Canalisation de données sur Kubernetes

Introduction à Kubernetes

Frank Heilmann

Platform Architect and Freelance Instructor

Qu'est-ce qu'une canalisation de données ?

  • Série de processus pour déplacer, transformer ou analyser des données
  • Étapes typiques :
    • ETL : Extraire des données de diverses sources, puis Transformer vers un schéma pertinent, enfin Charger dans une cible (p. ex., un entrepôt de données)
    • ELT : Extraire des données de diverses sources, puis Charger dans une cible (p. ex., un lac de données), enfin Transformer au besoin vers un schéma pertinent

Canalisations de données

Introduction à Kubernetes

Canalisation de données sur Kubernetes

  • Les étapes d'une canalisation de données se lient bien aux objets Kubernetes :
    • Étapes Extraire, Transformer, Charger : Pods (Deployment ou StatefulSet)
    • Données extraites et transformées : volumes persistants
  • Kubernetes peut faire évoluer les Deployments et le stockage au besoin, donc accroître le débit

Canalisations de données sur Kubernetes

Introduction à Kubernetes

Outils libres pour les canalisations de données

  • De nombreux logiciels libres sont prêts à être déployés sur Kubernetes
  • Quelques exemples :
    • Extraction : Apache NiFi, Apache Kafka avec Kafka Connect
    • Transformation : Apache Spark, Apache Kafka, PostgreSQL
    • Chargement : Apache Spark, Apache Kafka avec KSQL, PostgreSQL
    • Stockage sur PV : Minio, Ceph
  • Cette liste est loin d'être exhaustive
Introduction à Kubernetes

Passons à la pratique !

Introduction à Kubernetes

Preparing Video For Download...