Datové pipelines na Kubernetes

Úvod do Kubernetes

Frank Heilmann

Platform Architect and Freelance Instructor

Co jsou datové pipelines?

  • Sada procesů pro přesun, transformaci nebo analýzu dat
  • Typické kroky:
    • ETL: Extrakce dat z různých zdrojů, poté Transformace do smysluplného schématu, nakonec Načtení do cílového úložiště (např. datového skladu)
    • ELT: Extrakce dat z různých zdrojů, poté Načtení do cílového úložiště (např. datového jezera), nakonec Transformace dat do smysluplného schématu dle potřeby

Datové pipelines

Úvod do Kubernetes

Datové pipelines na Kubernetes

  • Kroky datové pipeline odpovídají objektům Kubernetes:
    • Kroky Extrakce, Transformace, Načtení: Pody (Deployment nebo StatefulSet)
    • Extrahovaná a transformovaná data: Persistentní svazky
  • Kubernetes dokáže škálovat Deploymenty i úložiště dle potřeby, a tím zvýšit propustnost

Datové pipelines na Kubernetes

Úvod do Kubernetes

Open-source nástroje pro datové pipelines

  • Existuje mnoho open-source nástrojů připravených k nasazení na Kubernetes
  • Příklady:
    • Extrakce: Apache NiFi, Apache Kafka s Kafka Connect
    • Transformace: Apache Spark, Apache Kafka, PostgreSQL
    • Načtení: Apache Spark, Apache Kafka s KSQL, PostgreSQL
    • Úložiště nad PV: Minio, Ceph
  • Tento seznam není vyčerpávající
Úvod do Kubernetes

Pojďme si procvičit!

Úvod do Kubernetes

Preparing Video For Download...