Potoki danych na Kubernetes

Wprowadzenie do Kubernetes

Frank Heilmann

Platform Architect and Freelance Instructor

Czym są potoki danych?

  • Zestaw procesów do przenoszenia, transformacji lub analizy danych
  • Typowe kroki:
    • ETL: Wyodrębnienie danych z różnych źródeł, następnie Transformacja do odpowiedniego schematu, na końcu Załadowanie do docelowego miejsca (np. hurtowni danych)
    • ELT: Wyodrębnienie danych z różnych źródeł, następnie Załadowanie do docelowego miejsca (np. data lake), na końcu Transformacja danych do odpowiedniego schematu

Potoki danych

Wprowadzenie do Kubernetes

Potoki danych na Kubernetes

  • Kroki potoku danych dobrze odwzorowują się na obiekty Kubernetes:
    • Kroki Extract, Transform, Load: Pody (Deployment lub StatefulSet)
    • Wyodrębnione i przetworzone dane: Persistent Volumes
  • Kubernetes może skalować Deploymenty i zasoby Storage według potrzeb, zwiększając przepustowość

Potoki danych na Kubernetes

Wprowadzenie do Kubernetes

Narzędzia open-source dla potoków danych

  • Wiele narzędzi open-source można łatwo wdrożyć na Kubernetes
  • Przykłady:
    • Extract: Apache NiFi, Apache Kafka z Kafka Connect
    • Transform: Apache Spark, Apache Kafka, PostgreSQL
    • Load: Apache Spark, Apache Kafka z KSQL, PostgreSQL
    • Przechowywanie na PV: Minio, Ceph
  • Lista ta nie jest wyczerpująca
Wprowadzenie do Kubernetes

Czas na ćwiczenia!

Wprowadzenie do Kubernetes

Preparing Video For Download...