Пайплайны данных в Kubernetes

Введение в Kubernetes

Frank Heilmann

Platform Architect and Freelance Instructor

Что такое пайплайны данных?

  • Набор процессов для перемещения, преобразования или анализа данных
  • Типичные этапы:
    • ETL: Extract — извлечение данных из источников, Transform — преобразование в нужную схему, Load — загрузка в целевое хранилище (например, хранилище данных)
    • ELT: Extract — извлечение данных из источников, Load — загрузка в целевое хранилище (например, озеро данных), Transform — преобразование в нужную схему по мере необходимости

Пайплайны данных

Введение в Kubernetes

Пайплайны данных в Kubernetes

  • Этапы пайплайна данных удобно сопоставляются с объектами Kubernetes:
    • Этапы Extract, Transform, Load: поды (Deployment или StatefulSet)
    • Извлечённые и преобразованные данные: постоянные тома (Persistent Volumes)
  • Kubernetes масштабирует Deployment и хранилище по мере необходимости, увеличивая пропускную способность

Пайплайны данных в Kubernetes

Введение в Kubernetes

Инструменты с открытым кодом для пайплайнов данных

  • Существует множество инструментов с открытым исходным кодом, готовых к развёртыванию в Kubernetes
  • Примеры:
    • Extract: Apache NiFi, Apache Kafka с Kafka Connect
    • Transform: Apache Spark, Apache Kafka, PostgreSQL
    • Load: Apache Spark, Apache Kafka с KSQL, PostgreSQL
    • Хранилище поверх PV: Minio, Ceph
  • Этот список не является исчерпывающим
Введение в Kubernetes

Давайте потренируемся!

Введение в Kubernetes

Preparing Video For Download...