Набор процессов для перемещения, преобразования или анализа данных
Типичные этапы:
ETL: Extract — извлечение данных из источников,
Transform — преобразование в нужную схему,
Load — загрузка в целевое хранилище (например, хранилище данных)
ELT: Extract — извлечение данных из источников,
Load — загрузка в целевое хранилище (например, озеро данных),
Transform — преобразование в нужную схему по мере необходимости
Пайплайны данных в Kubernetes
Этапы пайплайна данных удобно сопоставляются с объектами Kubernetes:
Этапы Extract, Transform, Load: поды (Deployment или StatefulSet)
Извлечённые и преобразованные данные: постоянные тома (Persistent Volumes)
Kubernetes масштабирует Deployment и хранилище по мере необходимости, увеличивая пропускную способность
Инструменты с открытым кодом для пайплайнов данных
Существует множество инструментов с открытым исходным кодом, готовых к развёртыванию в Kubernetes
Примеры:
Extract: Apache NiFi, Apache Kafka с Kafka Connect
Transform: Apache Spark, Apache Kafka, PostgreSQL
Load: Apache Spark, Apache Kafka с KSQL, PostgreSQL