Набір процесів для переміщення, перетворення або аналізу даних
Типові етапи:
ETL: Extract — отримати дані з різних джерел,
далі Transform — перетворити до змістовної схеми,
зрештою Load — завантажити в цільове сховище (напр., у data warehouse)
ELT: Extract — отримати дані з різних джерел,
далі Load — завантажити в цільове сховище (напр., у data lake),
зрештою Transform — перетворити до змістовної схеми за потреби
Конвеєри даних у Kubernetes
Кроки конвеєра даних добре відповідають об'єктам Kubernetes:
Extract, Transform, Load: Pod-и (Deployment або StatefulSet)
Витягнуті та перетворені дані: Persistent Volumes
Kubernetes може масштабувати Deployment-и та сховище за потреби, підвищуючи пропускну здатність
Відкриті інструменти для конвеєрів даних
Є багато відкритих інструментів, які легко розгорнути в Kubernetes
Приклади:
Extract: Apache NiFi, Apache Kafka з Kafka Connect
Transform: Apache Spark, Apache Kafka, PostgreSQL
Load: Apache Spark, Apache Kafka з KSQL, PostgreSQL