Kubernetes 上的数据流水线
Kubernetes 入门
Frank Heilmann
Platform Architect and Freelance Instructor
什么是数据流水线?
一组用于移动、转换或分析数据的流程
典型步骤:
ETL
:从多种数据源
抽取
,再
转换
为有意义的模式,最后
加载
到目标数据存储(如数据仓库)
ELT
:从多种数据源
抽取
,先
加载
到目标数据存储(如数据湖),需要时再
转换
为有意义的模式
Kubernetes 上的数据流水线
数据流水线的步骤可很好映射到 Kubernetes 对象:
抽取、转换、加载:Pod(Deployment 或 StatefulSet)
已抽取与已转换的数据:持久卷(PV)
Kubernetes 可按需扩展 Deployment 与存储,从而提升吞吐量
数据流水线的开源工具
许多开源软件可直接在 Kubernetes 上部署
例如:
抽取:
Apache NiFi
、
Apache Kafka
搭配
Kafka Connect
转换:
Apache Spark
、
Apache Kafka
、
PostgreSQL
加载:
Apache Spark
、
Apache Kafka
搭配
KSQL
、
PostgreSQL
基于 PV 的存储:
Minio
、
Ceph
此清单并不完整
让我们来练习!
Kubernetes 入门
Preparing Video For Download...