Kubernetes 上的数据流水线

Kubernetes 入门

Frank Heilmann

Platform Architect and Freelance Instructor

什么是数据流水线?

  • 一组用于移动、转换或分析数据的流程
  • 典型步骤:
    • ETL:从多种数据源抽取,再转换为有意义的模式,最后加载到目标数据存储(如数据仓库)
    • ELT:从多种数据源抽取,先加载到目标数据存储(如数据湖),需要时再转换为有意义的模式

数据流水线

Kubernetes 入门

Kubernetes 上的数据流水线

  • 数据流水线的步骤可很好映射到 Kubernetes 对象:
    • 抽取、转换、加载:Pod(Deployment 或 StatefulSet)
    • 已抽取与已转换的数据:持久卷(PV)
  • Kubernetes 可按需扩展 Deployment 与存储,从而提升吞吐量

Kubernetes 上的数据流水线

Kubernetes 入门

数据流水线的开源工具

  • 许多开源软件可直接在 Kubernetes 上部署
  • 例如:
    • 抽取:Apache NiFiApache Kafka 搭配 Kafka Connect
    • 转换:Apache SparkApache KafkaPostgreSQL
    • 加载:Apache SparkApache Kafka 搭配 KSQLPostgreSQL
    • 基于 PV 的存储:MinioCeph
  • 此清单并不完整
Kubernetes 入门

让我们来练习!

Kubernetes 入门

Preparing Video For Download...