Kubernetes でのデータパイプライン
Kubernetes入門
Frank Heilmann
Platform Architect and Freelance Instructor
データパイプラインとは
データを移動・変換・分析するプロセスの集合
代表的な手順:
ETL
: さまざまなデータソースから
抽出 (Extract)
し、 意味のあるスキーマへ
変換 (Transform)
し、 最後にターゲットのデータシンク(例: データウェアハウス)へ
格納 (Load)
ELT
: さまざまなデータソースから
抽出 (Extract)
し、 ターゲットのデータシンク(例: データレイク)へ
格納 (Load)
し、 必要時に意味のあるスキーマへ
変換 (Transform)
Kubernetes でのデータパイプライン
データパイプラインの各段階は Kubernetes オブジェクトに対応します:
Extract/Transform/Load の各段階: Pod(Deployment または StatefulSet)
抽出・変換後のデータ: PersistentVolume
Kubernetes は必要に応じて Deployment とストレージをスケールでき、スループットを向上
データパイプライン向け OSS ツール
Kubernetes で容易にデプロイ可能な OSS が多数あります
例:
抽出:
Apache NiFi
、
Apache Kafka
(
Kafka Connect
)
変換:
Apache Spark
、
Apache Kafka
、
PostgreSQL
格納:
Apache Spark
、
Apache Kafka
(
KSQL
)、
PostgreSQL
PV 上のストレージ:
MinIO
、
Ceph
これはあくまで一部の例です
演習に進みましょう!
Kubernetes入門
Preparing Video For Download...