쿠버네티스의 데이터 파이프라인
Kubernetes 소개
Frank Heilmann
Platform Architect and Freelance Instructor
데이터 파이프라인이란?
데이터를 이동·변환·분석하는 프로세스 집합
일반적 단계:
ETL
: 다양한 소스에서
추출(Extract)
→ 의미 있는 스키마로
변환(Transform)
→ 대상 싱크(예: 데이터 웨어하우스)에
적재(Load)
ELT
: 다양한 소스에서
추출
→ 대상 싱크(예: 데이터 레이크)에
적재
→ 필요 시 의미 있는 스키마로
변환
쿠버네티스의 데이터 파이프라인
데이터 파이프라인 단계는 쿠버네티스 객체에 잘 매핑됩니다:
Extract/Transform/Load 단계: 파드(Deployment 또는 StatefulSet)
추출·변환된 데이터: 퍼시스턴트 볼륨(PV)
쿠버네티스는 필요 시 Deployment와 스토리지를 확장해 처리량을 높일 수 있습니다
데이터 파이프라인용 오픈 소스 도구
쿠버네티스에 바로 배포 가능한 오픈 소스가 많습니다
예시:
추출:
Apache NiFi
,
Apache Kafka
+
Kafka Connect
변환:
Apache Spark
,
Apache Kafka
,
PostgreSQL
적재:
Apache Spark
,
Apache Kafka
+
KSQL
,
PostgreSQL
PV 위 스토리지:
Minio
,
Ceph
위 목록은 전체가 아닙니다
연습해 봅시다!
Kubernetes 소개
Preparing Video For Download...