쿠버네티스의 데이터 파이프라인

Kubernetes 소개

Frank Heilmann

Platform Architect and Freelance Instructor

데이터 파이프라인이란?

  • 데이터를 이동·변환·분석하는 프로세스 집합
  • 일반적 단계:
    • ETL: 다양한 소스에서 추출(Extract) → 의미 있는 스키마로 변환(Transform) → 대상 싱크(예: 데이터 웨어하우스)에 적재(Load)
    • ELT: 다양한 소스에서 추출 → 대상 싱크(예: 데이터 레이크)에 적재 → 필요 시 의미 있는 스키마로 변환

데이터 파이프라인

Kubernetes 소개

쿠버네티스의 데이터 파이프라인

  • 데이터 파이프라인 단계는 쿠버네티스 객체에 잘 매핑됩니다:
    • Extract/Transform/Load 단계: 파드(Deployment 또는 StatefulSet)
    • 추출·변환된 데이터: 퍼시스턴트 볼륨(PV)
  • 쿠버네티스는 필요 시 Deployment와 스토리지를 확장해 처리량을 높일 수 있습니다

쿠버네티스의 데이터 파이프라인

Kubernetes 소개

데이터 파이프라인용 오픈 소스 도구

  • 쿠버네티스에 바로 배포 가능한 오픈 소스가 많습니다
  • 예시:
    • 추출: Apache NiFi, Apache Kafka + Kafka Connect
    • 변환: Apache Spark, Apache Kafka, PostgreSQL
    • 적재: Apache Spark, Apache Kafka + KSQL, PostgreSQL
    • PV 위 스토리지: Minio, Ceph
  • 위 목록은 전체가 아닙니다
Kubernetes 소개

연습해 봅시다!

Kubernetes 소개

Preparing Video For Download...