데이터 파이프라인 소개

PySpark로 데이터 정제하기

Mike Metzger

Data Engineering Consultant

데이터 파이프라인이란?

  • 소스에서 최종 산출물까지 데이터를 처리하는 단계 집합
  • 단계/구성 요소 수는 제한 없음
  • 여러 시스템에 걸칠 수 있음
  • 여기서는 Spark 내 데이터 파이프라인에 집중합니다
PySpark로 데이터 정제하기

데이터 파이프라인의 구성

  • 입력
    • CSV, JSON, 웹 서비스, 데이터베이스
  • 변환
    • withColumn(), .filter(), .drop()
  • 출력
    • CSV, Parquet, 데이터베이스
  • 검증
  • 분석
PySpark로 데이터 정제하기

파이프라인 상세

  • Spark에 공식 정의는 없음
  • 보통 작업에 필요한 일반 Spark 코드로 구성
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
PySpark로 데이터 정제하기

연습해 봅시다!

PySpark로 데이터 정제하기

Preparing Video For Download...