불변성과 지연 처리

PySpark로 데이터 정제하기

Mike Metzger

Data Engineering Consultant

변수 복습

Python 변수:

  • 가변적임
  • 유연성 제공
  • 동시성 문제 가능성
  • 복잡성 증가 가능
PySpark로 데이터 정제하기

불변성

불변 변수는 다음과 같습니다:

  • 함수형 프로그래밍의 구성요소
  • 한 번 정의됨
  • 직접 수정 불가
  • 재할당 시 새로 생성
  • 효율적으로 공유 가능
PySpark로 데이터 정제하기

불변성 예제

새 데이터 프레임 정의:

voter_df = spark.read.csv('voterdata.csv')

변경 적용:

voter_df = voter_df.withColumn('fullyear', 
    voter_df.year + 2000)

voter_df = voter_df.drop(voter_df.year)
PySpark로 데이터 정제하기

지연 처리

  • 느리지 않을까요?
  • 변환(Transformations)
  • 액션(Actions)
  • 효율적 실행 계획 수립 가능
voter_df = voter_df.withColumn('fullyear', 
    voter_df.year + 2000)
voter_df = voter_df.drop(voter_df.year)

voter_df.count()
PySpark로 데이터 정제하기

연습해 봅시다!

PySpark로 데이터 정제하기

Preparing Video For Download...