클러스터 사이징 팁

PySpark로 데이터 정제하기

Mike Metzger

Data Engineering Consultant

구성 옵션

  • Spark에는 많은 구성 설정이 있습니다
  • 필요에 맞게 수정할 수 있습니다
  • 구성 설정 읽기:
    spark.conf.get(<configuration name>)
    
  • 구성 설정 쓰기
    spark.conf.set(<configuration name>)
    
PySpark로 데이터 정제하기

클러스터 유형

Spark 배포 옵션:

  • 단일 노드
  • 스탠드얼론
  • 매니지드
    • YARN
    • Mesos
    • Kubernetes
PySpark로 데이터 정제하기

드라이버

  • 작업 할당
  • 결과 통합
  • 공유 데이터 액세스

팁:

  • 드라이버 노드는 워커의 2배 메모리를 권장
  • 빠른 로컬 스토리지가 유용
PySpark로 데이터 정제하기

워커

  • 실제 작업을 실행
  • 해당 작업의 코드, 데이터, 리소스를 이상적으로 모두 보유

권장 사항:

  • 큰 워커보다 워커 수를 늘리는 것이 대체로 유리
  • 테스트로 최적 균형을 찾기
  • 빠른 로컬 스토리지가 매우 유용
PySpark로 데이터 정제하기

연습해 봅시다!

PySpark로 데이터 정제하기

Preparing Video For Download...