시작하기

PySpark로 하는 Feature Engineering

John Hogue

Lead Data Scientist, General Mills

바로 분석에 뛰어들기

미지의 영역

  • 스스로 전문가가 되십시오
  • 분석 목표를 정의하십시오
  • 데이터를 조사하십시오
  • 호기심을 갖고 질문하십시오

몬스터

PySpark로 하는 Feature Engineering

데이터 사이언스 프로세스

데이터 사이언스 프로세스

PySpark로 하는 Feature Engineering

Spark는 빠르고 자주 변경됩니다

PySpark로 하는 Feature Engineering

데이터 형식: Parquet

데이터는 Parquet 형식으로 제공됩니다

  • 열 단위로 저장
    • 열 서브셋 쿼리 속도 빠름
  • 구조화된 스키마 정의
    • 필드 및 데이터 타입 정의
    • 비정형 텍스트 데이터에 적합
  • 업계 표준
    • 유용한 스킬입니다! 😃

Parquet 파일 형식

PySpark로 하는 Feature Engineering

Spark로 데이터 가져오기

PySpark read 메서드

  • PySpark는 다양한 파일 형식을 지원합니다!
# JSON
spark.read.json('example.json')
# CSV or delimited files
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Read a parquet file to a PySpark DataFrame
df = spark.read.parquet('example.parq')
PySpark로 하는 Feature Engineering

연습해 봅시다!

PySpark로 하는 Feature Engineering

Preparing Video For Download...