PySpark로 데이터 정제하기
Mike Metzger
Data Engineering Consultant
Spark 클러스터는 두 종류의 프로세스로 구성됩니다
중요한 매개변수:
airport_df = spark.read.csv('airports-*.txt.gz')
명확한 스키마는 가져오기 성능을 크게 향상시킵니다
split -l 10000 -d largefile chunk-
df_csv = spark.read.csv('singlelargefile.csv')
df_csv.write.parquet('data.parquet')
df = spark.read.parquet('data.parquet')
PySpark로 데이터 정제하기