使用 PySpark 清理資料
Mike Metzger
Data Engineering Consultant
「Spark 叢集」由兩種行程組成
重要參數:
airport_df = spark.read.csv('airports-*.txt.gz')
良好定義的 schema 可大幅提升匯入效能
split -l 10000 -d largefile chunk-
df_csv = spark.read.csv('singlelargefile.csv')
df_csv.write.parquet('data.parquet')
df = spark.read.parquet('data.parquet')
使用 PySpark 清理資料