使用 PySpark 进行数据清洗
Mike Metzger
Data Engineering Consultant
Spark 集群由两类进程组成
关键参数:
airport_df = spark.read.csv('airports-*.txt.gz')
明确定义的 schema 可显著提升导入性能
split -l 10000 -d largefile chunk-
df_csv = spark.read.csv('singlelargefile.csv')
df_csv.write.parquet('data.parquet')
df = spark.read.parquet('data.parquet')
使用 PySpark 进行数据清洗