การทำความสะอาดข้อมูลด้วย PySpark
Mike Metzger
Data Engineering Consultant
Spark Clusters ประกอบด้วยกระบวนการ 2 ประเภท
พารามิเตอร์สำคัญ:
airport_df = spark.read.csv('airports-*.txt.gz')
การกำหนด schema ที่ชัดเจนช่วยเพิ่มประสิทธิภาพการนำเข้าข้อมูลได้อย่างมาก
split -l 10000 -d largefile chunk-
df_csv = spark.read.csv('singlelargefile.csv')
df_csv.write.parquet('data.parquet')
df = spark.read.parquet('data.parquet')
การทำความสะอาดข้อมูลด้วย PySpark