การทำความสะอาดข้อมูลด้วย PySpark
Mike Metzger
Data Engineering Consultant
ตัวแปรใน Python:
ตัวแปรแบบ immutable:
สร้าง data frame ใหม่:
voter_df = spark.read.csv('voterdata.csv')
การเปลี่ยนแปลงข้อมูล:
voter_df = voter_df.withColumn('fullyear', voter_df.year + 2000)voter_df = voter_df.drop(voter_df.year)
voter_df = voter_df.withColumn('fullyear',
voter_df.year + 2000)
voter_df = voter_df.drop(voter_df.year)
voter_df.count()
การทำความสะอาดข้อมูลด้วย PySpark