การทำความสะอาดข้อมูลด้วย PySpark
Mike Metzger
Data Engineering Consultant
การตรวจสอบความถูกต้อง คือ:
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)
การดำเนินการนี้จะลบแถวที่มีบริษัทไม่อยู่ใน valid_df ออกโดยอัตโนมัติ!
ใช้คอมโพเนนต์ของ Spark เพื่อตรวจสอบตรรกะ:
การทำความสะอาดข้อมูลด้วย PySpark