使用 PySpark 进行数据清洗
Mike Metzger
Data Engineering Consultant
"验证"是:
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)
这会"自动"移除公司不在 valid_df 中的行!
使用 Spark 组件验证逻辑:
使用 PySpark 进行数据清洗