PySpark でデータをクレンジングする
Mike Metzger
Data Engineering Consultant
「検証」とは:
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)
これにより、valid_df にない会社の行は自動的に除外されます!
Spark 機能でロジックを検証:
PySpark でデータをクレンジングする