Nettoyer des données avec PySpark
Mike Metzger
Data Engineering Consultant
La validation consiste à :
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)
Cela supprime automatiquement toute ligne dont la société n'est pas dans valid_df !
Utiliser les composants Spark pour valider la logique :
Nettoyer des données avec PySpark