Làm sạch dữ liệu với PySpark
Mike Metzger
Data Engineering Consultant
Xác thực là:
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)
Điều này tự động loại bỏ mọi hàng có company không nằm trong valid_df!
Dùng các thành phần Spark để kiểm tra logic:
Làm sạch dữ liệu với PySpark