PySpark के साथ डेटा क्लीनिंग
Mike Metzger
Data Engineering Consultant
वैलिडेशन का मतलब:
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)
यह अपने आप उन सभी रो को हटा देता है जिनकी company valid_df में नहीं है!
लॉजिक वैलिडेट करने के लिए Spark कम्पोनेंट्स का उपयोग:
PySpark के साथ डेटा क्लीनिंग