डेटा वैलिडेशन

PySpark के साथ डेटा क्लीनिंग

Mike Metzger

Data Engineering Consultant

परिभाषा

वैलिडेशन का मतलब:

  • जाँचना कि डेटासेट अपेक्षित फ़ॉर्मैट का पालन करता है
  • रो/कॉलम की संख्या
  • डेटा टाइप्स
  • जटिल वैलिडेशन नियम
PySpark के साथ डेटा क्लीनिंग

Joins के जरिए वैलिडेशन

  • ज्ञात मानों से डेटा की तुलना करता है
  • दिए गए सेट में डेटा खोजना आसान
  • अपेक्षाकृत तेज
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)

यह अपने आप उन सभी रो को हटा देता है जिनकी company valid_df में नहीं है!

PySpark के साथ डेटा क्लीनिंग

जटिल नियम वैलिडेशन

लॉजिक वैलिडेट करने के लिए Spark कम्पोनेंट्स का उपयोग:

  • कैलकुलेशंस
  • बाहरी सोर्स से मिलान
  • अक्सर DataFrame को बदलने/जाँचने के लिए UDF उपयोग होता है
PySpark के साथ डेटा क्लीनिंग

अभ्यास करते हैं!

PySpark के साथ डेटा क्लीनिंग

Preparing Video For Download...