इम्पोर्ट परफॉर्मेंस सुधारें

PySpark के साथ डेटा क्लीनिंग

Mike Metzger

Data Engineering Consultant

Spark क्लस्टर्स

Spark Clusters दो प्रकार की प्रक्रियाओं से बने होते हैं

  • ड्राइवर प्रक्रिया
  • वर्कर प्रक्रियाएँ
PySpark के साथ डेटा क्लीनिंग

इम्पोर्ट परफॉर्मेंस

महत्वपूर्ण पैरामीटर्स:

  • ऑब्जेक्ट्स की संख्या (Files, Network locations, आदि)
    • अधिक, छोटे ऑब्जेक्ट्स बड़े वालों से बेहतर
    • वाइल्डकार्ड से इम्पोर्ट कर सकते हैं
      airport_df = spark.read.csv('airports-*.txt.gz')
      
  • ऑब्जेक्ट्स का सामान्य आकार
    • समान आकार के ऑब्जेक्ट्स पर Spark बेहतर चलता है
PySpark के साथ डेटा क्लीनिंग

स्कीमाज़

अच्छी तरह परिभाषित स्कीमा इम्पोर्ट परफॉर्मेंस को बहुत बढ़ाता है

  • डेटा को बार-बार पढ़ने से बचाता है
  • इम्पोर्ट पर वेलिडेशन देता है
PySpark के साथ डेटा क्लीनिंग

ऑब्जेक्ट्स को कैसे स्प्लिट करें

  • OS युटिलिटीज़/स्क्रिप्ट्स का उपयोग करें (split, cut, awk)
    split -l 10000 -d largefile chunk-
    
  • कस्टम स्क्रिप्ट्स का उपयोग करें
  • Parquet में लिखें
    df_csv = spark.read.csv('singlelargefile.csv')
    df_csv.write.parquet('data.parquet')
    df = spark.read.parquet('data.parquet')
    
PySpark के साथ डेटा क्लीनिंग

अभ्यास करते हैं!

PySpark के साथ डेटा क्लीनिंग

Preparing Video For Download...