पार्टिशनिंग और लेज़ी प्रोसेसिंग

PySpark के साथ डेटा क्लीनिंग

Mike Metzger

Data Engineering Consultant

पार्टिशनिंग

  • DataFrames पार्टिशन में बाँटे जाते हैं
  • पार्टिशन का आकार बदल सकता है
  • हर पार्टिशन अलग से प्रोसेस होता है
PySpark के साथ डेटा क्लीनिंग

लेज़ी प्रोसेसिंग

  • ट्रांसफॉर्मेशन लेज़ी होते हैं
    • .withColumn(...)
    • .select(...)
  • कोई काम तब तक नहीं होता जब तक कोई एक्शन न चलाएँ
    • .count()
    • .write(...)
  • बेहतर परफॉर्मेंस के लिए ट्रांसफॉर्मेशन का क्रम बदला जा सकता है
  • कभी-कभी अप्रत्याशित व्यवहार हो सकता है
PySpark के साथ डेटा क्लीनिंग

IDs जोड़ना

सामान्य ID फ़ील्ड:

  • रिलेशनल डेटाबेस में आम
  • प्रायः इंटेजर, बढ़ते, क्रमिक और यूनिक
  • बहुत कम पैरेलल
id last name first name state
0 Smith John TX
1 Wilson A. IL
2 Adams Wendy OR
PySpark के साथ डेटा क्लीनिंग

Monotonically increasing IDs

pyspark.sql.functions.monotonically_increasing_id()

  • इंटेजर (64-बिट), मान बढ़ता है, यूनिक
  • जरूरी नहीं कि क्रमिक हो (गैप हो सकते हैं)
  • पूरी तरह पैरेलल
id last name first name state
0 Smith John TX
134520871 Wilson A. IL
675824594 Adams Wendy OR
PySpark के साथ डेटा क्लीनिंग

नोट्स

याद रखें, Spark लेज़ी है!

  • कभी-कभी क्रम बिगड़ सकता है
  • अगर जॉइन करेंगे, तो ID जॉइन के बाद असाइन हो सकती है
  • अपने ट्रांसफॉर्मेशन टेस्ट करें
PySpark के साथ डेटा क्लीनिंग

अभ्यास करते हैं!

PySpark के साथ डेटा क्लीनिंग

Preparing Video For Download...