Immutability और Lazy Processing

PySpark के साथ डेटा क्लीनिंग

Mike Metzger

Data Engineering Consultant

Variable पुनरावलोकन

Python वैरिएबल्स:

  • Mutable
  • Flexibility
  • Concurrency में समस्याओं की संभावना
  • जटिलता बढ़ने की आशंका
PySpark के साथ डेटा क्लीनिंग

Immutability

Immutable वैरिएबल्स:

  • Functional programming का घटक
  • एक बार परिभाषित
  • सीधे बदले नहीं जा सकते
  • पुनः असाइन होने पर नए सिरे से बनते हैं
  • कुशलता से साझा किए जा सकते हैं
PySpark के साथ डेटा क्लीनिंग

Immutability उदाहरण

नया data frame परिभाषित करें:

voter_df = spark.read.csv('voterdata.csv')

परिवर्तन करें:

voter_df = voter_df.withColumn('fullyear', 
    voter_df.year + 2000)

voter_df = voter_df.drop(voter_df.year)
PySpark के साथ डेटा क्लीनिंग

Lazy Processing

  • क्या यह धीमा नहीं होगा?
  • Transformations
  • Actions
  • कुशल योजना संभव होती है
voter_df = voter_df.withColumn('fullyear', 
    voter_df.year + 2000)
voter_df = voter_df.drop(voter_df.year)

voter_df.count()
PySpark के साथ डेटा क्लीनिंग

अभ्यास करते हैं!

PySpark के साथ डेटा क्लीनिंग

Preparing Video For Download...