DataFrame कॉलम ऑपरेशंस

PySpark के साथ डेटा क्लीनिंग

Mike Metzger

Data Engineering Consultant

DataFrame रिफ्रेशर

DataFrames:

  • रो और कॉलम से बने होते हैं
  • Immutable होते हैं
  • डेटा बदलने के लिए कई ट्रांसफॉर्मेशन ऑपरेशंस उपयोग करें
# वे रो लौटाएँ जहाँ name "M" से शुरू होता है 
voter_df.filter(voter_df.name.like('M%'))

# केवल name और position लौटाएँ voters = voter_df.select('name', 'position')
PySpark के साथ डेटा क्लीनिंग

आम DataFrame ट्रांसफॉर्मेशन

  • Filter / Where
    voter_df.filter(voter_df.date > '1/1/2019') # या voter_df.where(...)
    
  • Select
    voter_df.select(voter_df.name)
    
  • withColumn
    voter_df.withColumn('year', voter_df.date.year)
    
  • drop
    voter_df.drop('unused_column')
    
PySpark के साथ डेटा क्लीनिंग

डेटा को फ़िल्टर करना

  • null हटाएँ
  • गलत/असामान्य एंट्री हटाएँ
  • संयुक्त स्रोतों से डेटा अलग करें
  • ~ से नकारें
    voter_df.filter(voter_df['name'].isNotNull())
    voter_df.filter(voter_df.date.year > 1800)
    voter_df.where(voter_df['_c0'].contains('VOTE'))
    voter_df.where(~ voter_df._c1.isNull())
    
PySpark के साथ डेटा क्लीनिंग

कॉलम स्ट्रिंग ट्रांसफॉर्मेशन

  • pyspark.sql.functions में उपलब्ध
    import pyspark.sql.functions as F
    
  • कॉलम-स्तर पर ट्रांसफॉर्मेशन के रूप में लागू
    voter_df.withColumn('upper', F.upper('name'))
    
  • मध्यवर्ती कॉलम बना सकते हैं
    voter_df.withColumn('splits', F.split('name', ' '))
    
  • अन्य टाइप में cast कर सकते हैं
    voter_df.withColumn('year', voter_df['_c4'].cast(IntegerType()))
    
PySpark के साथ डेटा क्लीनिंग

ArrayType() कॉलम फंक्शन

ArrayType() के साथ काम करने के लिए विभिन्न यूटिलिटी फंक्शन/ट्रांसफॉर्मेशन

.size(<column>) - ArrayType() कॉलम की लंबाई लौटाता है

.getItem(<index>) - लिस्ट कॉलम में दिए गए index पर आइटम लाने के लिए उपयोग होता है।

PySpark के साथ डेटा क्लीनिंग

अभ्यास करते हैं!

PySpark के साथ डेटा क्लीनिंग

Preparing Video For Download...