PySpark के साथ डेटा क्लीनिंग
Mike Metzger
Data Engineering Consultant
DataFrames:
# वे रो लौटाएँ जहाँ name "M" से शुरू होता है voter_df.filter(voter_df.name.like('M%'))# केवल name और position लौटाएँ voters = voter_df.select('name', 'position')
voter_df.filter(voter_df.date > '1/1/2019') # या voter_df.where(...)
voter_df.select(voter_df.name)
voter_df.withColumn('year', voter_df.date.year)
voter_df.drop('unused_column')
~ से नकारेंvoter_df.filter(voter_df['name'].isNotNull())
voter_df.filter(voter_df.date.year > 1800)
voter_df.where(voter_df['_c0'].contains('VOTE'))
voter_df.where(~ voter_df._c1.isNull())
import pyspark.sql.functions as F
voter_df.withColumn('upper', F.upper('name'))
voter_df.withColumn('splits', F.split('name', ' '))
voter_df.withColumn('year', voter_df['_c4'].cast(IntegerType()))
ArrayType() के साथ काम करने के लिए विभिन्न यूटिलिटी फंक्शन/ट्रांसफॉर्मेशन
.size(<column>) - ArrayType() कॉलम की लंबाई लौटाता है
.getItem(<index>) - लिस्ट कॉलम में दिए गए index पर आइटम लाने के लिए उपयोग होता है।
PySpark के साथ डेटा क्लीनिंग