PySpark के साथ डेटा क्लीनिंग
Mike Metzger
Data Engineering Consultant
Spark में Caching:
जब Spark टास्क विकसित करें:
Action से पहले DataFrame पर .cache() कॉल करें
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
कैश स्थिति जाँचने के लिए .is_cached देखें
print(voter_df.is_cached)
True
DataFrame का काम पूरा होने पर .unpersist() कॉल करें
voter_df.unpersist()
PySpark के साथ डेटा क्लीनिंग