Làm sạch dữ liệu với PySpark
Mike Metzger
Data Engineering Consultant
Caching trong Spark:
Khi phát triển tác vụ Spark:
Gọi .cache() trên DataFrame trước Action
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
Dùng .is_cached để kiểm tra trạng thái cache
print(voter_df.is_cached)
True
Gọi .unpersist() khi dùng xong DataFrame
voter_df.unpersist()
Làm sạch dữ liệu với PySpark