PySpark でデータをクレンジングする
Mike Metzger
Data Engineering Consultant
Spark の「キャッシュ」:
Spark 開発時のポイント:
アクション前に DataFrame で .cache() を呼ぶ
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
.is_cached でキャッシュ状態を確認
print(voter_df.is_cached)
True
完了時は .unpersist() を呼ぶ
voter_df.unpersist()
PySpark でデータをクレンジングする