Cleaning Data with PySpark
Mike Metzger
Data Engineering Consultant
Ukládání do mezipaměti ve Sparku:
Při vývoji úloh ve Sparku:
Před akcí zavolejte .cache() na DataFrame
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
Stav mezipaměti zjistíte pomocí .is_cached
print(voter_df.is_cached)
True
Po dokončení práce s DataFramem zavolejte .unpersist()
voter_df.unpersist()
Cleaning Data with PySpark