Datarensning med PySpark
Mike Metzger
Data Engineering Consultant
Caching i Spark:
Vid utveckling av Spark-uppgifter:
Anropa .cache() på DataFrame innan en åtgärd
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
Kontrollera .is_cached för att se cachestatus
print(voter_df.is_cached)
True
Anropa .unpersist() när du är klar med DataFrame
voter_df.unpersist()
Datarensning med PySpark