Pulizia dei dati con PySpark
Mike Metzger
Data Engineering Consultant
Il caching in Spark:
Quando sviluppi task Spark:
Chiama .cache() sul DataFrame prima dell’azione
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
Controlla .is_cached per lo stato della cache
print(voter_df.is_cached)
True
Chiama .unpersist() quando hai finito col DataFrame
voter_df.unpersist()
Pulizia dei dati con PySpark