Nettoyer des données avec PySpark
Mike Metzger
Data Engineering Consultant
La « mise en cache » dans Spark :
Lors du développement de tâches Spark :
Appelez .cache() sur le DataFrame avant l'action
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
Vérifiez .is_cached pour connaître l'état du cache
print(voter_df.is_cached)
True
Appelez .unpersist() quand vous avez terminé avec le DataFrame
voter_df.unpersist()
Nettoyer des données avec PySpark