Czyszczenie danych w PySpark
Mike Metzger
Data Engineering Consultant
Buforowanie w Spark:
Podczas tworzenia zadań Spark:
Wywołaj .cache() na DataFrame przed akcją
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
Sprawdź .is_cached, aby określić stan bufora
print(voter_df.is_cached)
True
Wywołaj .unpersist() po zakończeniu pracy z DataFrame
voter_df.unpersist()
Czyszczenie danych w PySpark