Очищення даних у PySpark
Mike Metzger
Data Engineering Consultant
Кешування у Spark:
Під час розробки завдань Spark:
Викличте .cache() для DataFrame перед дією (Action)
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
Перевіряйте .is_cached, щоб дізнатися стан кешу
print(voter_df.is_cached)
True
Викличте .unpersist() після завершення роботи з DataFrame
voter_df.unpersist()
Очищення даних у PySpark