Очистка данных с помощью PySpark
Mike Metzger
Data Engineering Consultant
Кэширование в Spark:
При разработке задач Spark:
Вызовите .cache() для DataFrame перед действием
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
Проверьте .is_cached, чтобы узнать статус кэша
print(voter_df.is_cached)
True
Вызовите .unpersist() по завершении работы с DataFrame
voter_df.unpersist()
Очистка данных с помощью PySpark