Curățarea datelor cu PySpark
Mike Metzger
Data Engineering Consultant
Caching-ul în Spark:
La dezvoltarea task-urilor Spark:
Apelați .cache() pe DataFrame înainte de Acțiune
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
Verificați .is_cached pentru a determina starea cache-ului
print(voter_df.is_cached)
True
Apelați .unpersist() când ați terminat cu DataFrame-ul
voter_df.unpersist()
Curățarea datelor cu PySpark