PySpark로 데이터 정제하기
Mike Metzger
Data Engineering Consultant
Spark의 _캐싱_:
Spark 작업 개발 시:
액션 전에 DataFrame에 .cache()를 호출하십시오
voter_df = spark.read.csv('voter_data.txt.gz')
voter_df.cache().count()
voter_df = voter_df.withColumn('ID', monotonically_increasing_id())
voter_df = voter_df.cache()
voter_df.show()
.is_cached로 캐시 상태를 확인하십시오
print(voter_df.is_cached)
True
DataFrame 사용을 마치면 .unpersist()를 호출하십시오
voter_df.unpersist()
PySpark로 데이터 정제하기