PySpark로 데이터 정제하기
Mike Metzger
Data Engineering Consultant
Python 변수:
불변 변수는 다음과 같습니다:
새 데이터 프레임 정의:
voter_df = spark.read.csv('voterdata.csv')
변경 적용:
voter_df = voter_df.withColumn('fullyear', voter_df.year + 2000)voter_df = voter_df.drop(voter_df.year)
voter_df = voter_df.withColumn('fullyear',
voter_df.year + 2000)
voter_df = voter_df.drop(voter_df.year)
voter_df.count()
PySpark로 데이터 정제하기