PySpark로 데이터 정제하기
Mike Metzger
Data Engineering Consultant
일반 ID 필드:
| id | last name | first name | state |
|---|---|---|---|
| 0 | Smith | John | TX |
| 1 | Wilson | A. | IL |
| 2 | Adams | Wendy | OR |
pyspark.sql.functions.monotonically_increasing_id()
| id | last name | first name | state |
|---|---|---|---|
| 0 | Smith | John | TX |
| 134520871 | Wilson | A. | IL |
| 675824594 | Adams | Wendy | OR |
Spark는 지연(lazy) 실행임을 기억하십시오!
PySpark로 데이터 정제하기