PySpark로 하는 Feature Engineering
John Hogue
Lead Data Scientist, General Mills
미지의 영역


특정 버전 (2.3.1)
버전을 확인하십시오!
# return spark version
spark.version
# return python version
import sys
sys.version_info
데이터는 Parquet 형식으로 제공됩니다

PySpark read 메서드
# JSON
spark.read.json('example.json')
# CSV or delimited files
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# Read a parquet file to a PySpark DataFrame
df = spark.read.parquet('example.parq')
PySpark로 하는 Feature Engineering