使用 PySpark 進行特徵工程
John Hogue
Lead Data Scientist, General Mills
前方有怪獸


指定版本(2.3.1)
檢查你的版本!
# return spark version
spark.version
# return python version
import sys
sys.version_info
資料以 Parquet 提供

PySpark read 方法
# JSON
spark.read.json('example.json')
# CSV 或分隔檔
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# 將 parquet 檔讀入為 PySpark DataFrame
df = spark.read.parquet('example.parq')
使用 PySpark 進行特徵工程