從哪裡開始

使用 PySpark 進行特徵工程

John Hogue

Lead Data Scientist, General Mills

直接下水做分析

前方有怪獸

  • 成為自己的專家
  • 先定義分析目標
  • 先研究你的資料
  • 保持好奇,多發問

怪獸

使用 PySpark 進行特徵工程

資料科學流程

資料科學流程

使用 PySpark 進行特徵工程

Spark 更新又快又頻繁

使用 PySpark 進行特徵工程

資料格式:Parquet

資料以 Parquet 提供

  • 欄式儲存
    • 查詢部分欄位很快
  • 結構化,具定義的綱要
    • 已定義欄位與資料型別
    • 很適合凌亂的文字資料
  • 產業廣泛採用
    • 很值得學的技能!😃

Parquet 檔案格式

使用 PySpark 進行特徵工程

把資料讀進 Spark

PySpark read 方法

  • PySpark 支援多種檔案型別!
# JSON
spark.read.json('example.json')
# CSV 或分隔檔
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# 將 parquet 檔讀入為 PySpark DataFrame
df = spark.read.parquet('example.parq')
使用 PySpark 進行特徵工程

一起來練習吧!

使用 PySpark 進行特徵工程

Preparing Video For Download...