叢集規模調校祕訣

使用 PySpark 清理資料

Mike Metzger

Data Engineering Consultant

組態選項

  • Spark 有許多組態設定
  • 可依需求調整
  • 讀取組態設定:
    spark.conf.get(<configuration name>)
    
  • 寫入組態設定
    spark.conf.set(<configuration name>)
    
使用 PySpark 清理資料

叢集類型

Spark 部署選項:

  • 單一節點
  • Standalone
  • 受管
    • YARN
    • Mesos
    • Kubernetes
使用 PySpark 清理資料

Driver

  • 任務指派
  • 結果彙整
  • 共用資料存取

提示:

  • Driver 節點記憶體應為 worker 的 2 倍
  • 快速本機儲存很有幫助
使用 PySpark 清理資料

Worker

  • 執行實際任務
  • 最好具備該任務所需的所有程式碼、資料與資源

建議:

  • worker 節點數量通常比加大單一 worker 更好
  • 透過測試找到平衡點
  • 極快的本機儲存非常有用
使用 PySpark 清理資料

一起來練習吧!

使用 PySpark 清理資料

Preparing Video For Download...