使用 PySpark 的 Big Data 基礎
Upendra Devisetty
Science Analyst, CyVerse
Volume、Variety、Velocity
Volume:資料規模
Variety:來源與格式多樣性
Velocity:資料產生與處理速度
Clustered computing:多部機器的資源集合
Parallel computing:單一電腦同時計算
Distributed computing:並行運作的節點(網路電腦)集合
Batch processing:將作業拆成小塊,在各機器上執行
Real-time processing:即時處理資料
Hadoop/MapReduce: 以 Java 撰寫的可擴充、具容錯性的架構
開源
批次處理
Apache Spark: 通用且極速的叢集運算系統
開源
同時支援批次與即時處理
注意: 現今多以 Apache Spark 取代 Hadoop/MapReduce
分散式叢集運算框架
對大型資料集進行高效的記憶體內計算
極速的資料處理框架
支援 Java、Scala、Python、R 與 SQL

Local 模式: 單一機器,例如你的筆電
Cluster 模式: 一組預先配置的機器
工作流程:Local -> Cluster
不需更動程式碼
使用 PySpark 的 Big Data 基礎