平行計算框架

Data Engineering 入門

Vincent Vankrunkelsven

Data Engineer, DataCamp

 

Apache hadoop 標誌

Data Engineering 入門

HDFS

 

HDFS 分散式檔案系統示意圖

Data Engineering 入門

MapReduce

 

Hadoop MapReduce 標誌

 

奧運項目分散處理示意圖

Data Engineering 入門

Hive

 

  • 執行於 Hadoop 上
  • 結構化查詢語言:Hive SQL
  • 最初用 MapReduce,現也支援其他工具

Apache Hive 標誌

Data Engineering 入門

Hive:範例

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Hive 到 MapReduce 的流程圖

Data Engineering 入門

Spark 標誌

  • 避免磁碟寫入
  • 由 Apache 軟體基金會維護
Data Engineering 入門

彈性分散式資料集(RDD)

 

  • Spark 仰賴它們
  • 類似 tuple 清單
  • 轉換:.map().filter()
  • 動作:.count().first()
Data Engineering 入門

PySpark

 

  • Spark 的 Python 介面
  • DataFrame 抽象
  • 外觀類似 Pandas
Data Engineering 入門

PySpark:範例

# 先將資料集載入到 athlete_events_spark

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Data Engineering 入門

一起來練習吧!

Data Engineering 入門

Preparing Video For Download...