並列計算フレームワーク

データエンジニアリング入門

Vincent Vankrunkelsven

Data Engineer @ DataCamp

 

Apache Hadoop のロゴ

データエンジニアリング入門

HDFS

 

分散ファイルシステムとしての HDFS の図

データエンジニアリング入門

MapReduce

 

Hadoop MapReduce のロゴ

 

オリンピック競技の例を示す図

データエンジニアリング入門

Hive

 

  • Hadoop 上で動作
  • 構造化クエリ言語: Hive SQL
  • 当初は MapReduce、現在は他ツールも対応

Apache Hive のロゴ

データエンジニアリング入門

Hive:例

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Hive から MapReduce への図

データエンジニアリング入門

Spark ロゴの画像

  • ディスク書き込みを回避
  • Apache Software Foundation により保守
データエンジニアリング入門

RDD(Resilient Distributed Dataset)

 

  • Spark はこれに依存
  • タプルのリストに類似
  • 変換: .map().filter()
  • アクション: .count().first()
データエンジニアリング入門

PySpark

 

  • Spark の Python インターフェース
  • DataFrame 抽象化
  • 見た目は Pandas に近い
データエンジニアリング入門

PySpark:例

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
データエンジニアリング入門

練習しましょう!

データエンジニアリング入門

Preparing Video For Download...