并行计算框架

Data Engineering 入门

Vincent Vankrunkelsven

Data Engineer @ DataCamp

 

Apache Hadoop 标志

Data Engineering 入门

HDFS

 

HDFS 分布式文件系统示意图

Data Engineering 入门

MapReduce

 

Hadoop MapReduce 标志

 

奥运项目示例的分布式示意图

Data Engineering 入门

Hive

 

  • 运行于 Hadoop
  • 结构化查询语言:Hive SQL
  • 最初基于 MapReduce,现支持其他工具

Apache Hive 标志

Data Engineering 入门

Hive:示例

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Hive 到 MapReduce 的示意图

Data Engineering 入门

Spark 标志

  • 避免磁盘写入
  • 由 Apache 软件基金会维护
Data Engineering 入门

弹性分布式数据集(RDD)

 

  • Spark 依赖它们
  • 类似于元组列表
  • 转换:.map().filter()
  • 动作:.count().first()
Data Engineering 入门

PySpark

 

  • Spark 的 Python 接口
  • DataFrame 抽象
  • 外观类似 Pandas
Data Engineering 入门

PySpark:示例

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Data Engineering 入门

让我们来练习!

Data Engineering 入门

Preparing Video For Download...