Frameworky pro paralelní výpočty

Introduction to Data Engineering

Vincent Vankrunkelsven

Data Engineer @ DataCamp

 

Logo Apache Hadoop

Introduction to Data Engineering

HDFS

 

Diagram HDFS jako distribuovaný souborový systém

Introduction to Data Engineering

MapReduce

 

Logo Hadoop MapReduce

 

Diagram s příkladem olympijských událostí

Introduction to Data Engineering

Hive

 

  • Běží na Hadoopu
  • Strukturovaný dotazovací jazyk: Hive SQL
  • Původně MapReduce, nyní i jiné nástroje

Logo Apache Hive

Introduction to Data Engineering

Hive: příklad

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Diagram Hive a MapReduce

Introduction to Data Engineering

Logo Spark

  • Zabraňuje zápisům na disk
  • Spravováno nadací Apache Software Foundation
Introduction to Data Engineering

Odolné distribuované datové sady (RDD)

 

  • Spark na nich závisí
  • Podobné seznamu n-tic
  • Transformace: .map() nebo .filter()
  • Akce: .count() nebo .first()
Introduction to Data Engineering

PySpark

 

  • Pythonové rozhraní pro Spark
  • Abstrakce DataFrame
  • Podobné Pandas
Introduction to Data Engineering

PySpark: příklad

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Introduction to Data Engineering

Lass uns üben!

Introduction to Data Engineering

Preparing Video For Download...