Frameworky pro paralelní výpočty

Introduction to Data Engineering

Vincent Vankrunkelsven

Data Engineer, DataCamp

 

Logo Apache Hadoop

Introduction to Data Engineering

HDFS

 

Diagram HDFS jako distribuovaný souborový systém

Introduction to Data Engineering

MapReduce

 

Logo Hadoop MapReduce

 

Diagram s příkladem olympijských událostí

Introduction to Data Engineering

Hive

 

  • Běží na Hadoopu
  • Strukturovaný dotazovací jazyk: Hive SQL
  • Původně MapReduce, nyní i jiné nástroje

Logo Apache Hive

Introduction to Data Engineering

Hive: příklad

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Diagram Hive a MapReduce

Introduction to Data Engineering

Logo Spark

  • Zabraňuje zápisům na disk
  • Spravováno nadací Apache Software Foundation
Introduction to Data Engineering

Odolné distribuované datové sady (RDD)

 

  • Spark na nich závisí
  • Podobné seznamu n-tic
  • Transformace: .map() nebo .filter()
  • Akce: .count() nebo .first()
Introduction to Data Engineering

PySpark

 

  • Pythonové rozhraní pro Spark
  • Abstrakce DataFrame
  • Podobné Pandas
Introduction to Data Engineering

PySpark: příklad

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Introduction to Data Engineering

Lass uns üben!

Introduction to Data Engineering

Preparing Video For Download...