Frameworki obliczeń równoległych

Wprowadzenie do inżynierii danych

Vincent Vankrunkelsven

Data Engineer @ DataCamp

 

Logo Apache Hadoop

Wprowadzenie do inżynierii danych

HDFS

 

Diagram HDFS jako rozproszony system plików

Wprowadzenie do inżynierii danych

MapReduce

 

Logo Hadoop MapReduce

 

Diagram ilustrujący przykład olimpijski

Wprowadzenie do inżynierii danych

Hive

 

  • Działa na Hadoop
  • Język zapytań: Hive SQL
  • Początkowo MapReduce, teraz inne narzędzia

Logo Apache Hive

Wprowadzenie do inżynierii danych

Hive: przykład

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Diagram Hive do MapReduce

Wprowadzenie do inżynierii danych

Logo Spark

  • Unika zapisów na dysk
  • Utrzymywany przez Apache Software Foundation
Wprowadzenie do inżynierii danych

Odporne rozproszone zbiory danych (RDD)

 

  • Spark opiera się na nich
  • Podobne do listy krotek
  • Transformacje: .map() lub .filter()
  • Akcje: .count() lub .first()
Wprowadzenie do inżynierii danych

PySpark

 

  • Interfejs Pythona do Spark
  • Abstrakcja DataFrame
  • Podobny do Pandas
Wprowadzenie do inżynierii danych

PySpark: przykład

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Wprowadzenie do inżynierii danych

Czas na ćwiczenia!

Wprowadzenie do inżynierii danych

Preparing Video For Download...