Cadre de calcul paralel

Introducere în Data Engineering

Vincent Vankrunkelsven

Data Engineer @ DataCamp

 

Sigla Apache Hadoop

Introducere în Data Engineering

HDFS

 

Diagramă HDFS ca sistem de fișiere distribuit

Introducere în Data Engineering

MapReduce

 

Sigla Hadoop MapReduce

 

Diagramă exemplu evenimente olimpice

Introducere în Data Engineering

Hive

 

  • Rulează pe Hadoop
  • Limbaj de interogare structurat: Hive SQL
  • Inițial MapReduce, acum și alte instrumente

Sigla Apache Hive

Introducere în Data Engineering

Hive: exemplu

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Diagramă Hive la MapReduce

Introducere în Data Engineering

Sigla Spark

  • Evită scrierile pe disc
  • Întreținut de Apache Software Foundation
Introducere în Data Engineering

Seturi de date distribuite reziliente (RDD)

 

  • Spark se bazează pe ele
  • Similar cu o listă de tupluri
  • Transformări: .map() sau .filter()
  • Acțiuni: .count() sau .first()
Introducere în Data Engineering

PySpark

 

  • Interfață Python pentru Spark
  • Abstractizare DataFrame
  • Asemănător cu Pandas
Introducere în Data Engineering

PySpark: exemplu

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Introducere în Data Engineering

Să exersăm!

Introducere în Data Engineering

Preparing Video For Download...