Ramverk för parallell beräkning

Introduktion till datatekniker

Vincent Vankrunkelsven

Data Engineer, DataCamp

 

Logo av Apache Hadoop

Introduktion till datatekniker

HDFS

 

Diagram över HDFS som distribuerat filsystem

Introduktion till datatekniker

MapReduce

 

Logo för Hadoop MapReduce

 

Diagram som illustrerar OS-exempel med olympiska grenar

Introduktion till datatekniker

Hive

 

  • Körs på Hadoop
  • Strukturerat frågespråk: Hive SQL
  • Ursprungligen MapReduce, nu även andra verktyg

Logo för Apache Hive

Introduktion till datatekniker

Hive: ett exempel

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Diagram över Hive till MapReduce

Introduktion till datatekniker

Bild på Spark-logotyp

  • Undviker diskskrivningar
  • Underhålls av Apache Software Foundation
Introduktion till datatekniker

Resilient distributed datasets (RDD)

 

  • Spark är beroende av dem
  • Liknar en lista av tupler
  • Transformationer: .map() eller .filter()
  • Åtgärder: .count() eller .first()
Introduktion till datatekniker

PySpark

 

  • Pythongränssnitt till Spark
  • DataFrame-abstraktion
  • Liknar Pandas
Introduktion till datatekniker

PySpark: ett exempel

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Introduktion till datatekniker

Nu kör vi en övning!

Introduktion till datatekniker

Preparing Video For Download...