Ramverk för parallell beräkning

Introduktion till datatekniker

Vincent Vankrunkelsven

Data Engineer @ DataCamp

 

Logo av Apache Hadoop

Introduktion till datatekniker

HDFS

 

Diagram över HDFS som distribuerat filsystem

Introduktion till datatekniker

MapReduce

 

Logo för Hadoop MapReduce

 

Diagram som illustrerar OS-exempel med olympiska grenar

Introduktion till datatekniker

Hive

 

  • Körs på Hadoop
  • Strukturerat frågespråk: Hive SQL
  • Ursprungligen MapReduce, nu även andra verktyg

Logo för Apache Hive

Introduktion till datatekniker

Hive: ett exempel

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Diagram över Hive till MapReduce

Introduktion till datatekniker

Bild på Spark-logotyp

  • Undviker diskskrivningar
  • Underhålls av Apache Software Foundation
Introduktion till datatekniker

Resilient distributed datasets (RDD)

 

  • Spark är beroende av dem
  • Liknar en lista av tupler
  • Transformationer: .map() eller .filter()
  • Åtgärder: .count() eller .first()
Introduktion till datatekniker

PySpark

 

  • Pythongränssnitt till Spark
  • DataFrame-abstraktion
  • Liknar Pandas
Introduktion till datatekniker

PySpark: ett exempel

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Introduktion till datatekniker

Nu kör vi en övning!

Introduktion till datatekniker

Preparing Video For Download...