Parallel computation frameworks

Introduction to Data Engineering

Vincent Vankrunkelsven

Data Engineer @ DataCamp

 

Apache Hadoop का लोगो

Introduction to Data Engineering

HDFS

 

डिस्ट्रिब्यूटेड फाइल सिस्टम के रूप में HDFS का डायग्राम

Introduction to Data Engineering

MapReduce

 

Hadoop MapReduce का लोगो

 

ओलंपिक इवेंट्स उदाहरण दर्शाता डायग्राम

Introduction to Data Engineering

Hive

 

  • Hadoop पर चलता है
  • Structured Query Language: Hive SQL
  • शुरू में MapReduce, अब अन्य टूल भी

Apache Hive का लोगो

Introduction to Data Engineering

Hive: एक उदाहरण

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

Hive से MapReduce का डायग्राम

Introduction to Data Engineering

Spark लोगो की छवि

  • डिस्क पर लिखने से बचता है
  • Apache Software Foundation द्वारा मेंटेन किया जाता है
Introduction to Data Engineering

Resilient distributed datasets (RDD)

 

  • Spark इन्हीं पर निर्भर करता है
  • ट्यूपल्स की लिस्ट जैसा
  • Transformations: .map() या .filter()
  • Actions: .count() या .first()
Introduction to Data Engineering

PySpark

 

  • Spark के लिए Python इंटरफेस
  • DataFrame एब्स्ट्रैक्शन
  • Pandas जैसा दिखता है
Introduction to Data Engineering

PySpark: एक उदाहरण

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Introduction to Data Engineering

अभ्यास करते हैं!

Introduction to Data Engineering

Preparing Video For Download...