เฟรมเวิร์กสำหรับการประมวลผลแบบขนาน

Data Engineering เบื้องต้น

Vincent Vankrunkelsven

Data Engineer, DataCamp

 

โลโก้ Apache Hadoop

Data Engineering เบื้องต้น

HDFS

 

แผนภาพ HDFS ในฐานะระบบไฟล์แบบกระจาย

Data Engineering เบื้องต้น

MapReduce

 

โลโก้ Hadoop MapReduce

 

แผนภาพตัวอย่างกิจกรรมโอลิมปิก

Data Engineering เบื้องต้น

Hive

 

  • รันบน Hadoop
  • ภาษาคิวรี: Hive SQL
  • เดิมใช้ MapReduce ปัจจุบันรองรับเครื่องมืออื่นด้วย

โลโก้ Apache Hive

Data Engineering เบื้องต้น

Hive: ตัวอย่างการใช้งาน

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

แผนภาพ Hive สู่ MapReduce

Data Engineering เบื้องต้น

โลโก้ Spark

  • หลีกเลี่ยงการเขียนลงดิสก์
  • ดูแลโดย Apache Software Foundation
Data Engineering เบื้องต้น

Resilient distributed datasets (RDD)

 

  • Spark ทำงานบน RDD
  • คล้ายกับลิสต์ของ tuple
  • การแปลง: .map() หรือ .filter()
  • การดำเนินการ: .count() หรือ .first()
Data Engineering เบื้องต้น

PySpark

 

  • อินเทอร์เฟซ Python สำหรับ Spark
  • นามธรรมแบบ DataFrame
  • รูปแบบคล้าย Pandas
Data Engineering เบื้องต้น

PySpark: ตัวอย่างการใช้งาน

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Data Engineering เบื้องต้น

มาฝึกกันเถอะ!

Data Engineering เบื้องต้น

Preparing Video For Download...