เฟรมเวิร์กสำหรับการประมวลผลแบบขนาน

Data Engineering เบื้องต้น

Vincent Vankrunkelsven

Data Engineer @ DataCamp

 

โลโก้ Apache Hadoop

Data Engineering เบื้องต้น

HDFS

 

แผนภาพ HDFS ในฐานะระบบไฟล์แบบกระจาย

Data Engineering เบื้องต้น

MapReduce

 

โลโก้ Hadoop MapReduce

 

แผนภาพตัวอย่างกิจกรรมโอลิมปิก

Data Engineering เบื้องต้น

Hive

 

  • รันบน Hadoop
  • ภาษาคิวรี: Hive SQL
  • เดิมใช้ MapReduce ปัจจุบันรองรับเครื่องมืออื่นด้วย

โลโก้ Apache Hive

Data Engineering เบื้องต้น

Hive: ตัวอย่างการใช้งาน

 

SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year

 

แผนภาพ Hive สู่ MapReduce

Data Engineering เบื้องต้น

โลโก้ Spark

  • หลีกเลี่ยงการเขียนลงดิสก์
  • ดูแลโดย Apache Software Foundation
Data Engineering เบื้องต้น

Resilient distributed datasets (RDD)

 

  • Spark ทำงานบน RDD
  • คล้ายกับลิสต์ของ tuple
  • การแปลง: .map() หรือ .filter()
  • การดำเนินการ: .count() หรือ .first()
Data Engineering เบื้องต้น

PySpark

 

  • อินเทอร์เฟซ Python สำหรับ Spark
  • นามธรรมแบบ DataFrame
  • รูปแบบคล้าย Pandas
Data Engineering เบื้องต้น

PySpark: ตัวอย่างการใช้งาน

# Load the dataset into athlete_events_spark first

(athlete_events_spark
  .groupBy('Year')
  .mean('Age')
  .show())
SELECT year, AVG(age)
FROM views.athlete_events
GROUP BY year
Data Engineering เบื้องต้น

มาฝึกกันเถอะ!

Data Engineering เบื้องต้น

Preparing Video For Download...