บทนำสู่ Data Pipelines

การทำความสะอาดข้อมูลด้วย PySpark

Mike Metzger

Data Engineering Consultant

Data pipeline คืออะไร?

  • ชุดขั้นตอนสำหรับประมวลผลข้อมูลจากแหล่งที่มาไปยังผลลัพธ์ขั้นสุดท้าย
  • ประกอบด้วยขั้นตอนหรือส่วนประกอบได้หลายส่วน
  • ครอบคลุมระบบได้หลายระบบ
  • จะเน้นที่ data pipelines ภายใน Spark
การทำความสะอาดข้อมูลด้วย PySpark

Data pipeline มีหน้าตาอย่างไร?

  • อินพุต
    • CSV, JSON, เว็บเซอร์วิส, ฐานข้อมูล
  • การแปลงข้อมูล
    • withColumn(), .filter(), .drop()
  • เอาต์พุต
    • CSV, Parquet, ฐานข้อมูล
  • การตรวจสอบ
  • การวิเคราะห์
การทำความสะอาดข้อมูลด้วย PySpark

รายละเอียดของ Pipeline

  • ไม่มีนิยามอย่างเป็นทางการใน Spark
  • โดยทั่วไปคือโค้ด Spark ปกติที่ใช้ทำงานนั้น ๆ
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
การทำความสะอาดข้อมูลด้วย PySpark

มาฝึกกันเถอะ!

การทำความสะอาดข้อมูลด้วย PySpark

Preparing Video For Download...