แนะนำการทำความสะอาดข้อมูลด้วย Apache Spark

การทำความสะอาดข้อมูลด้วย PySpark

Mike Metzger

Data Engineering Consultant

การทำความสะอาดข้อมูลคืออะไร?

การทำความสะอาดข้อมูล: การเตรียมข้อมูลดิบให้พร้อมใช้งานใน data processing pipeline

งานที่พบในการทำความสะอาดข้อมูล:

  • การจัดรูปแบบหรือแทนที่ข้อความ
  • การคำนวณ
  • การลบข้อมูลที่ไม่สมบูรณ์หรือไม่ถูกต้อง
การทำความสะอาดข้อมูลด้วย PySpark

ทำไมต้องทำความสะอาดข้อมูลด้วย Spark?

ปัญหาของระบบข้อมูลทั่วไป:

  • ประสิทธิภาพ
  • การจัดการกระบวนการข้อมูล

ข้อดีของ Spark:

  • รองรับการขยายขนาด
  • เฟรมเวิร์กที่ทรงพลังสำหรับการจัดการข้อมูล
การทำความสะอาดข้อมูลด้วย PySpark

ตัวอย่างการทำความสะอาดข้อมูล

ข้อมูลดิบ:

name age (years) city
Smith, John 37 Dallas
Wilson, A. 59 Chicago
null 215

ข้อมูลที่ผ่านการทำความสะอาดแล้ว:

last name first name age (months) state
Smith John 444 TX
Wilson A. 708 IL
การทำความสะอาดข้อมูลด้วย PySpark

Spark Schemas

  • กำหนดรูปแบบของ DataFrame
  • รองรับชนิดข้อมูลหลายประเภท:
    • String, วันที่, จำนวนเต็ม, array
  • กรองข้อมูลที่ไม่ถูกต้องระหว่างนำเข้า
  • ช่วยเพิ่มประสิทธิภาพการอ่านข้อมูล
การทำความสะอาดข้อมูลด้วย PySpark

ตัวอย่าง Spark Schema

นำเข้า schema

import pyspark.sql.types
peopleSchema = StructType([
  # Define the name field
  StructField('name', StringType(), True),
  # Add the age field
  StructField('age', IntegerType(), True),
  # Add the city field
  StructField('city', StringType(), True)  
])

อ่านไฟล์ CSV ที่มีข้อมูล

people_df = spark.read.format('csv').load(name='rawdata.csv', schema=peopleSchema)
การทำความสะอาดข้อมูลด้วย PySpark

มาฝึกกันเถอะ!

การทำความสะอาดข้อมูลด้วย PySpark

Preparing Video For Download...