Giới thiệu về Pipeline Dữ liệu

Làm sạch dữ liệu với PySpark

Mike Metzger

Data Engineering Consultant

Data pipeline là gì?

  • Tập các bước xử lý dữ liệu từ nguồn đến đầu ra cuối
  • Có thể gồm bất kỳ số bước/thành phần nào
  • Có thể trải rộng nhiều hệ thống
  • Ta sẽ tập trung vào pipeline dữ liệu trong Spark
Làm sạch dữ liệu với PySpark

Data pipeline trông như thế nào?

  • Đầu vào
    • CSV, JSON, web service, cơ sở dữ liệu
  • Biến đổi
    • withColumn(), .filter(), .drop()
  • Đầu ra
    • CSV, Parquet, cơ sở dữ liệu
  • Kiểm định
  • Phân tích
Làm sạch dữ liệu với PySpark

Chi tiết pipeline

  • Không được định nghĩa chính thức trong Spark
  • Thường là toàn bộ mã Spark cần cho nhiệm vụ
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
Làm sạch dữ liệu với PySpark

Luyện tập nhé!

Làm sạch dữ liệu với PySpark

Preparing Video For Download...