Introducere în pipeline-uri de date

Curățarea datelor cu PySpark

Mike Metzger

Data Engineering Consultant

Ce este un pipeline de date?

  • Un set de pași pentru procesarea datelor de la sursă la ieșire
  • Poate conține oricâți pași sau componente
  • Poate acoperi mai multe sisteme
  • Ne vom concentra pe pipeline-uri de date în Spark
Curățarea datelor cu PySpark

Cum arată un pipeline de date?

  • Intrări
    • CSV, JSON, servicii web, baze de date
  • Transformări
    • withColumn(), .filter(), .drop()
  • Ieșiri
    • CSV, Parquet, bază de date
  • Validare
  • Analiză
Curățarea datelor cu PySpark

Detalii despre pipeline

  • Nu este definit formal în Spark
  • De obicei, întreg codul Spark necesar pentru sarcină
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
Curățarea datelor cu PySpark

Să exersăm!

Curățarea datelor cu PySpark

Preparing Video For Download...