Introduzione alle pipeline di dati

Pulizia dei dati con PySpark

Mike Metzger

Data Engineering Consultant

Cos'è una data pipeline?

  • Serie di passaggi per elaborare dati da fonte/i a output finale
  • Può avere qualsiasi numero di passaggi o componenti
  • Può coinvolgere molti sistemi
  • Ci concentriamo sulle pipeline in Spark
Pulizia dei dati con PySpark

Com'è una data pipeline?

  • Input
    • CSV, JSON, servizi web, database
  • Trasformazioni
    • withColumn(), .filter(), .drop()
  • Output
    • CSV, Parquet, database
  • Validazione
  • Analisi
Pulizia dei dati con PySpark

Dettagli della pipeline

  • Non è definita formalmente in Spark
  • In genere è il normale codice Spark richiesto per il task
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
Pulizia dei dati con PySpark

Ayo berlatih!

Pulizia dei dati con PySpark

Preparing Video For Download...