Úvod do datových pipeline

Cleaning Data with PySpark

Mike Metzger

Data Engineering Consultant

Co je datová pipeline?

  • Sada kroků pro zpracování dat ze zdroje(ů) na výstup
  • Může obsahovat libovolný počet kroků nebo komponent
  • Může zahrnovat mnoho systémů
  • Zaměříme se na datové pipeline v rámci Sparku
Cleaning Data with PySpark

Jak vypadá datová pipeline?

  • Vstup(y)
    • CSV, JSON, webové služby, databáze
  • Transformace
    • withColumn(), .filter(), .drop()
  • Výstup(y)
    • CSV, Parquet, databáze
  • Validace
  • Analýza
Cleaning Data with PySpark

Detaily pipeline

  • Ve Sparku není formálně definována
  • Typicky veškerý běžný kód Sparku potřebný pro daný úkol
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
Cleaning Data with PySpark

Pojďme si to procvičit!

Cleaning Data with PySpark

Preparing Video For Download...