Introduction aux pipelines de données

Nettoyer des données avec PySpark

Mike Metzger

Data Engineering Consultant

Qu'est-ce qu'un pipeline de données ?

  • Suite d'étapes pour traiter des données de la source au résultat final
  • Peut comporter n'importe quel nombre d'étapes ou de composants
  • Peut couvrir de nombreux systèmes
  • Nous nous concentrerons sur les pipelines de données dans Spark
Nettoyer des données avec PySpark

À quoi ressemble un pipeline de données ?

  • Entrée(s)
    • CSV, JSON, services Web, bases de données
  • Transformations
    • withColumn(), .filter(), .drop()
  • Sortie(s)
    • CSV, Parquet, base de données
  • Validation
  • Analyse
Nettoyer des données avec PySpark

Détails du pipeline

  • Pas défini formellement dans Spark
  • En général, tout le code Spark normal requis pour la tâche
    schema = StructType([
    StructField('name', StringType(), False),
    StructField('age', StringType(), False)
    ])
    df = spark.read.format('csv').load('datafile').schema(schema)
    df = df.withColumn('id', monotonically_increasing_id())
    ...
    df.write.parquet('outdata.parquet')
    df.write.json('outdata.json')
    
Nettoyer des données avec PySpark

Passons à la pratique !

Nettoyer des données avec PySpark

Preparing Video For Download...