Introduction au nettoyage de données avec Apache Spark

Nettoyer des données avec PySpark

Mike Metzger

Data Engineering Consultant

Qu'est-ce que le nettoyage de données ?

Nettoyage de données : préparer des données brutes pour les chaînes de traitement.

Tâches possibles en nettoyage de données :

  • Reformater ou remplacer du texte
  • Effectuer des calculs
  • Retirer les données bruitées ou incomplètes
Nettoyer des données avec PySpark

Pourquoi nettoyer des données avec Spark ?

Problèmes des systèmes de données typiques :

  • Performance
  • Organisation des flux de données

Avantages de Spark :

  • Évolutif
  • Cadre puissant pour traiter les données
Nettoyer des données avec PySpark

Exemple de nettoyage de données

Données brutes :

name age (years) city
Smith, John 37 Dallas
Wilson, A. 59 Chicago
null 215

Données nettoyées :

last name first name age (months) state
Smith John 444 TX
Wilson A. 708 IL
Nettoyer des données avec PySpark

Schémas Spark

  • Définit le format d'un DataFrame
  • Peut contenir divers types de données :
    • Chaînes, dates, entiers, tableaux
  • Peut filtrer les données indésirables à l'importation
  • Améliore la performance de lecture
Nettoyer des données avec PySpark

Exemple de schéma Spark

Importer le schéma

import pyspark.sql.types
peopleSchema = StructType([
  # Define the name field
  StructField('name', StringType(), True),
  # Add the age field
  StructField('age', IntegerType(), True),
  # Add the city field
  StructField('city', StringType(), True)  
])

Lire le fichier CSV contenant les données

people_df = spark.read.format('csv').load(name='rawdata.csv', schema=peopleSchema)
Nettoyer des données avec PySpark

Passons à la pratique !

Nettoyer des données avec PySpark

Preparing Video For Download...