Validation des données

Nettoyer des données avec PySpark

Mike Metzger

Data Engineering Consultant

Définition

La validation consiste à :

  • Vérifier qu'un ensemble de données respecte le format attendu
  • Nombre de lignes/colonnes
  • Types de données
  • Règles de validation complexes
Nettoyer des données avec PySpark

Validation par jointures

  • Compare les données à des valeurs connues
  • Facile pour repérer des données dans un ensemble donné
  • Relativement rapide
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)

Cela supprime automatiquement toute ligne dont la société n'est pas dans valid_df !

Nettoyer des données avec PySpark

Validation de règles complexes

Utiliser les composants Spark pour valider la logique :

  • Calculs
  • Vérification avec une source externe
  • Utilise souvent une UDF pour modifier/vérifier le DataFrame
Nettoyer des données avec PySpark

Passons à la pratique !

Nettoyer des données avec PySpark

Preparing Video For Download...