Convalida dei dati

Pulizia dei dati con PySpark

Mike Metzger

Data Engineering Consultant

Definizione

La convalida è:

  • Verificare che un dataset rispetti il formato atteso
  • Numero di righe/colonne
  • Tipi di dato
  • Regole di convalida complesse
Pulizia dei dati con PySpark

Convalida tramite join

  • Confronta i dati con valori noti
  • Facile trovare dati in un set dato
  • Relativamente veloce
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)

Questo rimuove automaticamente le righe con aziende non presenti in valid_df!

Pulizia dei dati con PySpark

Convalida con regole complesse

Usare i componenti Spark per validare la logica:

  • Calcoli
  • Verifica con una fonte esterna
  • Probabile uso di una UDF per modificare/verificare il DataFrame
Pulizia dei dati con PySpark

Let's practice!

Pulizia dei dati con PySpark

Preparing Video For Download...