Datavalidering

Datarensning med PySpark

Mike Metzger

Data Engineering Consultant

Definition

Validering innebär att:

  • Kontrollera att en datamängd följer förväntat format
  • Antal rader / kolumner
  • Datatyper
  • Komplexa valideringsregler
Datarensning med PySpark

Validering via joins

  • Jämför data mot kända värden
  • Enkelt att hitta data i en given mängd
  • Relativt snabbt
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)

Detta tar automatiskt bort alla rader med ett företag som inte finns i valid_df!

Datarensning med PySpark

Validering av komplexa regler

Använd Spark-komponenter för att validera logik:

  • Beräkningar
  • Verifiering mot extern källa
  • Använder troligen en UDF för att ändra / verifiera DataFrame
Datarensning med PySpark

Nu kör vi en övning!

Datarensning med PySpark

Preparing Video For Download...