Walidacja danych

Czyszczenie danych w PySpark

Mike Metzger

Data Engineering Consultant

Definicja

Walidacja to:

  • Weryfikacja zgodności danych z oczekiwanym formatem
  • Liczba wierszy / kolumn
  • Typy danych
  • Złożone reguły walidacji
Czyszczenie danych w PySpark

Walidacja za pomocą złączeń

  • Porównuje dane ze znanymi wartościami
  • Łatwe wyszukiwanie danych w zbiorze
  • Stosunkowo szybkie
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)

To automatycznie usuwa wiersze z firmą nieobecną w valid_df!

Czyszczenie danych w PySpark

Walidacja złożonych reguł

Walidacja logiki przy użyciu komponentów Spark:

  • Obliczenia
  • Weryfikacja względem zewnętrznego źródła
  • Zazwyczaj wykorzystuje UDF do modyfikacji / weryfikacji DataFrame
Czyszczenie danych w PySpark

Czas na ćwiczenia!

Czyszczenie danych w PySpark

Preparing Video For Download...