Валідація даних

Очищення даних у PySpark

Mike Metzger

Data Engineering Consultant

Визначення

Валідація — це:

  • Перевірка, що набір даних відповідає очікуваному формату
  • Кількість рядків/стовпців
  • Типи даних
  • Складні правила перевірки
Очищення даних у PySpark

Перевірка через зʼєднання

  • Порівнює дані з відомими значеннями
  • Легко знайти дані в заданому наборі
  • Порівняно швидко
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)

Це автоматично прибирає всі рядки з компаніями, яких немає у valid_df!

Очищення даних у PySpark

Перевірка складних правил

Використання компонентів Spark для перевірки логіки:

  • Обчислення
  • Звірка з зовнішнім джерелом
  • Ймовірно, використовує UDF для зміни/перевірки DataFrame
Очищення даних у PySpark

Давайте потренуємось!

Очищення даних у PySpark

Preparing Video For Download...