データ検証

PySpark でデータをクレンジングする

Mike Metzger

Data Engineering Consultant

定義

「検証」とは:

  • データセットが想定どおりの形式か確認すること
  • 行数・列数
  • データ型
  • 複雑な検証ルール
PySpark でデータをクレンジングする

結合による検証

  • 既知の値と照合
  • 指定集合内のデータを探しやすい
  • 比較的高速
parsed_df = spark.read.parquet('parsed_data.parquet')
company_df = spark.read.parquet('companies.parquet')
verified_df = parsed_df.join(company_df, parsed_df.company == company_df.company)

これにより、valid_df にない会社の行は自動的に除外されます!

PySpark でデータをクレンジングする

複雑なルール検証

Spark 機能でロジックを検証:

  • 計算
  • 外部ソースとの照合
  • UDF で DataFrame を変換・検証する場合が多い
PySpark でデータをクレンジングする

演習に進みましょう!

PySpark でデータをクレンジングする

Preparing Video For Download...