データ検証のベストプラクティス
責任あるAIデータマネジメント
Maria Prokofieva
Lead ML engineer
学習内容
- サブグループ分析
- 欠損値
- 外れ値除去
- データ不整合の修正
- 特徴量スケーリング
- 特徴量エンコーディング
- 次元削減
欠損データ
- 大規模データで一般的
- データ削除
- 代入法やモデルベース手法
- 検証にはサブグループ分析

外れ値除去
- zスコア、IQR などの統計手法、またはロバストスケーリング
- セグメント間の公平性を検証

データ不整合
- データ品質はモデルの健全性・信頼性に影響
- データ標準化と検証ルール
- サブグループ正規化
特徴量スケーリング
- 入力特徴量を変換するスケーリング
- グループ間の分布で検証

特徴量エンコーディング
- エンコーディングが結果に与える影響を評価
- バイアスや情報損失を確認
- 過学習を確認
- 正則化と次元削減を活用
次元削減
- 入力特徴量を削減し、本質情報を保持
- バイアスが生じる可能性
- t-SNE など公正性配慮の手法を利用

ファイナンシャルアドバイザー
- 「年間収入」と「投資頻度」の特徴量
- 外れ値の調整とスケーリング
- サブグループ分析

Preparing Video For Download...