資料驗證最佳做法

負責任的 AI 資料管理

Maria Prokofieva

Lead ML engineer

本章重點

  • 次群體分析
  • 遺漏值
  • 移除離群值
  • 更正資料不一致
  • 特徵縮放
  • 特徵編碼
  • 降維
負責任的 AI 資料管理

次群體分析

步驟 1:依受保護特徵分成次群體

步驟 2:評估各次群體的統計分佈與模型表現

步驟 3:評估各次群體的模型公平性指標

步驟 4:採取緩解策略

負責任的 AI 資料管理

遺漏資料

  • 大型資料集中常見
  • 刪除資料
  • 推補策略與模型式方法
  • 用次群體分析進行驗證

missing data

負責任的 AI 資料管理

移除離群值

  • 使用 z 分數、IQR 或穩健縮放等統計方法
  • 驗證各資料分段是否受到公平對待

outlier removal

負責任的 AI 資料管理

資料不一致

  • 資料品質影響模型的完整性與可靠性
  • 資料標準化與驗證規則
  • 次群體正規化
負責任的 AI 資料管理

特徵縮放

  • 以特徵縮放轉換輸入特徵
  • 檢查群體間分佈來驗證

feature scaling

負責任的 AI 資料管理

特徵編碼

  • 評估編碼對結果的影響
  • 檢查偏誤與資訊流失
  • 檢查是否過擬合
  • 採用正則化與降維
負責任的 AI 資料管理

降維

  • 減少輸入特徵並保留關鍵資訊
  • 可能引入偏誤
  • 使用重視公平性的技術,如 t-SNE

dimensionality reduction

負責任的 AI 資料管理

理財顧問

  • 「Annual income」與「Investment frequency」特徵
  • 調整離群值並進行縮放
  • 次群體分析

outlier removal

負責任的 AI 資料管理

一起來練習吧!

負責任的 AI 資料管理

Preparing Video For Download...