Bù khuyết với fancyimpute

Xử lý Dữ liệu Khuyết trong Python

Suraj Donthi

Deep Learning & Computer Vision Consultant

Gói fancyimpute

  • Gói cung cấp kỹ thuật nâng cao
  • Dùng thuật toán học máy để bù giá trị thiếu
  • Dùng các cột khác để dự đoán và điền giá trị thiếu
Xử lý Dữ liệu Khuyết trong Python

Các kỹ thuật bù của fancyimpute

  • KNN (K-Nearest Neighbors)
  • MICE (Multiple Imputation by Chained Equations)
Xử lý Dữ liệu Khuyết trong Python

Bù bằng K-Nearest Neighbors

  • Chọn K điểm gần/tương tự nhất dựa trên các đặc trưng không thiếu
  • Lấy trung bình các điểm đã chọn để điền đặc trưng bị thiếu

GIF K láng giềng gần nhất

Xử lý Dữ liệu Khuyết trong Python

Bù bằng K-Nearest Neighbors

from fancyimpute import KNN
diabetes_knn = diabetes.copy(deep=True)
knn_imputer = KNN()
diabetes_knn.iloc[:, :] = knn_imputer.fit_transform(diabetes_knn)
Xử lý Dữ liệu Khuyết trong Python

Multiple Imputations by Chained Equations (MICE)

  • Thực hiện nhiều mô hình hồi quy trên mẫu ngẫu nhiên của dữ liệu
  • Lấy trung bình các giá trị dự đoán từ nhiều hồi quy
  • Điền giá trị đặc trưng bị thiếu cho điểm dữ liệu
Xử lý Dữ liệu Khuyết trong Python

Multiple Imputations by Chained Equations (MICE)

from fancyimpute import IterativeImputer

diabetes_MICE = diabetes.copy(deep=True) MICE_imputer = IterativeImputer() diabetes_MICE.iloc[:, :] = MICE_imputer.fit_transform(diabetes_MICE)
Xử lý Dữ liệu Khuyết trong Python

Tóm tắt

  • Dùng kỹ thuật học máy để bù giá trị thiếu
  • KNN tìm các điểm giống nhất để bù
  • MICE thực hiện hồi quy nhiều lần để bù
  • MICE là mô hình bù khuyết rất vững
Xử lý Dữ liệu Khuyết trong Python

Ayo berlatih!

Xử lý Dữ liệu Khuyết trong Python

Preparing Video For Download...