Tổng hợp lại

Xử lý dữ liệu khuyết bằng Imputation trong R

Michal Oleszak

Machine Learning Engineer

Nghiên cứu tình huống: tự do dân sự ở châu Phi

head(africa)
  year      country gdp_pc  infl trade    civlib population
1 1972 Burkina Faso    377 -2.92 29.69 0.5000000    5848380
2 1973 Burkina Faso    376  7.60 31.31 0.5000000    5958700
3 1974 Burkina Faso    393  8.72 35.22 0.3333333    6075700
4 1975 Burkina Faso    416 18.76 40.11 0.3333333    6202000
5 1976 Burkina Faso    435 -8.40 37.76 0.5000000    6341030
6 1977 Burkina Faso    448 29.99 41.11 0.6666667    6486870
1 Nguồn dữ liệu: https://scholar.harvard.edu/rbates/data
Xử lý dữ liệu khuyết bằng Imputation trong R

Mô hình hóa dữ liệu thiếu

Mục tiêu: khảo sát mối quan hệ giữa chỉ số tự do dân sự, civlib, và GDP bình quân đầu người, gdp_pc.

  1. Trực quan hóa dữ liệu thiếu.
    • Biến nào bị thiếu?
    • Cơ chế thiếu dữ liệu có thể là gì?
  2. Bù dữ liệu thiếu và kiểm tra chất lượng bù.
  3. Chạy mô hình trên dữ liệu đã bù, tính đến bất định do bù.
Xử lý dữ liệu khuyết bằng Imputation trong R

Bạn sẽ cần

  • aggr()
  • spineMiss()
  • mice() - with() - pool()
Xử lý dữ liệu khuyết bằng Imputation trong R

Đánh giá chất lượng bù với MICE

  • mice() tạo nhiều bộ dữ liệu đã bù.
  • Trực quan hóa từng bộ bằng hàm của VIM có thể rườm rà.
  • Gói mice có đồ thị riêng xử lý tự động nhiều bộ dữ liệu.
nhanes_multiimp <- mice(nhanes, m = 5, defaultMethod = "pmm")
stripplot(nhanes_multiimp, 
          Weight ~ Height | .imp,
          pch = 20, cex = 2)
Xử lý dữ liệu khuyết bằng Imputation trong R

Strip plot

Lưới 6 biểu đồ tán xạ Chiều cao vs Cân nặng. Mỗi biểu đồ tô màu các giá trị bù. Các giá trị bù gần với giá trị quan sát, khó phân biệt nếu không nhờ màu.

Xử lý dữ liệu khuyết bằng Imputation trong R

Áp dụng những gì bạn đã học!

Xử lý dữ liệu khuyết bằng Imputation trong R

Preparing Video For Download...