Podsumowanie

Obsługa brakujących danych z imputacją w R

Michal Oleszak

Machine Learning Engineer

Studium przypadku: wolności obywatelskie w Afryce

head(africa)
  year      country gdp_pc  infl trade    civlib population
1 1972 Burkina Faso    377 -2.92 29.69 0.5000000    5848380
2 1973 Burkina Faso    376  7.60 31.31 0.5000000    5958700
3 1974 Burkina Faso    393  8.72 35.22 0.3333333    6075700
4 1975 Burkina Faso    416 18.76 40.11 0.3333333    6202000
5 1976 Burkina Faso    435 -8.40 37.76 0.5000000    6341030
6 1977 Burkina Faso    448 29.99 41.11 0.6666667    6486870
1 Data source: https://scholar.harvard.edu/rbates/data
Obsługa brakujących danych z imputacją w R

Modelowanie niekompletnych danych

Cel: zbadanie zależności między wolnościami obywatelskimi, civlib, a PKB per capita, gdp_pc.

  1. Wizualizacja niekompletnych danych.
    • Które zmienne mają braki?
    • Jakie mogą być mechanizmy braków danych?
  2. Imputacja braków i ocena jej jakości.
  3. Dopasowanie modelu do danych po imputacji z uwzględnieniem niepewności.
Obsługa brakujących danych z imputacją w R

Potrzebne funkcje

  • aggr()
  • spineMiss()
  • mice() - with() - pool()
Obsługa brakujących danych z imputacją w R

Ocena jakości imputacji w MICE

  • mice() tworzy wiele imputowanych zbiorów danych.
  • Wizualizacja każdego z nich za pomocą funkcji VIM może być uciążliwa.
  • Pakiet mice oferuje własne wykresy automatycznie obsługujące wiele zbiorów.
nhanes_multiimp <- mice(nhanes, m = 5, defaultMethod = "pmm")
stripplot(nhanes_multiimp, 
          Weight ~ Height | .imp,
          pch = 20, cex = 2)
Obsługa brakujących danych z imputacją w R

Wykres paskowy

Siatka sześciu wykresów rozrzutu Wzrost vs Waga. Na każdym wykresie zaznaczono imputowane wartości kolorem. Są one zbliżone do obserwowanych, niemal nieodróżnialne.

Obsługa brakujących danych z imputacją w R

Czas zastosować zdobytą wiedzę w praktyce!

Obsługa brakujących danych z imputacją w R

Preparing Video For Download...