Wizualizacja wzorców brakujących danych

Obsługa brakujących danych z imputacją w R

Michal Oleszak

Machine Learning Engineer

Problemy z podejściem testowym

  • Wykrywanie wzorców brakujących danych za pomocą testów statystycznych bywa uciążliwe.
  • Test t wiąże się z wieloma założeniami dotyczącymi danych.
  • Wnioskowanie na podstawie p-wartości jest podatne na błędy (dobór poziomu istotności, p-hacking).
Obsługa brakujących danych z imputacją w R

Wizualizacja brakujących danych

  • Alternatywne podejście: wizualizacje!
  • Łatwe w użyciu.
  • Umożliwiają wykrywanie wzorców brakujących danych.
  • Dostarczają informacji o innych aspektach jakości danych.

Pakiet VIM oferuje zestaw narzędzi do wizualizacji brakujących danych. W tej lekcji:

  • Wykres agregacji
  • Wykres kręgosłupowy
  • Wykres mozaikowy
Obsługa brakujących danych z imputacją w R

Wykres agregacji

nhanes %>% aggr(combined = TRUE, numbers = TRUE)

Wykres agregacji w postaci siatki przedstawiającej wszystkie kombinacje brakujących i zaobserwowanych wartości dla poszczególnych zmiennych zbioru danych. Dla każdej kombinacji pokazano odsetek obserwacji o danym wzorcu braków.

Obsługa brakujących danych z imputacją w R

Wykres kręgosłupowy

nhanes %>% select(Gender, TotChol) %>% spineMiss()

Wykres kręgosłupowy składający się z dwóch słupków odpowiadających mężczyznom i kobietom. Wewnątrz każdego słupka pokazano odsetek brakujących wartości zmiennej całkowitego cholesterolu dla danej płci.

Obsługa brakujących danych z imputacją w R

Wykres mozaikowy

nhanes %>% mosaicMiss(highlight = "TotChol", plotvars = c("Gender", "PhysActive"))

Wykres mozaikowy złożony z kafelków tworzących prostokąt. Każdy kafelek odpowiada jednej wartości zmiennej "Gender" i jednej wartości zmiennej "PhysActive". Wewnątrz każdego kafelka pokazano odsetek brakujących wartości zmiennej całkowitego cholesterolu.

Obsługa brakujących danych z imputacją w R

Czas na wykresy!

Obsługa brakujących danych z imputacją w R

Preparing Video For Download...