Závislost chybějících dat

Práce s chybějícími daty v R

Nicholas Tierney

Statistician

Přehled

  • MCAR Zcela náhodně chybějící data

  • MAR Náhodně chybějící data

  • MNAR Nenáhodně chybějící data

Práce s chybějícími daty v R

MCAR: Co to je?

Chybějící hodnoty nemají žádnou souvislost s pozorovanými ani nepozorovanými daty.

test vacation
NA TRUE
11.533340 FALSE
10.126115 TRUE
NA FALSE
NA TRUE
8.551881 FALSE
NA FALSE
NA TRUE
10.608264 TRUE
Práce s chybějícími daty v R

MCAR: Jaké jsou důsledky?

Důsledky

  • Imputace je doporučena
  • Odstranění pozorování může zmenšit vzorek a omezit inferenci, ale nezpůsobí zkreslení
  • Data byste měli imputovat
Práce s chybějícími daty v R

MAR: Co to je?

Chybějící hodnoty závisejí na pozorovaných datech, nikoli na nepozorovaných

Důsledky:

  • Imputujte
  • Odstranění pozorování není ideální – může vést ke zkreslení
test vacation depression
NA TRUE 87.93109
11.533340 FALSE 40.02708
10.126115 TRUE 48.62883
NA FALSE 88.21743
NA TRUE 90.29282
8.551881 FALSE 44.77343
NA FALSE 89.48865
NA TRUE 89.99209
10.608264 TRUE 45.56832
Práce s chybějícími daty v R

MNAR: Co to je?

Chybějící hodnoty odpovědi souvisejí s nepozorovanou hodnotou relevantní pro dané hodnocení.

Důsledky:

  • Data budou zkreslena po odstranění i imputaci
  • Inference je omezená – postupujte opatrně.
test vacation depression
NA TRUE NA
11.533340 FALSE 11.533340
10.126115 TRUE 10.126115
NA FALSE NA
NA TRUE NA
8.551881 FALSE 8.551881
NA FALSE NA
NA TRUE NA
10.608264 TRUE 10.608264
Práce s chybějícími daty v R

Příklad: MCAR

vis_miss(mt_cars, cluster = TRUE)

Práce s chybějícími daty v R

Příklad: MAR

oceanbuoys %>% arrange(year) %>% vis_miss()

Práce s chybějícími daty v R

Příklad: MNAR

vis_miss(ocean, cluster = TRUE)

Práce s chybějícími daty v R

Pojďme si procvičit!

Práce s chybějícími daty v R

Preparing Video For Download...