Paradoks Simpsona

Regresja średnio zaawansowana w R

Richie Cotton

Data Evangelist at DataCamp

Niezwykle pomysłowy paradoks!

Paradoks Simpsona występuje, gdy trend modelu na całym zbiorze danych znacznie różni się od trendów obserwowanych w podzbiorach.

trend = współczynnik nachylenia

Regresja średnio zaawansowana w R

Syntetyczne dane Simpsona

x y group
62.24344 70.60840 D
52.33499 14.70577 B
56.36795 46.39554 C
66.80395 66.17487 D
66.53605 89.24658 E
62.38129 91.45260 E
  • 5 grup danych, oznaczonych „A" do „E"
1 https://www.rdocumentation.org/packages/datasauRus/topics/simpsons_paradox
Regresja średnio zaawansowana w R

Regresje liniowe

Cały zbiór danych

mdl_whole <- lm(
  y ~ x, 
  data = simpsons_paradox
)
coefficients(mdl_whole)
(Intercept)            x  
    -38.554        1.751  

Według grup

mdl_by_group <- lm(
  y ~ group + group:x + 0, 
  data = simpsons_paradox
)
coefficients(mdl_by_group)
  groupA    groupB    groupC    groupD    groupE  
 32.5051   67.3886   99.6333  132.3932  123.8242  
groupA:x  groupB:x  groupC:x  groupD:x  groupE:x  
 -0.6266   -1.0105   -0.9940   -0.9908   -0.5364
Regresja średnio zaawansowana w R

Wykres całego zbioru danych

ggplot(simpsons_paradox, aes(x, y)) +
  geom_point() +
  geom_smooth(method = "lm", se = FALSE)

scatter-simpson-whole.png

Regresja średnio zaawansowana w R

Wykres według grup

ggplot(simpsons_paradox, aes(x, y, color = group)) +
  geom_point() +
  geom_smooth(method = "lm", se = FALSE)

scatter-simpson-by-group.png

Regresja średnio zaawansowana w R

Jak pogodzić różnice

Dobra rada

Jeśli to możliwe, warto zwizualizować zbiór danych.

Częsta rada

Nie ma uniwersalnie najlepszego modelu — zależy to od zbioru danych i zadawanego pytania.

Kolejna dobra rada

Sformułuj pytanie przed rozpoczęciem modelowania.

Regresja średnio zaawansowana w R

Przykład: wyniki testów

scatter-video-games-whole.png

scatter-video-games-by-group.png

Regresja średnio zaawansowana w R

Przykład: choroby zakaźne

scatter-cities-whole.png

scatter-cities-by-group.png

1 https://stats.stackexchange.com/questions/478463/examples-of-simpsons-paradox-being-resolved-by-choosing-the-aggregate-data
Regresja średnio zaawansowana w R

Jak pogodzić różnice — ciąg dalszy

  • Zazwyczaj (choć nie zawsze) model grupowy dostarcza więcej informacji.
  • Czy brakuje zmiennych objaśniających?
  • Kontekst ma znaczenie.
Regresja średnio zaawansowana w R

Paradoks Simpsona w rzeczywistych danych

  • Paradoks zwykle jest mniej oczywisty.
  • Zamiast całkowitej zmiany kierunku może pojawić się zerowe nachylenie.
  • Może nie występować w każdej grupie.
Regresja średnio zaawansowana w R

Czas na ćwiczenia!

Regresja średnio zaawansowana w R

Preparing Video For Download...