Problém modelování pro vysvětlení

Modelování s daty v Tidyverse

Albert Y. Kim

Assistant Professor of Statistical and Data Sciences

Připomenutí: Obecný vzorec modelování

$$ y = f(\vec{x}) + \epsilon $$

Kde:

  • $y$: výsledná proměnná zájmu
  • $\vec{x}$: vysvětlující/prediktory
  • $f()$: funkce vztahu mezi $y$ a $\vec{x}$, tzv. signál
  • $\epsilon$: nesystematická chybová složka, tzv. šum
Modelování s daty v Tidyverse

Problém modelování

Uvažujme $y = f(\vec{x}) + \epsilon$.

  1. $f()$ a $\epsilon$ jsou neznámé
  2. $n$ pozorování $y$ a $\vec{x}$ je v datech známých/dostupných
  3. Cíl: Přizpůsobit model $\hat{f}()$, který aproximuje $f()$ a ignoruje $\epsilon$
  4. Cíl jinak: Oddělit signál od šumu
  5. Poté lze generovat odhadované/předpovězené hodnoty $\hat{y} = \hat{f}(\vec{x})$
Modelování s daty v Tidyverse

Příklad modelování pro vysvětlení

Modelování s daty v Tidyverse

EDA vztahu

library(ggplot2)
library(dplyr)
library(moderndive)

ggplot(evals, aes(x = age, y = score)) +
  geom_point() + 
  labs(x = "age", y = "score",
       title = "Teaching score over age")
Modelování s daty v Tidyverse

EDA vztahu

Modelování s daty v Tidyverse

Bodový graf s rozptýlením

library(ggplot2)
library(dplyr)
library(moderndive)

# Use geom_jitter() instead of geom_point()
ggplot(evals, aes(x = age, y = score)) +
  geom_jitter() + 
  labs(x = "age", y = "score",
       title = "Teaching score over age (jittered)")
Modelování s daty v Tidyverse

Bodový graf s rozptýlením

Modelování s daty v Tidyverse

Korelační koeficient

Modelování s daty v Tidyverse

Výpočet korelačního koeficientu

evals %>% 
  summarize(correlation = cor(score, age))
# A tibble: 1 x 1
  correlation
        <dbl>
1      -0.107
Modelování s daty v Tidyverse

Pojďme si procvičit!

Modelování s daty v Tidyverse

Preparing Video For Download...