설명을 위한 모델링 문제

Tidyverse로 하는 데이터 모델링

Albert Y. Kim

Assistant Professor of Statistical and Data Sciences

복습: 일반 모델링 공식

$$ y = f(\vec{x}) + \epsilon $$

구성 요소:

  • $y$: 관심 결과 변수
  • $\vec{x}$: 설명/예측 변수
  • $f()$: $y$와 $\vec{x}$ 간의 관계 함수 (즉, 신호)
  • $\epsilon$: 비체계적 오차 성분 (즉, 노이즈)
Tidyverse로 하는 데이터 모델링

모델링 문제

$y = f(\vec{x}) + \epsilon$을 고려합니다.

  1. $f()$와 $\epsilon$은 미지수
  2. $y$와 $\vec{x}$의 $n$개 관측값은 데이터에서 알 수 있음
  3. 목표: $\epsilon$을 무시하면서 $f()$를 근사하는 모델 $\hat{f}()$ 적합
  4. 목표 재정의: 신호와 노이즈 분리
  5. 이후 적합/예측값 $\hat{y} = \hat{f}(\vec{x})$ 생성 가능
Tidyverse로 하는 데이터 모델링

설명을 위한 모델링 예시

Tidyverse로 하는 데이터 모델링

관계에 대한 EDA

library(ggplot2)
library(dplyr)
library(moderndive)

ggplot(evals, aes(x = age, y = score)) +
  geom_point() + 
  labs(x = "age", y = "score",
       title = "Teaching score over age")
Tidyverse로 하는 데이터 모델링

관계에 대한 EDA

Tidyverse로 하는 데이터 모델링

지터 산점도

library(ggplot2)
library(dplyr)
library(moderndive)

# Use geom_jitter() instead of geom_point()
ggplot(evals, aes(x = age, y = score)) +
  geom_jitter() + 
  labs(x = "age", y = "score",
       title = "Teaching score over age (jittered)")
Tidyverse로 하는 데이터 모델링

지터 산점도

Tidyverse로 하는 데이터 모델링

상관 계수

Tidyverse로 하는 데이터 모델링

상관 계수 계산

evals %>% 
  summarize(correlation = cor(score, age))
# A tibble: 1 x 1
  correlation
        <dbl>
1      -0.107
Tidyverse로 하는 데이터 모델링

연습해 봅시다!

Tidyverse로 하는 데이터 모델링

Preparing Video For Download...