Технические условия линейной регрессии

Вывод для линейной регрессии в R

Jo Hardin

Professor, Pomona College

Каковы технические условия?

$$Y = \beta_0 + \beta_1 \cdot X + \epsilon$$

$$\epsilon \sim N(0, \sigma_\epsilon)$$

  • L: линейная модель
  • I: независимые наблюдения
  • N: точки распределены нормально вокруг прямой
  • E: равномерный разброс вокруг прямой для всех значений объясняющей переменной

Вывод для линейной регрессии в R

Линейная модель: остатки

linear_lm <- augment(
  lm(response ~ explanatory,
     data = lineardata)
)

ggplot(linear_lm,
       aes(x =. fitted, y = .resid)) +
  geom_point() +
  geom_hline(yintercept=0)

Прогнозируемое значение: $\hat{Y}_i = b_0 + b_1 X_i$

Остаток: $e_i= Y_i - \hat{Y}_i$

Вывод для линейной регрессии в R

Нелинейная зависимость

$$Y = \beta_0 + \beta_1 \cdot X + \epsilon$$

$$\epsilon \sim N(0, \sigma_\epsilon)$$

  • L: линейная модель
  • I: независимые наблюдения
  • N: точки распределены нормально вокруг прямой
  • E: равномерный разброс вокруг прямой для всех значений объясняющей переменной

Вывод для линейной регрессии в R

Нелинейная зависимость: остатки

nonlinear_lm <- augment(
  lm(response ~ explanatory,
     data = nonlineardata))
ggplot(nonlinear_lm, 
       aes(x = .fitted, y = .resid)) + 
  geom_point() +
  geom_hline(yintercept=0)

Прогнозируемое значение: $\hat{Y}_i = b_0 + b_1 X_i$

Остаток: $e_i= Y_i - \hat{Y}_i$

Вывод для линейной регрессии в R

Ненормальное распределение

$$Y = \beta_0 + \beta_1 \cdot X + \epsilon$$

$$\epsilon \sim N(0, \sigma_\epsilon)$$

  • L: линейная модель
  • I: независимые наблюдения
  • N: точки распределены нормально вокруг прямой
  • E: равномерный разброс вокруг прямой для всех значений объясняющей переменной

Вывод для линейной регрессии в R

Ненормальное распределение: остатки

nonnormal_lm <- augment(
  lm(response ~ explanatory, 
     data = nonnormaldata))
ggplot(nonnormal_lm, 
      aes(x = .fitted, y = .resid)) + 
  geom_point() +
  geom_hline(yintercept = 0) 

Прогнозируемое значение: $\hat{Y}_i = b_0 + b_1 X_i$

Остаток: $e_i= Y_i - \hat{Y}_i$

Вывод для линейной регрессии в R

Неравномерная дисперсия

$$Y = \beta_0 + \beta_1 \cdot X + \epsilon$$

$$\epsilon \sim N(0, \sigma_\epsilon)$$

  • L: линейная модель
  • I: независимые наблюдения
  • N: точки распределены нормально вокруг прямой
  • E: равномерный разброс вокруг прямой для всех значений объясняющей переменной

Вывод для линейной регрессии в R

Неравномерная дисперсия: остатки

nonequal_lm <- augment(
  lm(response ~ explanatory, 
     data = nonequaldata))
ggplot(nonequal_lm, 
       aes(x = .fitted, y = .resid)) + 
  geom_point() +
  geom_hline(yintercept = 0)

Прогнозируемое значение: $\hat{Y}_i = b_0 + b_1 X_i$

Остаток: $e_i= Y_i - \hat{Y}_i$

Вывод для линейной регрессии в R

Давайте потренируемся!

Вывод для линейной регрессии в R

Preparing Video For Download...