Перевірка гіпотез для порівняння двох середніх за допомогою моделювання

Статистичні висновки для числових даних в R

Mine Cetinkaya-Rundel

Associate Professor of the Practice, Duke University

Мотивація

  • Питання: чи лікування з використанням ембріональних стовбурових клітин покращує функцію серця після інфаркту краще, ніж традиційна терапія?

  • Дані: stem.cell з пакета openintro

library(openintro)
data(stem.cell)
   trmt   before   after 
1  ctrl    35.25   29.50
2  ctrl    36.50   29.50
3  ctrl    39.75   36.25
   ...      ...     ... 
n  esc     53.75   51.00
Статистичні висновки для числових даних в R

План аналізу

Крок 1. Обчисліть change для кожної вівці: різницю між значеннями до та після для кожної вівці.

   trmt   before   after   change 
1  ctrl    35.25   29.50   ?
2  ctrl    36.50   29.50   ?
3  ctrl    39.75   36.25   ?
   ...      ...     ...   
n  esc     53.75   51.00   ?
Статистичні висновки для числових даних в R

План аналізу

Крок 2. Сформулюйте гіпотези:

$H_0: \mu_{esc} = \mu_{ctrl}$; немає різниці між середніми змінами в групах лікування та контролю.

$H_A: \mu_{esc} > \mu_{ctrl}$; є різниця між середніми змінами в групах лікування та контролю.

Статистичні висновки для числових даних в R

План аналізу

Крок 3. Виконайте перевірку гіпотези.

  • Запишіть значення change на 18 картках.
  • (1) Перетасуйте картки й випадково розділіть навпіл: лікування та контроль.
  • (2) Обчисліть і зафіксуйте статистику тесту: різницю середніх change між лікуванням і контролем.
  • Багаторазово повторіть (1) і (2), щоб отримати вибірковий розподіл.
  • Обчисліть p-значення як частку симуляцій, де статистика тесту принаймні така ж екстремальна, як спостережувана різниця середніх вибірок.
Статистичні висновки для числових даних в R

Перевірка гіпотез: генерування ресемплів

Скористайтеся пакетом infer для перевірки:

library(infer)
Статистичні висновки для числових даних в R

Перевірка гіпотез: генерування ресемплів

Почніть з датафрейму та вкажіть модель:

library(infer)

diff_ht_mean <- stem.cell %>%
  specify(__) %>%                    # y ~ x
  ...
Статистичні висновки для числових даних в R

Перевірка гіпотез: генерування ресемплів

Задайте нульову гіпотезу, тобто відсутність різниці між середніми:

library(infer)

diff_ht_mean <- stem.cell %>%
  specify(__) %>%                    # y ~ x
  hypothesize(null = __) %>%         # "independence" or "point"
  ...
Статистичні висновки для числових даних в R

Перевірка гіпотез: генерування ресемплів

Згенеруйте ресемпли, припускаючи, що $H_0$ істинна:

library(infer)

diff_ht_mean <- stem.cell %>%
  specify(__) %>%                    # y ~ x
  hypothesize(null = __) %>%         # "independence" or "point"
  generate(reps = __, type = __) %>% # "bootstrap", "permute", or "simulate"
  ...
Статистичні висновки для числових даних в R

Перевірка гіпотез: генерування ресемплів

Обчисліть статистику тесту:

library(infer)

diff_ht_mean <- stem.cell %>%
  specify(__) %>%                    # y ~ x
  hypothesize(null = __) %>%         # "independence" or "point"
  generate(reps = _N_, type = __) %>%# "bootstrap", "permute", or "simulate"
  calculate(stat = "diff in means")  # type of statistic to calculate
Статистичні висновки для числових даних в R

Перевірка гіпотез: обчислення p-значення

Обчисліть p-значення як частку симуляцій, де змодельована різниця між середніми вибірок не менша за спостережувану

$$P ((\bar{x}_{esc,sim} - \bar{x}_{ctrl,sim}) \ge (\bar{x}_{esc,obs} - \bar{x}_{ctrl,obs}))$$

Статистичні висновки для числових даних в R

Давайте потренуємось!

Статистичні висновки для числових даних в R

Preparing Video For Download...