Виконання t-тестів

Тестування гіпотез у Python

James Chapman

Curriculum Manager, DataCamp

Задачі для двох вибірок

  • Порівняйте вибіркові статистики між групами змінної
  • converted_comp — числова змінна
  • age_first_code_cut — категоріальна змінна з рівнями ("child" і "adult")
  • Чи отримують користувачі, які почали кодувати в дитинстві, вищу компенсацію, ніж ті, хто почав у дорослому віці?
Тестування гіпотез у Python

Гіпотези

$H_{0}$: Середня компенсація (у USD) однакова для тих, хто вперше кодував у дитинстві, і тих, хто вперше кодував у дорослому віці.

$H_{0}$: $\mu_{child} = \mu_{adult}$

$H_{0}$: $\mu_{child} - \mu_{adult} = 0$

$H_{A}$: Середня компенсація (у USD) вища для тих, хто вперше кодував у дитинстві, порівняно з тими, хто почав у дорослому віці.

$H_{A}$: $\mu_{child} > \mu_{adult}$

$H_{A}$: $\mu_{child} - \mu_{adult} > 0$

Тестування гіпотез у Python

Обчислення зведеної статистики за групами

stack_overflow.groupby('age_first_code_cut')['converted_comp'].mean()
age_first_code_cut
adult    111313.311047
child    132419.570621
Name: converted_comp, dtype: float64
Тестування гіпотез у Python

Статистики тесту

  • Вибіркове середнє оцінює середнє в генеральній сукупності
  • $\bar{x}$ — вибіркове середнє
  • $\bar{x}_{child}$ — вибіркове середнє компенсації для тих, хто спершу кодував у дитинстві
  • $\bar{x}_{adult}$ — вибіркове середнє компенсації для тих, хто спершу кодував у дорослому віці
  • $\bar{x}_{child} - \bar{x}_{adult}$ — статистика тесту
  • z-оцінка — (стандартизована) статистика тесту
Тестування гіпотез у Python

Стандартизація статистики тесту

$z = \dfrac{\text{sample stat} - \text{population parameter}}{\text{standard error}}$

$t = \dfrac{\text{difference in sample stats} - \text{difference in population parameters}}{\text{standard error}}$

$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}}) - (\mu_{\text{child}} - \mu_{\text{adult}})}{SE(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}$

Тестування гіпотез у Python

Стандартна похибка

$SE(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}}) \approx \sqrt{\dfrac{s_{\text{child}}^2}{n_{\text{child}}} + \dfrac{s_{\text{adult}}^2}{n_{\text{adult}}}}$

$s$ — стандартне відхилення змінної

$n$ — обсяг вибірки (кількість спостережень/рядків у вибірці)

Тестування гіпотез у Python

За умови справедливості нульової гіпотези

$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}}) - (\mu_{\text{child}} - \mu_{\text{adult}})}{SE(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}$

$H_{0}$: $\mu_{\text{child}} - \mu_{\text{adult}} = 0$    $\rightarrow$     $t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}}) }{SE(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}$

$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}{\sqrt{\dfrac{s_{\text{child}}^2}{n_{\text{child}}} + \dfrac{s_{\text{adult}}^2}{n_{\text{adult}}}}}$

Тестування гіпотез у Python

Обчислення за умови нульової гіпотези

xbar = stack_overflow.groupby('age_first_code_cut')['converted_comp'].mean()
adult    111313.311047
child    132419.570621
Name: converted_comp, dtype: float64 age_first_code_cut
s = stack_overflow.groupby('age_first_code_cut')['converted_comp'].std()
adult    271546.521729
child    255585.240115
Name: converted_comp, dtype: float64 age_first_code_cut
n = stack_overflow.groupby('age_first_code_cut')['converted_comp'].count()
adult    1376
child     885
Name: converted_comp, dtype: int64
Тестування гіпотез у Python

Обчислення статистики тесту

$t = \dfrac{(\bar{x}_{\text{child}} - \bar{x}_{\text{adult}})}{\sqrt{\dfrac{s_{\text{child}}^2}{n_{\text{child}}} + \dfrac{s_{\text{adult}}^2}{n_{\text{adult}}}}}$

import numpy as np
numerator = xbar_child - xbar_adult
denominator = np.sqrt(s_child ** 2 / n_child + s_adult ** 2 / n_adult)
t_stat = numerator / denominator
1.8699313316221844
Тестування гіпотез у Python

Давайте потренуємось!

Тестування гіпотез у Python

Preparing Video For Download...