Tests d'hypothèse en R
Richie Cotton
Data Evangelist at DataCamp
age_first_code_cut classe le moment où un utilisateur de Stack Overflow a commencé à programmer"adult" signifie à 14 ans ou plus"child" signifie avant 14 ansUne hypothèse est une affirmation sur un paramètre de population inconnu.
Un test d'hypothèse oppose deux hypothèses concurrentes.
L'hypothèse nulle ($H_{0}$) est l'idée « championne » en place.
L'hypothèse alternative ($H_{A}$) est la nouvelle idée « challenger » du chercheur.
Pour notre problème
Le seuil de signification correspond à « au‑delà de tout doute raisonnable » pour les tests d'hypothèse.

Les tests d'hypothèse vérifient si la statistique d'échantillon tombe dans les queues de la distribution nulle.
| Test | Queues |
|---|---|
| alternative différente de la nulle | bilatéral |
| alternative plus grande que la nulle | unilatéral droit |
| alternative plus petite que la nulle | unilatéral gauche |
$H_{A}$ : La proportion de scientifiques des données ayant commencé à programmer enfants est supérieure à 35 %.
Notre hypothèse alternative est « supérieure à », donc test unilatéral droit.
Une valeur p est
la probabilité d'observer une statistique de test
aussi extrême ou plus extrême
que celle de notre échantillon initial,
en supposant l'hypothèse nulle vraie.
prop_child_samp <- stack_overflow %>%
summarize(point_estimate = mean(age_first_code_cut == "child")) %>%
pull(point_estimate)
0.388
prop_child_hyp <- 0.35
std_error <- 0.0096028
z_score <- (prop_child_samp - prop_child_hyp) / std_error
3.956
pnorm() est la FDR normale.lower.tail = TRUE.lower.tail = FALSE.
p_value <- pnorm(z_score, lower.tail = FALSE)
3.818e-05
Tests d'hypothèse en R