Hypothèses dans les tests d'hypothèses

Vérification d'hypothèses en Python

James Chapman

Curriculum Manager, DataCamp

Aléa

Hypothèse

Les échantillons sont des sous-ensembles aléatoires de populations plus vastes

Conséquence
  • L'échantillon n'est pas représentatif de la population
Comment vérifier
  • Comprendre comment vos données ont été recueillies
  • Parler à la personne qui a recueilli les données/expert du domaine

Un logo avec la mention « Responsibly Sourced Ingredients ».

1 Les techniques d'échantillonnage sont abordées dans « Sampling in Python ».
Vérification d'hypothèses en Python

Indépendance des observations

Hypothèse

Chaque observation (ligne) du jeu de données est indépendante

Conséquence
  • Risque accru d'erreurs de type faux négatif/positif
Comment vérifier
  • Comprendre comment nos données ont été recueillies
Vérification d'hypothèses en Python

Taille d'échantillon élevée

Hypothèse

L'échantillon est assez grand pour réduire l'incertitude, de sorte que le théorème central limite s'applique

Conséquence
  • Intervalles de confiance plus larges
  • Risque accru d'erreurs de type faux négatif/positif
Comment vérifier
  • Cela dépend du test
Vérification d'hypothèses en Python

Grande taille d'échantillon : test t

Un échantillon
  • Au moins 30 observations dans l'échantillon

$n \ge 30$

$n$ : taille de l'échantillon

Deux échantillons
  • Au moins 30 observations dans chaque échantillon

$n_{1} \ge 30, n_{2} \ge 30$

$n_{i}$ : taille de l'échantillon pour le groupe $i$

Échantillons appariés
  • Au moins 30 paires d'observations entre les échantillons

Nombre de lignes dans nos données $\ge 30$

ANOVA
  • Au moins 30 observations dans chaque échantillon

$n_{i} \ge 30$ pour toutes les valeurs de $i$

Vérification d'hypothèses en Python

Grande taille d'échantillon : tests de proportion

Un échantillon
  • Nombre de succès dans l'échantillon supérieur ou égal à 10

$n \times \hat{p} \ge 10$

  • Nombre d'échecs dans l'échantillon supérieur ou égal à 10

$n \times (1 - \hat{p}) \ge 10$

$n$ : taille de l'échantillon
$\hat{p}$ : proportion de succès dans l'échantillon

Deux échantillons
  • Nombre de succès dans chaque échantillon supérieur ou égal à 10

$n_{1} \times \hat{p}_{1} \ge 10$

$n_{2} \times \hat{p}_{2} \ge 10$

  • Nombre d'échecs dans chaque échantillon supérieur ou égal à 10

$n_{1} \times (1 - \hat{p}_{1}) \ge 10$

$n_{2} \times (1 - \hat{p}_{2}) \ge 10$

Vérification d'hypothèses en Python

Grande taille d'échantillon : tests du khi carré

  • Le nombre de succès dans chaque groupe est supérieur ou égal à 5

$n_{i} \times \hat{p}_{i} \ge 5$ pour toutes les valeurs de $i$

  • Le nombre d'échecs dans chaque groupe est supérieur ou égal à 5

$n_{i} \times (1 - \hat{p}_{i}) \ge 5$ pour toutes les valeurs de $i$

$n_{i}$ : taille de l'échantillon pour le groupe $i$
$\hat{p}_{i}$ : proportion de succès dans l'échantillon du groupe $i$

Vérification d'hypothèses en Python

Vérification de gros bon sens

Si la distribution bootstrap n'a pas l'air normale, les hypothèses sont probablement invalides

  • Revoir la collecte des données pour vérifier l'aléa, l'indépendance et la taille de l'échantillon
Vérification d'hypothèses en Python

Passons à la pratique !

Vérification d'hypothèses en Python

Preparing Video For Download...