Puissance et taille d'échantillon

Tests A/B en R

Lauryn Burleigh

Data Scientist

Définition de la puissance

  • Probabilité de rejeter l'hypothèse nulle quand elle est fausse
  • Éviter l'erreur de type II de ne pas la rejeter
  • Idéal : faible taux d'erreur de type II, forte puissance

Une distribution normale de l'hypothèse nulle à gauche et de l'hypothèse alternative à droite, se chevauchant partiellement. Une ligne horizontale pointillée indique la p-valeur où elles se chevauchent. À gauche de la ligne sous l'alternative : erreur de type II ; à droite : puissance.

Tests A/B en R

Atouts de la puissance

Utilité du test

  • Rejeter l'hypothèse nulle quand il le faut

Une distribution normale de l'hypothèse nulle à gauche et de l'hypothèse alternative à droite, se chevauchant partiellement. Une ligne horizontale pointillée indique la p-valeur où elles se chevauchent. À gauche de la ligne sous l'alternative : erreur de type II ; à droite : puissance.

Puissance

  • Déterminer la taille d'échantillon requise
  • Vérifier si les résultats sont fiables
Tests A/B en R

Taille d'échantillon

  • Taille d'effet estimée
  • Puissance estimée (souvent 0,8)
  • Alpha (souvent 0,05)

Chevauchement de distributions pour diverses tailles d'échantillon où un petit échantillon a une distribution plus étroite qu'un grand pour une valeur t, sur l'axe x. Un petit échantillon exige une t plus élevée pour atteindre la signification.

library(pwr)
pwr.t.test(d = .8, power = 0.8,

sig.level = 0.05,
type = "one.sample",
alternative = "two.sided")
     One-sample t test power calculation 
              n = 14.30276
              d = 0.8
      sig.level = 0.05
          power = 0.8
    alternative = two.sided
Tests A/B en R

Taille d'effet

  • Taille d'effet attendue
  • Moyenne du groupe témoin − moyenne du groupe expérimental

Une distribution normale de l'hypothèse nulle à gauche et de l'hypothèse alternative à droite, se chevauchant partiellement. Une ligne horizontale pointillée indique la p-valeur où elles se chevauchent. À gauche de la ligne sous l'alternative : erreur de type II ; à droite : puissance. Une barre rouge illustre que la taille d'effet est l'écart entre les pics des deux distributions.

Avant l'analyse

Déterminer la taille d'effet avec :

  • Information contextuelle
  • Données préliminaires

 

Après l'analyse

Déterminer la taille d'effet avec :

  • Ensemble de données complet
Tests A/B en R

Analyse de puissance du test

Plus de puissance = plus de chances de rejeter correctement l'hypothèse nulle

Trois éléments requis :

  • Taille d'échantillon
  • Taille d'effet
  • Alpha
library(pwr)
pwr.t.test(n = 20, sig.level = 0.045, 
           d = .81, type = "one.sample")
     One-sample t test power calculation 
              n = 20
              d = 0.81
      sig.level = 0.045
          power = 0.9223189
    alternative = two.sided
Tests A/B en R

Distributions de pizza

Distributions similaires

Pas de différence significative

Deux histogrammes, Pepperoni en rose et Cheese en bleu, où les valeurs figurent sur l'axe des x et les fréquences sur l'axe des y, avec des pics proches sur l'axe des x.

Distributions différentes

Différence probablement significative

Deux histogrammes, Pepperoni en rose et Cheese en bleu, où les valeurs figurent sur l'axe des x et les fréquences sur l'axe des y, avec des pics éloignés sur l'axe des x.

Tests A/B en R

Hypothèses pour la pizza

Distribution de l'hypothèse nulle en rose avec une différence moyenne de 0 et distribution de l'hypothèse alternative en bleu avec une différence moyenne de 3,5 ; la valeur critique de rejet est une ligne verticale à 1,64.

  • Similaires : à gauche de la valeur de rejet
  • Différentes : à droite de la valeur de rejet
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
Tests A/B en R

Puissance pour la pizza

Distribution de l'hypothèse nulle en rose avec une différence moyenne de 0 et distribution de l'hypothèse alternative en bleu avec une différence moyenne de 3,5 ; la valeur critique de rejet est une ligne verticale à 1,64.

  • Similaires : à gauche de la valeur de rejet
  • Différentes : à droite de la valeur de rejet
  • Puissance : probabilité de ne pas conclure à tort à des garnitures identiques (erreur de type II)
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
Tests A/B en R

Passons à la pratique !

Tests A/B en R

Preparing Video For Download...