Potenza e dimensione del campione

A/B Testing in R

Lauryn Burleigh

Data Scientist

Definizione di potenza

  • Probabilità di rifiutare l’ipotesi nulla quando è falsa
  • Non commettere un errore di Tipo II (non rifiutare H0)
  • Ideale: basso tasso di errore di Tipo II, alta potenza

Una distribuzione normale per l’ipotesi nulla a sinistra e per l’ipotesi alternativa a destra, parzialmente sovrapposte. Una linea orizzontale tratteggiata indica il p-value dove si sovrappongono. A sinistra della linea sotto l’alternativa è l’errore di Tipo II, a destra è la potenza.

A/B Testing in R

Vantaggi della potenza

Utilità del test

  • Rifiutare l’ipotesi nulla quando va rifiutata

Una distribuzione normale per l’ipotesi nulla a sinistra e per l’ipotesi alternativa a destra, parzialmente sovrapposte. Una linea orizzontale tratteggiata indica il p-value dove si sovrappongono. A sinistra della linea sotto l’alternativa è l’errore di Tipo II, a destra è la potenza.

Potenza

  • Determinare la dimensione del campione necessaria
  • Verificare se i risultati sono affidabili
A/B Testing in R

Dimensione del campione

  • Dimensione dell’effetto stimata
  • Potenza stimata (tipicamente 0,8)
  • Alpha (tipicamente 0,05)

Distribuzioni sovrapposte per varie dimensioni di campione: un campione più piccolo ha una distribuzione più stretta di uno più grande per un t-value, sull’asse x. La linea del campione più piccolo indica che servono t più alti per la significatività.

library(pwr)
pwr.t.test(d = .8, power = 0.8,

sig.level = 0.05,
type = "one.sample",
alternative = "two.sided")
     One-sample t test power calculation 
              n = 14.30276
              d = 0.8
      sig.level = 0.05
          power = 0.8
    alternative = two.sided
A/B Testing in R

Dimensione dell’effetto

  • Dimensione dell’effetto attesa
  • Media controllo − media sperimentale

Una distribuzione normale per l’ipotesi nulla a sinistra e per l’ipotesi alternativa a destra, parzialmente sovrapposte. Una linea orizzontale tratteggiata indica il p-value dove si sovrappongono. A sinistra della linea sotto l’alternativa è l’errore di Tipo II, a destra è la potenza. Una barra rossa indica che la dimensione dell’effetto è la differenza tra i picchi delle due distribuzioni.

Prima dell’analisi

Trova la dimensione dell’effetto con:

  • Informazioni pregresse
  • Dati preliminari

 

Dopo l’analisi

Trova la dimensione dell’effetto con:

  • Dataset completo
A/B Testing in R

Analisi di potenza del test

Potenza più alta = più probabilità di rifiutare correttamente H0

Tre elementi chiave:

  • Dimensione del campione
  • Dimensione dell’effetto
  • Alpha
library(pwr)
pwr.t.test(n = 20, sig.level = 0.045, 
           d = .81, type = "one.sample")
     One-sample t test power calculation 
              n = 20
              d = 0.81
      sig.level = 0.045
          power = 0.9223189
    alternative = two.sided
A/B Testing in R

Distribuzioni della pizza

Distribuzioni simili

Nessuna differenza significativa

Due istogrammi, Pepperoni in rosa e Cheese in blu, con i valori ricevuti sull’asse x e le frequenze sull’asse y, con picchi vicini sull’asse x.

Distribuzioni diverse

Differenza probabilmente significativa

Due istogrammi, Pepperoni in rosa e Cheese in blu, con i valori ricevuti sull’asse x e le frequenze sull’asse y, con picchi separati sull’asse x.

A/B Testing in R

Ipotesi sulla pizza

Distribuzione dell’ipotesi nulla in rosa con differenza media 0 e dell’ipotesi alternativa in blu con differenza media 3,5; una linea verticale a 1,64 indica il valore critico di rifiuto.

  • Simili: a sinistra del valore di rifiuto
  • Diverse: a destra del valore di rifiuto
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
A/B Testing in R

Potenza della pizza

Distribuzione dell’ipotesi nulla in rosa con differenza media 0 e dell’ipotesi alternativa in blu con differenza media 3,5; una linea verticale a 1,64 indica il valore critico di rifiuto.

  • Simili: a sinistra del valore di rifiuto
  • Diverse: a destra del valore di rifiuto
  • Potenza: probabilità di non concludere erroneamente che le distribuzioni dei topping siano uguali (errore di Tipo II)
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
A/B Testing in R

Andiamo a fare pratica!

A/B Testing in R

Preparing Video For Download...