Moc i wielkość próby

Testy A/B w R

Lauryn Burleigh

Data Scientist

Definicja mocy

  • Prawdopodobieństwo odrzucenia hipotezy zerowej, gdy jest ona fałszywa
  • Brak błędu II rodzaju (nieodrzucenia hipotezy zerowej)
  • Ideał: mały wskaźnik błędu II rodzaju, duża moc

Normalny rozkład hipotezy zerowej po lewej i rozkład hipotezy alternatywnej po prawej, częściowo nakładające się. Przerywana pozioma linia wskazuje wartość p w miejscu nakładania się rozkładów. Po lewej stronie linii, pod rozkładem hipotezy alternatywnej, zaznaczony jest błąd II rodzaju; po prawej – moc testu.

Testy A/B w R

Zalety analizy mocy

Użyteczność testu

  • Odrzucenie hipotezy zerowej, gdy jest to uzasadnione

Normalny rozkład hipotezy zerowej po lewej i rozkład hipotezy alternatywnej po prawej, częściowo nakładające się. Przerywana pozioma linia wskazuje wartość p w miejscu nakładania się rozkładów. Po lewej stronie linii, pod rozkładem hipotezy alternatywnej, zaznaczony jest błąd II rodzaju; po prawej – moc testu.

Moc

  • Wyznaczenie potrzebnej wielkości próby
  • Ocena wiarygodności wyników
Testy A/B w R

Wielkość próby

  • Szacowana wielkość efektu
  • Szacowana moc (zwykle 0,8)
  • Alfa (zwykle 0,05)

Nakładające się rozkłady dla różnych wielkości próby – mniejsza próba daje węższy rozkład; oś x przedstawia wartość t. Linia dla mniejszej próby wskazuje, że wymaga ona większej wartości t do osiągnięcia istotności.

library(pwr)
pwr.t.test(d = .8, power = 0.8,

sig.level = 0.05,
type = "one.sample",
alternative = "two.sided")
     One-sample t test power calculation 
              n = 14.30276
              d = 0.8
      sig.level = 0.05
          power = 0.8
    alternative = two.sided
Testy A/B w R

Wielkość efektu

  • Oczekiwana wielkość efektu
  • Średnia grupy kontrolnej – średnia grupy eksperymentalnej

Normalny rozkład hipotezy zerowej po lewej i rozkład hipotezy alternatywnej po prawej, częściowo nakładające się. Przerywana pozioma linia wskazuje wartość p w miejscu nakładania się rozkładów. Po lewej stronie linii, pod rozkładem hipotezy alternatywnej, zaznaczony jest błąd II rodzaju; po prawej – moc testu. Czerwony pasek wskazuje, że wielkość efektu to różnica między szczytami obu rozkładów.

Przed analizą

Wielkość efektu wyznaczamy na podstawie:

  • Informacji tła
  • Danych wstępnych

 

Po analizie

Wielkość efektu wyznaczamy na podstawie:

  • Pełnego zbioru danych
Testy A/B w R

Analiza mocy testu

Wyższa moc = większe prawdopodobieństwo poprawnego odrzucenia hipotezy zerowej

Trzy wymagane elementy:

  • Wielkość próby
  • Wielkość efektu
  • Alfa
library(pwr)
pwr.t.test(n = 20, sig.level = 0.045, 
           d = .81, type = "one.sample")
     One-sample t test power calculation 
              n = 20
              d = 0.81
      sig.level = 0.045
          power = 0.9223189
    alternative = two.sided
Testy A/B w R

Rozkłady pizzy

Podobne rozkłady

Brak istotnej różnicy

Dwa histogramy – Pepperoni w kolorze różowym i Cheese w kolorze niebieskim – z wartościami na osi x i liczbą wystąpień na osi y; szczyty rozkładów blisko siebie.

Różne rozkłady

Prawdopodobnie istotna różnica

Dwa histogramy – Pepperoni w kolorze różowym i Cheese w kolorze niebieskim – z wartościami na osi x i liczbą wystąpień na osi y; szczyty rozkładów wyraźnie oddalone od siebie.

Testy A/B w R

Hipotezy dotyczące pizzy

Rozkład hipotezy zerowej w kolorze różowym ze średnią różnicą 0 i rozkład hipotezy alternatywnej w kolorze niebieskim ze średnią różnicą 3,5; krytyczna wartość odrzucenia zaznaczona pionową linią na poziomie 1,64.

  • Podobne: po lewej stronie wartości krytycznej
  • Różne: po prawej stronie wartości krytycznej
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
Testy A/B w R

Moc testu dla pizzy

Rozkład hipotezy zerowej w kolorze różowym ze średnią różnicą 0 i rozkład hipotezy alternatywnej w kolorze niebieskim ze średnią różnicą 3,5; krytyczna wartość odrzucenia zaznaczona pionową linią na poziomie 1,64.

  • Podobne: po lewej stronie wartości krytycznej
  • Różne: po prawej stronie wartości krytycznej
  • Moc: prawdopodobieństwo uniknięcia błędnego stwierdzenia podobieństwa rozkładów (błąd II rodzaju)
library(ggplot2)
ggplot(HypDists, 
       aes(x = Time, fill = Hypothesis)) + 
  geom_histogram() + 
  xlab("Difference Between Groups") + 
  geom_vline(xintercept = 1.64)
Testy A/B w R

Czas na ćwiczenia!

Testy A/B w R

Preparing Video For Download...