Centralne twierdzenie graniczne

Wprowadzenie do statystyki w Pythonie

Maggie Matsui

Content Developer, DataCamp

Rzut kostką 5 razy

die = pd.Series([1, 2, 3, 4, 5, 6])

# Roll 5 times samp_5 = die.sample(5, replace=True) print(samp_5)
array([3, 1, 4, 1, 1])
np.mean(samp_5)
2.0

 

sześciościenna kostka

Wprowadzenie do statystyki w Pythonie

Rzut kostką 5 razy

# Roll 5 times and take mean
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
4.4
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
3.8
Wprowadzenie do statystyki w Pythonie

Rzut kostką 5 razy, 10 razy

Powtórz 10 razy:

  • Rzuć 5 razy
  • Oblicz średnią
sample_means = []

for i in range(10):
samp_5 = die.sample(5, replace=True) sample_means.append(np.mean(samp_5))
print(sample_means)
[3.8, 4.0, 3.8, 3.6, 3.2, 4.8, 2.6,
3.0, 2.6, 2.0]
Wprowadzenie do statystyki w Pythonie

Rozkłady próbkowania

Rozkład próbkowania średniej z próby

histogram 10 średnich z próby

Wprowadzenie do statystyki w Pythonie

100 średnich z próby

sample_means = []
for i in range(100):
    sample_means.append(np.mean(die.sample(5, replace=True)))

histogram 100 średnich z próby

Wprowadzenie do statystyki w Pythonie

1000 średnich z próby

sample_means = []
for i in range(1000):
    sample_means.append(np.mean(die.sample(5, replace=True)))

histogram 1000 średnich z próby

Wprowadzenie do statystyki w Pythonie

Centralne twierdzenie graniczne

Rozkład próbkowania statystyki zbliża się do rozkładu normalnego wraz ze wzrostem liczby prób.

histogramy 10, 100 i 1000 średnich z próby – im więcej prób, tym kształt bardziej zbliżony do krzywej dzwonowej

 

* Próby powinny być losowe i niezależne

Wprowadzenie do statystyki w Pythonie

Odchylenie standardowe a CTG

sample_sds = []
for i in range(1000):
  sample_sds.append(np.std(die.sample(5, replace=True)))

Rozkład 1000 odchyleń standardowych z próby dla 5 rzutów kostką

Wprowadzenie do statystyki w Pythonie

Proporcje a CTG

sales_team = pd.Series(["Amir", "Brian", "Claire", "Damian"])

sales_team.sample(10, replace=True)
array(['Claire', 'Damian', 'Brian', 'Damian', 'Damian', 'Amir', 'Amir', 'Amir', 
      'Amir', 'Damian'], dtype=object)
sales_team.sample(10, replace=True)
array(['Brian', 'Amir', 'Brian', 'Claire', 'Brian', 'Damian', 'Claire', 'Brian', 
      'Claire', 'Claire'], dtype=object)
Wprowadzenie do statystyki w Pythonie

Rozkład próbkowania proporcji

Rozkład proporcji z próby przypomina rozkład normalny

Wprowadzenie do statystyki w Pythonie

Średnia rozkładu próbkowania

# Estimate expected value of die
np.mean(sample_means)
3.48
# Estimate proportion of "Claire"s
np.mean(sample_props)
0.26

Rozkład próbkowania średnich z próby z przerywaną linią pośrodku  

  • Szacowanie cech nieznanego rozkładu bazowego
  • Łatwiejsze szacowanie cech dużych populacji
Wprowadzenie do statystyki w Pythonie

Czas na ćwiczenia!

Wprowadzenie do statystyki w Pythonie

Preparing Video For Download...