Il teorema del limite centrale

Introduzione alla statistica in Python

Maggie Matsui

Content Developer, DataCamp

Lanciare il dado 5 volte

die = pd.Series([1, 2, 3, 4, 5, 6])

# Lancia 5 volte samp_5 = die.sample(5, replace=True) print(samp_5)
array([3, 1, 4, 1, 1])
np.mean(samp_5)
2.0

 

dado a sei facce

Introduzione alla statistica in Python

Lanciare il dado 5 volte

# Lancia 5 volte e fai la media
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
4.4
samp_5 = die.sample(5, replace=True)
np.mean(samp_5)
3.8
Introduzione alla statistica in Python

Lanciare il dado 5 volte per 10 volte

Ripeti 10 volte:

  • Lancia 5 volte
  • Calcola la media
sample_means = []

for i in range(10):
samp_5 = die.sample(5, replace=True) sample_means.append(np.mean(samp_5))
print(sample_means)
[3.8, 4.0, 3.8, 3.6, 3.2, 4.8, 2.6,
3.0, 2.6, 2.0]
Introduzione alla statistica in Python

Distribuzioni campionarie

Distribuzione campionaria della media campionaria

istogramma di 10 medie campionarie

Introduzione alla statistica in Python

100 medie campionarie

sample_means = []
for i in range(100):
    sample_means.append(np.mean(die.sample(5, replace=True)))

istogramma di 100 medie campionarie

Introduzione alla statistica in Python

1000 medie campionarie

sample_means = []
for i in range(1000):
    sample_means.append(np.mean(die.sample(5, replace=True)))

istogramma di 1000 medie campionarie

Introduzione alla statistica in Python

Teorema del limite centrale

La distribuzione campionaria di una statistica si avvicina alla normale quando aumentano i tentativi.

istogrammi di 10, 100 e 1000 medie campionarie: con più medie la distribuzione è più a campana

 

* I campioni devono essere casuali e indipendenti

Introduzione alla statistica in Python

Deviazione standard e TLC

sample_sds = []
for i in range(1000):
  sample_sds.append(np.std(die.sample(5, replace=True)))

Distribuzione di 1000 deviazioni standard campionarie di 5 lanci di dado

Introduzione alla statistica in Python

Proporzioni e TLC

sales_team = pd.Series(["Amir", "Brian", "Claire", "Damian"])

sales_team.sample(10, replace=True)
array(['Claire', 'Damian', 'Brian', 'Damian', 'Damian', 'Amir', 'Amir', 'Amir', 
      'Amir', 'Damian'], dtype=object)
sales_team.sample(10, replace=True)
array(['Brian', 'Amir', 'Brian', 'Claire', 'Brian', 'Damian', 'Claire', 'Brian', 
      'Claire', 'Claire'], dtype=object)
Introduzione alla statistica in Python

Distribuzione campionaria della proporzione

Anche la distribuzione delle proporzioni campionarie appare normale

Introduzione alla statistica in Python

Media della distribuzione campionaria

# Stima del valore atteso del dado
np.mean(sample_means)
3.48
# Stima della proporzione di "Claire"
np.mean(sample_props)
0.26

Distribuzione campionaria delle medie con linea tratteggiata al centro  

  • Stimare le caratteristiche di una distribuzione ignota
  • Stimare più facilmente le caratteristiche di grandi popolazioni
Introduzione alla statistica in Python

Ayo berlatih!

Introduzione alla statistica in Python

Preparing Video For Download...