Statistisk inferens och slumpmässigt urval

Grunderna i inferens med Python

Paul Savala

Assistant Professor of Mathematics

Deskriptiv statistik

  • Urvalsstatistik sammanfattar data
  • Deskriptiv statistik sammanfattar vårt urval
Datum SP500 Stängning Daglig förändring
2017-08-07 2480,91 6,14
2017-08-08 2474,92 -5,99
2017-08-09 2474,02 -0,90
2017-08-10 2438,21 -35,81

Genomsnittlig daglig förändring: -$9,14

Grunderna i inferens med Python

Inferens

  • Dra slutsatser om vår population
  • Deskriptiv statistik: Beskriver data
  • Inferens: Dra slutsatser och fatta beslut
Datum SP500 Stängning Daglig förändring
2017-08-07 2480,91 6,14
2017-08-08 2474,92 -5,99
2017-08-09 2474,02 -0,90
2017-08-10 2438,21 -35,81

Genomsnittlig daglig svängning för valfria dagar ~$9,14

Grunderna i inferens med Python

Den statistiska inferensprocessen

Ett diagram som visar hur en population leder till ett urval, som leder till inferens, som leder tillbaka till populationen.

Grunderna i inferens med Python

Punktskattningar

  • Ges av ett enskilt värde
  • "Bästa gissningen" på en okänd populationsstatistik

Punktskatning: 1 158,95 BTC daglig svängning

De fem första raderna i Bitcoin-datamängden

btc_high = btc_sp_df['High_BTC']
btc_low = btc_sp_df['Low_BTC']

np.mean(btc_high - btc_low)
1158.95
Grunderna i inferens med Python

Urval

Punktskattningar beror på urvalet

btc_sp_first100 = btc_sp_df.iloc[:100]

np.mean(btc_sp_first100['High_BTC'] - btc_sp_first100['Low_BTC'])
659.60
initial_row = np.random.choice(btc_sp_df.shape[0]-100)

btc_sp_random_100 = btc_sp_df.iloc[initial_row:initial_row+100]
np.mean(btc_sp_first100['High_BTC'] - btc_sp_first100['Low_BTC'])
943.83
Grunderna i inferens med Python

Nu kör vi en övning!

Grunderna i inferens med Python

Preparing Video For Download...