Statistická inference a náhodné vzorkování

Základy statistické inference v Pythonu

Paul Savala

Assistant Professor of Mathematics

Popisné statistiky

  • Vzorkové statistiky slouží k shrnutí dat
  • Popisné statistiky shrnují náš vzorek
Datum Uzavření SP500 Denní změna
2017-08-07 2480.91 6.14
2017-08-08 2474.92 -5.99
2017-08-09 2474.02 -0.90
2017-08-10 2438.21 -35.81

Průměrná denní změna: -$9.14

Základy statistické inference v Pythonu

Inference

  • Vyvozovat závěry o populaci
  • Popisné statistiky: Popis dat
  • Inference: Závěry a rozhodnutí
Datum Uzavření SP500 Denní změna
2017-08-07 2480.91 6.14
2017-08-08 2474.92 -5.99
2017-08-09 2474.02 -0.90
2017-08-10 2438.21 -35.81

Průměrný denní výkyv pro libovolné dny ~$9.14

Základy statistické inference v Pythonu

Proces statistické inference

Diagram znázorňující populaci vedoucí k vzorku, poté k inferenci a zpět k populaci.

Základy statistické inference v Pythonu

Bodové odhady

  • Vyjádřen jednou hodnotou
  • „Nejlepší odhad" neznámé statistiky populace

Bodový odhad: 1158,95 BTC denní výkyv

Prvních pět řádků datasetu Bitcoin

btc_high = btc_sp_df['High_BTC']
btc_low = btc_sp_df['Low_BTC']

np.mean(btc_high - btc_low)
1158.95
Základy statistické inference v Pythonu

Vzorkování

Bodové odhady závisí na vzorku

btc_sp_first100 = btc_sp_df.iloc[:100]

np.mean(btc_sp_first100['High_BTC'] - btc_sp_first100['Low_BTC'])
659.60
initial_row = np.random.choice(btc_sp_df.shape[0]-100)

btc_sp_random_100 = btc_sp_df.iloc[initial_row:initial_row+100]
np.mean(btc_sp_first100['High_BTC'] - btc_sp_first100['Low_BTC'])
943.83
Základy statistické inference v Pythonu

Pojďme cvičit!

Základy statistické inference v Pythonu

Preparing Video For Download...