記述統計でデータを要約する

Pythonでの金融データのインポートと管理

Stefan Jansen

Instructor

データを把握する

  • 目的: 主要な量的特徴を把握する
  • 観点:
    • 代表値: どの値が「典型的」か
    • 散らばり: 外れ値はあるか
    • 各変数の分布全体
Pythonでの金融データのインポートと管理

代表値

  • 平均: $\displaystyle \bar{x} = \frac{1}{n}\sum_{i=1}^n x_i$
  • 中央値: 値の50%が小/大
  • 最頻値: 最も頻出する値

対称分布

Pythonでの金融データのインポートと管理

代表値

  • 平均: $\displaystyle \bar{x} = \frac{1}{n}\sum_{i=1}^n x_i$
  • 中央値: 値の50%が小/大
  • 最頻値: 最も頻出する値

歪んだ分布

Pythonでの金融データのインポートと管理

代表値

  • 平均: $\displaystyle \bar{x} = \frac{1}{n}\sum_{i=1}^n x_i$
  • 中央値: 値の50%が小/大
  • 最頻値: 最も頻出する値

二峰性分布

Pythonでの金融データのインポートと管理

要約統計量を計算する

nasdaq = pd.read_excel('listings.xlsx', sheet_name='nasdaq', na_values='n/a')
market_cap = nasdaq['Market Capitalization'].div(10**6)
market_cap.mean()
3180.7126214953805
market_cap.median()
225.9684285
market_cap.mode()
0.0
Pythonでの金融データのインポートと管理

要約統計量を計算する

時価総額のヒストグラム

Pythonでの金融データのインポートと管理

散らばり

  • 分散: 平均からの二乗偏差の合計を $n-1$ で割る
    • $\displaystyle var = \frac{1}{n-1}\sum_{i=1}^n(x_i-\bar{x})^2$
  • 標準偏差: 分散の平方根
    • $\displaystyle sd = \sqrt{var}$

時価総額の分散イメージ

Pythonでの金融データのインポートと管理

分散と標準偏差を計算する

variance = market_cap.var()
print(variance)
648773812.8182
np.sqrt(variance)
25471.0387
market_cap.std()
25471.0387
Pythonでの金融データのインポートと管理

Let's practice!

Pythonでの金融データのインポートと管理

Preparing Video For Download...