seabornでカテゴリ別の分布

Pythonでの金融データのインポートと管理

Stefan Jansen

Instructor

カテゴリ別の分布

  • 前のセグメント:要約統計
  • 観測数、カテゴリ別平均
  • 次:カテゴリ変数の水準ごとに分布を可視化し、比較を容易にする
  • 例:セクター別やIPO年別の時価総額の分布
  • 要約統計より詳細
Pythonでの金融データのインポートと管理

データ整備:外れ値の除去

nasdaq = pd.read_excel('listings.xlsx', sheet_name='nasdaq', 
                        na_values='n/a')
nasdaq['market_cap_m'] = nasdaq['Market Capitalization'].div(1e6)

nasdaq = nasdaq[nasdaq.market_cap_m > 0] # Active companies only
outliers = nasdaq.market_cap_m.quantile(.9) # Outlier threshold
nasdaq = nasdaq[nasdaq.market_cap_m < outliers] # Remove outliers
Pythonでの金融データのインポートと管理

箱ひげ図:四分位と外れ値

import seaborn as sns
sns.boxplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75);

四分位数の図

Pythonでの金融データのインポートと管理

応用:SwarmPlot

sns.swarmplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75)
plt.show()

スウォームプロット

Pythonでの金融データのインポートと管理

演習に進みましょう

Pythonでの金融データのインポートと管理

Preparing Video For Download...