按类别的分布(seaborn)

在 Python 中导入与管理金融数据

Stefan Jansen

Instructor

按类别的分布

  • 上一节:汇总统计
  • 每类观测数与均值
  • 现在:按分类变量的水平可视化某变量分布,便于比较
  • 例:按行业或上市年份的市值分布
  • 比汇总统计更细致
在 Python 中导入与管理金融数据

清洗数据:去除离群值

nasdaq = pd.read_excel('listings.xlsx', sheet_name='nasdaq', 
                        na_values='n/a')
nasdaq['market_cap_m'] = nasdaq['Market Capitalization'].div(1e6)

nasdaq = nasdaq[nasdaq.market_cap_m > 0] # Active companies only
outliers = nasdaq.market_cap_m.quantile(.9) # Outlier threshold
nasdaq = nasdaq[nasdaq.market_cap_m < outliers] # Remove outliers
在 Python 中导入与管理金融数据

箱线图:四分位与离群值

import seaborn as sns
sns.boxplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75);

四分位数示意图

在 Python 中导入与管理金融数据

变体:SwarmPlot 蜂群图

sns.swarmplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75)
plt.show()

swarmplot.png

在 Python 中导入与管理金融数据

让我们来练习!

在 Python 中导入与管理金融数据

Preparing Video For Download...