Распределения по категориям с seaborn

Импорт и управление финансовыми данными в Python

Stefan Jansen

Instructor

Распределения по категориям

  • Прошлый раздел: сводная статистика
  • Число наблюдений, среднее по категориям
  • Теперь: визуализация распределения переменной по уровням категориальной переменной для сравнения
  • Пример: распределение рыночной капитализации по секторам или году IPO
  • Больше деталей, чем в сводной статистике
Импорт и управление финансовыми данными в Python

Очистка данных: удаление выбросов

nasdaq = pd.read_excel('listings.xlsx', sheet_name='nasdaq', 
                        na_values='n/a')
nasdaq['market_cap_m'] = nasdaq['Market Capitalization'].div(1e6)

nasdaq = nasdaq[nasdaq.market_cap_m > 0] # Active companies only
outliers = nasdaq.market_cap_m.quantile(.9) # Outlier threshold
nasdaq = nasdaq[nasdaq.market_cap_m < outliers] # Remove outliers
Импорт и управление финансовыми данными в Python

Boxplot: квартили и выбросы

import seaborn as sns
sns.boxplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75);

quartiles.png

Импорт и управление финансовыми данными в Python

Вариант: SwarmPlot

sns.swarmplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75)
plt.show()

swarmplot.png

Импорт и управление финансовыми данными в Python

Давайте потренируемся!

Импорт и управление финансовыми данными в Python

Preparing Video For Download...