Rozkłady według kategorii z seaborn

Importowanie i zarządzanie danymi finansowymi w Pythonie

Stefan Jansen

Instructor

Rozkłady według kategorii

  • Poprzedni segment: Statystyki opisowe
  • Liczba obserwacji, średnia według kategorii
  • Teraz: Wizualizacja rozkładu zmiennej według poziomów zmiennej kategorycznej
  • Przykład: Rozkład kapitalizacji rynkowej według sektora lub roku IPO
  • Więcej szczegółów niż statystyki opisowe
Importowanie i zarządzanie danymi finansowymi w Pythonie

Czyszczenie danych: usuwanie wartości odstających

nasdaq = pd.read_excel('listings.xlsx', sheet_name='nasdaq', 
                        na_values='n/a')
nasdaq['market_cap_m'] = nasdaq['Market Capitalization'].div(1e6)

nasdaq = nasdaq[nasdaq.market_cap_m > 0] # Active companies only
outliers = nasdaq.market_cap_m.quantile(.9) # Outlier threshold
nasdaq = nasdaq[nasdaq.market_cap_m < outliers] # Remove outliers
Importowanie i zarządzanie danymi finansowymi w Pythonie

Wykres pudełkowy: kwartyle i wartości odstające

import seaborn as sns
sns.boxplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75);

Kwartyle.png

Importowanie i zarządzanie danymi finansowymi w Pythonie

Wariant: SwarmPlot

sns.swarmplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75)
plt.show()

Wykres SwarmPlot.png

Importowanie i zarządzanie danymi finansowymi w Pythonie

Czas na ćwiczenia!

Importowanie i zarządzanie danymi finansowymi w Pythonie

Preparing Video For Download...