Fördelningar per kategori med seaborn

Importera och hantera finansiell data i Python

Stefan Jansen

Instructor

Fördelningar per kategori

  • Förra avsnittet: Sammanfattande statistik
  • Antal observationer, medelvärde per kategori
  • Nu: Visualisera fördelningen av en variabel per nivå i en kategorisk variabel för enklare jämförelse
  • Exempel: Fördelning av börsvärde per sektor eller IPO-år
  • Mer detaljer än sammanfattande statistik
Importera och hantera finansiell data i Python

Rensa data: ta bort extremvärden

nasdaq = pd.read_excel('listings.xlsx', sheet_name='nasdaq', 
                        na_values='n/a')
nasdaq['market_cap_m'] = nasdaq['Market Capitalization'].div(1e6)

nasdaq = nasdaq[nasdaq.market_cap_m > 0] # Active companies only
outliers = nasdaq.market_cap_m.quantile(.9) # Outlier threshold
nasdaq = nasdaq[nasdaq.market_cap_m < outliers] # Remove outliers
Importera och hantera finansiell data i Python

Lådagram: kvartiler och extremvärden

import seaborn as sns
sns.boxplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75);

quartiles.png

Importera och hantera finansiell data i Python

En variant: SwarmPlot

sns.swarmplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75)
plt.show()

swarmplot.png

Importera och hantera finansiell data i Python

Nu kör vi en övning!

Importera och hantera finansiell data i Python

Preparing Video For Download...