Distribuzioni per categoria con seaborn

Importing and Managing Financial Data in Python

Stefan Jansen

Instructor

Distribuzioni per categoria

  • Ultimo segmento: statistiche riassuntive
  • Numero di osservazioni, media per categoria
  • Ora: visualizza la distribuzione di una variabile per livelli di una variabile categoriale per confrontare meglio
  • Esempio: distribuzione della Market Cap per settore o anno di IPO
  • Più dettaglio delle statistiche riassuntive
Importing and Managing Financial Data in Python

Pulire i dati: rimuovere outlier

nasdaq = pd.read_excel('listings.xlsx', sheet_name='nasdaq', 
                        na_values='n/a')
nasdaq['market_cap_m'] = nasdaq['Market Capitalization'].div(1e6)

nasdaq = nasdaq[nasdaq.market_cap_m > 0] # Active companies only
outliers = nasdaq.market_cap_m.quantile(.9) # Outlier threshold
nasdaq = nasdaq[nasdaq.market_cap_m < outliers] # Remove outliers
Importing and Managing Financial Data in Python

Boxplot: quartili e outlier

import seaborn as sns
sns.boxplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75);

Quartili e outlier

Importing and Managing Financial Data in Python

Una variante: SwarmPlot

sns.swarmplot(x='Sector', y='market_cap_m', data=nasdaq)
plt.xticks(rotation=75)
plt.show()

Swarmplot

Importing and Managing Financial Data in Python

Ayo berlatih!

Importing and Managing Financial Data in Python

Preparing Video For Download...