Grattis

Exploratory Data Analysis i Python

George Boorman

Curriculum Manager, DataCamp

Inspektion och validering

ett histogram över bokbetyg

books["year"] = books["year"].astype(int)
books.dtypes
name       object
author     object
rating    float64
year        int64
genre      object
dtype: object
Exploratory Data Analysis i Python

Aggregering

books.groupby("genre").agg(
    mean_rating=("rating", "mean"),
    std_rating=("rating", "std"),
    median_year=("year", "median")
)
|  genre      | mean_rating | std_rating | median_year |
|-------------|-------------|------------|-------------|
|   Childrens |    4.780000 |   0.122370 |      2015.0 |
|     Fiction |    4.570229 |   0.281123 |      2013.0 |
| Non Fiction |    4.598324 |   0.179411 |      2013.0 |
Exploratory Data Analysis i Python

Hantera saknade värden

print(salaries.isna().sum())
Working_Year            12
Designation             27
Experience              33
Employment_Status       31
Employee_Location       28
Company_Size            40
Remote_Working_Ratio    24
Salary_USD              60
dtype: int64
Exploratory Data Analysis i Python

Hantera saknade värden

  • Ta bort saknade värden

 

  • Imputera medelvärde, median, typvärde

 

  • Imputera per undergrupp

 

salaries_dict = salaries.groupby("Experience")["Salary_USD"].median().to_dict()
salaries["Salary_USD"] = salaries["Salary_USD"].fillna(salaries["Experience"].map(salaries_dict))
Exploratory Data Analysis i Python

Analysera kategoriska data

salaries["Job_Category"] = np.select(conditions, 
                                     job_categories, 
                                     default="Other")

Stapeldiagram som visar antal jobb per kategori

Exploratory Data Analysis i Python

Tillämpa lambdafunktioner

Tillämpa en lambdafunktion

salaries["std_dev"] = salaries.groupby("Experience")["Salary_USD"].transform(lambda x: x.std())
Exploratory Data Analysis i Python

Hantera extremvärden

sns.boxplot(data=salaries,
            y="Salary_USD")
plt.show()

Lådagram över löner för dataprofessionella, med 25:e percentilen längst ned, 50:e percentilen som mittlinje och 75:e percentilen längst upp

Exploratory Data Analysis i Python

Mönster över tid

sns.lineplot(data=divorce, x="marriage_month", y="marriage_duration")
plt.show()

Ett linjediagram som visar sambandet mellan äktenskapsmånad och äktenskapets längd

Exploratory Data Analysis i Python

Korrelation

sns.heatmap(divorce.corr(numeric_only=True), annot=True)
plt.show()

En värmekarta över skilsmässokorrelationer

Exploratory Data Analysis i Python

Fördelningar

sns.kdeplot(data=divorce, x="marriage_duration", hue="education_man", cut=0)
plt.show()

KDE-plot över äktenskapets längd med färgkodning efter education_man och cut satt till noll

Exploratory Data Analysis i Python

Korstabulering

pd.crosstab(planes["Source"], planes["Destination"],
            values=planes["Price"], aggfunc="median")
Destination  Banglore   Cochin   Delhi  Hyderabad  Kolkata  New Delhi
Source                                                               
Banglore          NaN      NaN  4823.0        NaN      NaN    10976.5
Chennai           NaN      NaN     NaN        NaN   3850.0        NaN
Delhi             NaN  10262.0     NaN        NaN      NaN        NaN
Kolkata        9345.0      NaN     NaN        NaN      NaN        NaN
Mumbai            NaN      NaN     NaN     3342.0      NaN        NaN
Exploratory Data Analysis i Python

pd.cut()

Ange intervallen

planes["Price_Category"] = pd.cut(planes["Price"],
                                  labels=labels,
                                  bins=bins)
Exploratory Data Analysis i Python

Datasnokning

Värmekarta med korrelationskoefficienter för olika antal mellanlandningar

Exploratory Data Analysis i Python

Formulera hypoteser

sns.barplot(data=planes, x="Airline", y="Duration")
plt.show()

Stapeldiagram över flygtid per flygbolag

Exploratory Data Analysis i Python

Nästa steg

Exploratory Data Analysis i Python

Grattis!

Exploratory Data Analysis i Python

Preparing Video For Download...