Introduction aux chiffriers

Ingestion de données rationalisée avec pandas

Amany Mahfouz

Instructor

Chiffriers

  • Aussi appelés fichiers Excel
  • Données tabulaires, avec des cellules en lignes et colonnes
  • Contrairement aux fichiers plats, peuvent avoir du formatage et des formules
  • Plusieurs feuilles peuvent exister dans un classeur
Ingestion de données rationalisée avec pandas

Charger des chiffriers

  • Les chiffriers ont leur propre fonction de chargement dans pandas : read_excel()

Capture d'écran des données de l'enquête New Developer de FreeCodeCamp dans un logiciel de chiffrier

Ingestion de données rationalisée avec pandas

Charger des chiffriers

import pandas as pd

# Read the Excel file
survey_data = pd.read_excel("fcc_survey.xlsx")

# View the first 5 lines of data print(survey_data.head())
    Age  AttendedBootcamp       ...                    SchoolMajor  StudentDebtOwe
0  28.0               0.0       ...                            NaN           20000
1  22.0               0.0       ...                            NaN             NaN
2  19.0               0.0       ...                            NaN             NaN
3  26.0               0.0       ...        Cinematography And Film            7000
4  20.0               0.0       ...                            NaN             NaN

[5 rows x 98 columns]
Ingestion de données rationalisée avec pandas

Charger des colonnes et lignes choisies

Feuille d'enquête avec des lignes d'en-tête de métadonnées

Feuille de facture avec plusieurs petits tableaux de données

Ingestion de données rationalisée avec pandas

Charger des colonnes et lignes choisies

  • read_excel() partage plusieurs paramètres avec read_csv()
    • nrows : limite le nombre de lignes à charger
    • skiprows : nombre ou numéros de lignes à ignorer
    • usecols : choisir des colonnes par nom, position ou lettre (p. ex. « A:P »)
Ingestion de données rationalisée avec pandas

Charger des colonnes et lignes choisies

Ingestion de données rationalisée avec pandas

Charger des colonnes et lignes choisies

# Read columns W-AB and AR of file, skipping metadata header
survey_data = pd.read_excel("fcc_survey_with_headers.xlsx",
                            skiprows=2,
                            usecols="W:AB, AR")

# View data print(survey_data.head())
   CommuteTime            CountryCitizen  ...    EmploymentFieldOther    EmploymentStatus   Income
0         35.0  United States of America  ...                     NaN  Employed for wages  32000.0
1         90.0  United States of America  ...                     NaN  Employed for wages  15000.0
2         45.0  United States of America  ...                     NaN  Employed for wages  48000.0
3         45.0  United States of America  ...                     NaN  Employed for wages  43000.0
4         10.0  United States of America  ...                     NaN  Employed for wages   6000.0

[5 rows x 7 columns]
Ingestion de données rationalisée avec pandas

Passons à la pratique !

Ingestion de données rationalisée avec pandas

Preparing Video For Download...