Introducere în foi de calcul

Ingestie eficientă a datelor cu pandas

Amany Mahfouz

Instructor

Foi de calcul

  • Cunoscute și ca fișiere Excel
  • Datele sunt stocate tabelar, cu celule dispuse în rânduri și coloane
  • Spre deosebire de fișierele plate, pot conține formatări și formule
  • Un registru de lucru poate conține mai multe foi de calcul
Ingestie eficientă a datelor cu pandas

Încărcarea foilor de calcul

  • Foile de calcul au propria funcție de încărcare în pandas: read_excel()

Captură de ecran a datelor din sondajul pentru dezvoltatori FreeCodeCamp într-un program de calcul tabelar

Ingestie eficientă a datelor cu pandas

Încărcarea foilor de calcul

import pandas as pd

# Read the Excel file
survey_data = pd.read_excel("fcc_survey.xlsx")

# View the first 5 lines of data print(survey_data.head())
    Age  AttendedBootcamp       ...                    SchoolMajor  StudentDebtOwe
0  28.0               0.0       ...                            NaN           20000
1  22.0               0.0       ...                            NaN             NaN
2  19.0               0.0       ...                            NaN             NaN
3  26.0               0.0       ...        Cinematography And Film            7000
4  20.0               0.0       ...                            NaN             NaN

[5 rows x 98 columns]
Ingestie eficientă a datelor cu pandas

Încărcarea coloanelor și rândurilor selectate

Foaie de calcul cu date din sondaj și rânduri de antet cu metadate

Foaie de calcul factură cu mai multe tabele mici de date

Ingestie eficientă a datelor cu pandas

Încărcarea coloanelor și rândurilor selectate

  • read_excel() are mulți parametri comuni cu read_csv()
    • nrows: limitează numărul de rânduri încărcate
    • skiprows: specifică numărul de rânduri sau indicii rândurilor de omis
    • usecols: selectează coloane după nume, număr pozițional sau literă (ex. "A:P")
Ingestie eficientă a datelor cu pandas

Încărcarea coloanelor și rândurilor selectate

Ingestie eficientă a datelor cu pandas

Încărcarea coloanelor și rândurilor selectate

# Read columns W-AB and AR of file, skipping metadata header
survey_data = pd.read_excel("fcc_survey_with_headers.xlsx",
                            skiprows=2,
                            usecols="W:AB, AR")

# View data print(survey_data.head())
   CommuteTime            CountryCitizen  ...    EmploymentFieldOther    EmploymentStatus   Income
0         35.0  United States of America  ...                     NaN  Employed for wages  32000.0
1         90.0  United States of America  ...                     NaN  Employed for wages  15000.0
2         45.0  United States of America  ...                     NaN  Employed for wages  48000.0
3         45.0  United States of America  ...                     NaN  Employed for wages  43000.0
4         10.0  United States of America  ...                     NaN  Employed for wages   6000.0

[5 rows x 7 columns]
Ingestie eficientă a datelor cu pandas

Să exersăm!

Ingestie eficientă a datelor cu pandas

Preparing Video For Download...