Введение в электронные таблицы

Эффективный импорт данных с pandas

Amany Mahfouz

Instructor

Электронные таблицы

  • Также известны как файлы Excel
  • Данные хранятся в табличном виде: ячейки расположены по строкам и столбцам
  • В отличие от плоских файлов, поддерживают форматирование и формулы
  • В одной рабочей книге может быть несколько листов
Эффективный импорт данных с pandas

Загрузка электронных таблиц

  • Для загрузки электронных таблиц в pandas есть отдельная функция: read_excel()

Снимок экрана с данными опроса FreeCodeCamp New Developer Survey в программе для работы с таблицами

Эффективный импорт данных с pandas

Загрузка электронных таблиц

import pandas as pd

# Read the Excel file
survey_data = pd.read_excel("fcc_survey.xlsx")

# View the first 5 lines of data print(survey_data.head())
    Age  AttendedBootcamp       ...                    SchoolMajor  StudentDebtOwe
0  28.0               0.0       ...                            NaN           20000
1  22.0               0.0       ...                            NaN             NaN
2  19.0               0.0       ...                            NaN             NaN
3  26.0               0.0       ...        Cinematography And Film            7000
4  20.0               0.0       ...                            NaN             NaN

[5 rows x 98 columns]
Эффективный импорт данных с pandas

Загрузка отдельных столбцов и строк

Таблица с данными опроса и строками метаданных в заголовке

Таблица счёта с несколькими небольшими таблицами данных

Эффективный импорт данных с pandas

Загрузка отдельных столбцов и строк

  • read_excel() имеет много общих именованных аргументов с read_csv()
    • nrows: ограничивает число загружаемых строк
    • skiprows: задаёт количество или номера пропускаемых строк
    • usecols: выбирает столбцы по имени, позиции или букве (например, "A:P")
Эффективный импорт данных с pandas

Загрузка отдельных столбцов и строк

Эффективный импорт данных с pandas

Загрузка отдельных столбцов и строк

# Read columns W-AB and AR of file, skipping metadata header
survey_data = pd.read_excel("fcc_survey_with_headers.xlsx",
                            skiprows=2,
                            usecols="W:AB, AR")

# View data print(survey_data.head())
   CommuteTime            CountryCitizen  ...    EmploymentFieldOther    EmploymentStatus   Income
0         35.0  United States of America  ...                     NaN  Employed for wages  32000.0
1         90.0  United States of America  ...                     NaN  Employed for wages  15000.0
2         45.0  United States of America  ...                     NaN  Employed for wages  48000.0
3         45.0  United States of America  ...                     NaN  Employed for wages  43000.0
4         10.0  United States of America  ...                     NaN  Employed for wages   6000.0

[5 rows x 7 columns]
Эффективный импорт данных с pandas

Давайте потренируемся!

Эффективный импорт данных с pandas

Preparing Video For Download...