Оптимізоване завантаження даних із pandas
Amany Mahfouz
Instructor
read_excel() типово завантажує перший аркуш файлу Excelsheet_nameread_excel() застосовуються до всіх зчитаних аркушів
# Отримати другий аркуш за індексом позиції survey_data_sheet2 = pd.read_excel('fcc_survey.xlsx', sheet_name=1)# Отримати другий аркуш за назвою survey_data_2017 = pd.read_excel('fcc_survey.xlsx', sheet_name='2017')print(survey_data_sheet2.equals(survey_data_2017))
True
sheet_name=None у read_excel() зчитує всі аркуші у книзіsurvey_responses = pd.read_excel("fcc_survey.xlsx", sheet_name=None)
print(type(survey_responses))
<class 'collections.OrderedDict'>
for key, value in survey_responses.items():
print(key, type(value))
2016 <class 'pandas.core.frame.DataFrame'>
2017 <class 'pandas.core.frame.DataFrame'>
# Створити порожній датафрейм для всіх завантажених аркушів all_responses = pd.DataFrame()# Ітеруватися по датафреймах у словнику for sheet_name, frame in survey_responses.items(): # Додати стовпець, щоб знати, за який це рік frame["Year"] = sheet_name# Додати датафрейм до all_responses all_responses = pd.concat([all_responses, frame])# Переглянути роки в даних print(all_responses.Year.unique())
['2016' '2017']
Оптимізоване завантаження даних із pandas