pandasで効率よくデータを取り込む
Amany Mahfouz
Instructor
parse_dates 引数で指定する(dtype ではない)parse_dates は次を受け付ける:



# 解析する日付列を指定 date_cols = ["Part1StartTime", "Part1EndTime"]# 標準的な日時列を解析して読み込む survey_df = pd.read_excel("fcc_survey.xlsx", parse_dates=date_cols)
# タイムスタンプ列のデータ型を確認
print(survey_df[["Part1StartTime",
"Part1EndTime",
"Part2StartDate",
"Part2StartTime",
"Part2EndTime"]].dtypes)
Part1StartTime datetime64[ns]
Part1EndTime datetime64[ns]
Part2StartDate object
Part2StartTime object
Part2EndTime object
dtype: object
# 解析する日付列を指定 date_cols = ["Part1StartTime", "Part1EndTime",[["Part2StartDate", "Part2StartTime"]]]# 標準および分割された日時列を解析して読み込む survey_df = pd.read_excel("fcc_survey.xlsx", parse_dates=date_cols)print(survey_df.head(3))
Part2StartDate_Part2StartTime Age ... SchoolMajor StudentDebtOwe
0 2016-03-29 21:24:57 28.0 ... NaN 20000
1 2016-03-29 21:27:14 22.0 ... NaN NaN
2 2016-03-29 21:27:13 19.0 ... NaN NaN
[3 rows x 98 columns]
# 解析する日付列を指定 date_cols = {"Part1Start": "Part1StartTime", "Part1End": "Part1EndTime", "Part2Start": ["Part2StartDate", "Part2StartTime"]}# 標準および分割された日時列を解析して読み込む survey_df = pd.read_excel("fcc_survey.xlsx", parse_dates=date_cols) print(survey_df.Part2Start.head(3))
0 2016-03-29 21:24:57
1 2016-03-29 21:27:14
2 2016-03-29 21:27:13
Name: Part2Start, dtype: datetime64[ns]
parse_dates は非標準の日時形式には対応しないpd.to_datetime() を使うto_datetime() の主な引数:format: 日時形式の文字列| Code | 意味 | 例 |
|---|---|---|
%Y |
年(4桁) | 1999 |
%m |
月(ゼロ埋め) | 03 |
%d |
日(ゼロ埋め) | 01 |
%H |
時(24時間) | 21 |
%M |
分(ゼロ埋め) | 09 |
%S |
秒(ゼロ埋め) | 05 |

format_string = "%m%d%Y %H:%M:%S"survey_df["Part2EndTime"] = pd.to_datetime(survey_df["Part2EndTime"], format=format_string)
print(survey_df.Part2EndTime.head())
0 2016-03-29 21:27:25
1 2016-03-29 21:29:10
2 2016-03-29 21:28:21
3 2016-03-29 21:30:51
4 2016-03-29 21:31:54
Name: Part2EndTime, dtype: datetime64[ns]
pandasで効率よくデータを取り込む