イテレータで大きなファイルをメモリに読み込む

Python ツールボックス

Hugo Bowne-Anderson

Data Scientist at DataCamp

データをチャンクで読み込む

  • メモリに収まりきらないデータがある
  • 解決策: 分割して読み込む(chunk)
  • pandas 関数: read_csv()
    • チャンクを指定: chunksize
Python ツールボックス

データを反復処理する

import pandas as pd
result = []

for chunk in pd.read_csv('data.csv', chunksize=1000):
result.append(sum(chunk['x']))
total = sum(result)
print(total)
4252532
Python ツールボックス

データを反復処理する

import pandas as pd
total = 0

for chunk in pd.read_csv('data.csv', chunksize=1000): total += sum(chunk['x'])
print(total)
4252532
Python ツールボックス

演習に進みましょう!

Python ツールボックス

Preparing Video For Download...