Utiliser des itérateurs pour charger de gros fichiers en mémoire

Boîte à outils Python

Hugo Bowne-Anderson

Data Scientist at DataCamp

Charger des données par blocs

  • Trop de données pour tenir en mémoire
  • Solution : charger par blocs !
  • Fonction pandas : read_csv()
    • Spécifier le bloc : chunksize
Boîte à outils Python

Itérer sur des données

import pandas as pd
result = []

for chunk in pd.read_csv('data.csv', chunksize=1000):
result.append(sum(chunk['x']))
total = sum(result)
print(total)
4252532
Boîte à outils Python

Itérer sur des données

import pandas as pd
total = 0

for chunk in pd.read_csv('data.csv', chunksize=1000): total += sum(chunk['x'])
print(total)
4252532
Boîte à outils Python

Passons à la pratique !

Boîte à outils Python

Preparing Video For Download...