En résumé

Mise à l'échelle et optimisation des pipelines de données avec Polars

Liam Brannigan

Data Scientist & Polars Contributor

Chapitre 1

Optimisation des requêtes

  • Comprendre comment Polars optimise les requêtes paresseuses en arrière-plan
  • Lire les plans de requête et profiler l'exécution
  • Exploiter les données triées et les raccourcis rapides pour réduire le travail
Mise à l'échelle et optimisation des pipelines de données avec Polars

Chapitre 2

Image de Polars ingérant plusieurs types de fichiers

  • Comparer CSV et Parquet et inspecter les métadonnées des fichiers
  • Contrôler la façon dont Polars balaie et écrit les données
  • Passer à des ensembles multifichiers, des partitions et des bases de données
Mise à l'échelle et optimisation des pipelines de données avec Polars

Chapitre 3

Schéma de données imbriquées transformées en tableau.

  • Travailler avec des colonnes liste et struct pour des données imbriquées
  • Utiliser des types catégoriels et enum pour des chaînes répétées
  • Estimer la taille du DataFrame et ajuster la précision numérique
Mise à l'échelle et optimisation des pipelines de données avec Polars

Chapitre 4

Image d'un grand tableau diffusé en continu.

  • Cibler les moteurs d'exécution par défaut, en diffusion continue et GPU
  • Traiter les résultats par lots et écrire les sorties sur disque
  • Tester les requêtes Polars pour des pipelines robustes et fiables
Mise à l'échelle et optimisation des pipelines de données avec Polars

Félicitations !

Mise à l'échelle et optimisation des pipelines de données avec Polars

Preparing Video For Download...