Riepilogo

Scalare e ottimizzare le pipeline di dati con Polars

Liam Brannigan

Data Scientist & Polars Contributor

Capitolo 1

Ottimizzazione delle query

  • Come Polars ottimizza le query lazy dietro le quinte
  • Leggere i piani di query e profilare l'esecuzione
  • Usare dati ordinati e fast‑path per ridurre il lavoro
Scalare e ottimizzare le pipeline di dati con Polars

Capitolo 2

Immagine di Polars che acquisisce più tipi di file

  • Confrontare CSV e Parquet e ispezionare i metadati
  • Controllare come Polars scansiona e scrive i dati
  • Scalare a dataset multifile, layout partizionati e database
Scalare e ottimizzare le pipeline di dati con Polars

Capitolo 3

Diagramma di dati annidati trasformati in tabella.

  • Lavorare con colonne list e struct per dati annidati
  • Usare tipi categorical ed enum per stringhe ripetute
  • Stimare la dimensione del DataFrame e regolare la precisione numerica
Scalare e ottimizzare le pipeline di dati con Polars

Capitolo 4

Immagine di una grande tabella in streaming.

  • Usare i motori di esecuzione default, streaming e GPU
  • Elaborare risultati a batch e scrivere output su disco
  • Testare le query Polars per pipeline robuste e affidabili
Scalare e ottimizzare le pipeline di dati con Polars

Complimenti!

Scalare e ottimizzare le pipeline di dati con Polars

Preparing Video For Download...