Sammanfattning

Skalning och optimering av datapipelines med Polars

Liam Brannigan

Data Scientist & Polars Contributor

Kapitel 1

Frågeoptimerng

  • Förstå hur Polars optimerar lata frågor i bakgrunden
  • Läsa frågeplaner och profilera körning
  • Använda sorterad data och snabbvägsoperationer för att minska arbete
Skalning och optimering av datapipelines med Polars

Kapitel 2

Bild av Polars som läser in flera filtyper

  • Jämföra CSV och Parquet samt granska filmetadata
  • Styra hur Polars skannar och skriver data
  • Skala till flerfilsdatamängder, partitionerade strukturer och databaser
Skalning och optimering av datapipelines med Polars

Kapitel 3

Diagram över nästlad data omvandlad till en tabell.

  • Arbeta med list- och struct-kolumner för nästlad data
  • Använda kategoriska typer och enumtyper för upprepade strängar
  • Uppskatta DataFrame-storlek och justera numerisk precision
Skalning och optimering av datapipelines med Polars

Kapitel 4

Bild av en stor tabell som strömmas.

  • Använda standard-, streaming- och GPU-körningsmiljöer
  • Bearbeta resultat i batchar och skriva utdata till disk
  • Testa Polars-frågor för robusta och tillförlitliga pipelines
Skalning och optimering av datapipelines med Polars

Grattis!

Skalning och optimering av datapipelines med Polars

Preparing Video For Download...