Shrnutí

Scaling and Optimizing Data Pipelines with Polars

Liam Brannigan

Data Scientist & Polars Contributor

Kapitola 1

Optimalizace dotazů

  • Jak Polars optimalizuje líné dotazy na pozadí
  • Čtení plánů dotazů a profilování provádění
  • Využití seřazených dat a rychlých operací ke snížení zátěže
Scaling and Optimizing Data Pipelines with Polars

Kapitola 2

Polars načítající různé typy souborů

  • Porovnání CSV a Parquet a kontrola metadat souborů
  • Řízení způsobu, jakým Polars čte a zapisuje data
  • Práce s více soubory, rozdělenými strukturami a databázemi
Scaling and Optimizing Data Pipelines with Polars

Kapitola 3

Diagram vnořených dat transformovaných do tabulky.

  • Práce se sloupci list a struct pro vnořená data
  • Použití kategorických typů a výčtů pro opakující se řetězce
  • Odhad velikosti DataFrame a úprava číselné přesnosti
Scaling and Optimizing Data Pipelines with Polars

Kapitola 4

Obraz velké tabulky zpracovávané streamováním.

  • Výběr výchozího, streamovacího a GPU prováděcího enginu
  • Zpracování výsledků po dávkách a ukládání výstupů na disk
  • Testování dotazů Polars pro spolehlivé a robustní pipeline
Scaling and Optimizing Data Pipelines with Polars

Gratulujeme!

Scaling and Optimizing Data Pipelines with Polars

Preparing Video For Download...