Podsumowanie

Skalowanie i optymalizacja potoków danych w Polars

Liam Brannigan

Data Scientist & Polars Contributor

Rozdział 1

Optymalizacja zapytań

  • Jak Polars optymalizuje zapytania leniwe w tle
  • Odczytywanie planów zapytań i profilowanie wykonania
  • Używanie posortowanych danych i szybkich ścieżek, aby ograniczyć liczbę operacji
Skalowanie i optymalizacja potoków danych w Polars

Rozdział 2

Polars wczytujący różne typy plików

  • Porównanie CSV i Parquet oraz inspekcja metadanych plików
  • Kontrolowanie sposobu skanowania i zapisu danych w Polars
  • Skalowanie do zbiorów wielu plików, układów partycjonowanych i baz danych
Skalowanie i optymalizacja potoków danych w Polars

Rozdział 3

Diagram zagnieżdżonych danych przekształconych w tabelę.

  • Praca z kolumnami list i struktur dla danych zagnieżdżonych
  • Używanie typów kategorycznych i wyliczeniowych dla powtarzających się ciągów znaków
  • Szacowanie rozmiaru DataFrame i dostrajanie precyzji numerycznej
Skalowanie i optymalizacja potoków danych w Polars

Rozdział 4

Obraz dużej tabeli przetwarzanej strumieniowo.

  • Wybór silnika wykonania: domyślny, strumieniowy i GPU
  • Przetwarzanie wyników partiami i zapis wyników na dysk
  • Testowanie zapytań Polars pod kątem niezawodnych potoków danych
Skalowanie i optymalizacja potoków danych w Polars

Gratulacje!

Skalowanie i optymalizacja potoków danych w Polars

Preparing Video For Download...