Abschluss

Skalieren und Optimieren von Data-Pipelines mit Polars

Liam Brannigan

Data Scientist & Polars Contributor

Kapitel 1

Abfrageoptimierung

  • Verstehen, wie Polars Lazy Queries intern optimiert
  • Query-Pläne lesen und die Ausführung profilieren
  • Sortierte Daten und Fast-Path-Operationen nutzen, um Arbeit zu sparen
Skalieren und Optimieren von Data-Pipelines mit Polars

Kapitel 2

Bild: Polars liest mehrere Dateitypen ein

  • CSV vs. Parquet vergleichen und Dateimetadaten prüfen
  • Steuern, wie Polars Daten scannt und schreibt
  • Skalieren auf Multifile-Datasets, partitionierte Layouts und Datenbanken
Skalieren und Optimieren von Data-Pipelines mit Polars

Kapitel 3

Diagramm: geschachtelte Daten zu Tabelle transformiert.

  • Mit List- und Struct-Spalten für geschachtelte Daten arbeiten
  • Kategorische und Enum-Typen für wiederholte Strings nutzen
  • DataFrame-Größe schätzen und numerische Präzision abstimmen
Skalieren und Optimieren von Data-Pipelines mit Polars

Kapitel 4

Bild: große Tabelle wird gestreamt.

  • Standard-, Streaming- und GPU-Engines gezielt einsetzen
  • Ergebnisse in Batches verarbeiten und auf Disk schreiben
  • Polars-Queries testen für robuste, verlässliche Pipelines
Skalieren und Optimieren von Data-Pipelines mit Polars

Glückwunsch!

Skalieren und Optimieren von Data-Pipelines mit Polars

Preparing Video For Download...