Effiziente Abfrageausführung

Skalieren und Optimieren von Data-Pipelines mit Polars

Liam Brannigan

Data Scientist & Polars Contributor

Lern deinen Instructor kennen

$$

$$

  • Liam Brannigan, Lead Data Scientist
  • ML- und Data-Engineering-Spezialist
  • Polars-Mitwirkender

Foto von Liam Brannigan – Kursleiter

Skalieren und Optimieren von Data-Pipelines mit Polars

Vom Laptop in die Cloud

Polars-Pipeline skaliert vom Laptop in die Cloud

Skalieren und Optimieren von Data-Pipelines mit Polars

Ist dieser Kurs was für dich?

Polars-Kursseiten

  • Eine Lazy-Query mit scan_csv erstellen
  • Ausdrücke mit filter, select und group_by schreiben
Skalieren und Optimieren von Data-Pipelines mit Polars

Kapitel 1 – Optimierung

Abfrageoptimierung

Skalieren und Optimieren von Data-Pipelines mit Polars

Kapitel 1 – Optimierung

Abfrageoptimierung

Skalieren und Optimieren von Data-Pipelines mit Polars

Kapitel 2 – effizientes I/O

Bild: Polars liest mehrere Dateitypen ein

Skalieren und Optimieren von Data-Pipelines mit Polars

Kapitel 3 – reichere Datentypen

Diagramm: Verschachtelte Daten in Tabelle umgewandelt.

Skalieren und Optimieren von Data-Pipelines mit Polars

Kapitel 4 – Pipelines skalieren

Bild: Große Tabelle wird gestreamt.

Skalieren und Optimieren von Data-Pipelines mit Polars

Chicago-Requests-Datensatz

Data-Analytics-Team des Bürgermeisters von Chicago

Skalieren und Optimieren von Data-Pipelines mit Polars

Datensatz untersuchen

requests = pl.scan_csv("311_Service_Requests.csv",try_parse_dates=True)

Ein riesiger Datensatz mit allen Service-Requests der Bürger Chicagos

Skalieren und Optimieren von Data-Pipelines mit Polars

Datensatz untersuchen

requests.collect()
Skalieren und Optimieren von Data-Pipelines mit Polars

Datensatz untersuchen

requests.collect().head(5)
shape: (5, 39)
| TYPE                          | STATUS    | DEPARTMENT     | CREATED_DATE        | ... |
| ---                           | ---       | ---            | ---                 | --- |
| str                           | str       | str            | str                 | ... |
|-------------------------------|-----------|----------------|---------------------|-----|
| Pothole in Street Complaint   | Completed | Transportation | 2019-12-16T10:09:08 | ... |
| Tree Trim Request             | Cancelled | Sanitation     | 2019-09-18T01:05:08 | ... |
| Garbage Cart Maintenance      | Completed | Sanitation     | 2021-01-24T09:14:58 | ... |
| Pothole in Street Complaint   | Completed | Transportation | 2019-03-21T10:41:01 | ... |
| Recycling Pick Up             | Completed | Sanitation     | 2021-02-16T08:28:59 | ... |
Skalieren und Optimieren von Data-Pipelines mit Polars

Verarbeitete Zeilen begrenzen

requests.head(5)
Skalieren und Optimieren von Data-Pipelines mit Polars

Verarbeitete Zeilen begrenzen

requests.head(5).collect()
shape: (5, 39)
| TYPE                            | STATUS    | DEPARTMENT     | CREATED_DATE        | ... |
| ---                             | ---       | ---            | ---                 | --- |
| str                             | str       | str            | str                 | ... |
|---------------------------------|-----------|----------------|---------------------|-----|
| Pothole in Street Complaint     | Completed | Transportation | 2019-12-16T10:09:08 | ... |
| Tree Trim Request | Completed | Sanitation     | 2019-09-18T01:05:08 | ... |
| Garbage Cart Maintenance        | Completed | Sanitation     | 2021-01-24T09:14:58 | ... |
| Pothole in Street Complaint     | Completed | Transportation | 2019-03-21T10:41:01 | ... |
| Recycling Pick Up               | Completed | Sanitation     | 2021-02-16T08:28:59 | ... |
  • collect später aufrufen
Skalieren und Optimieren von Data-Pipelines mit Polars

Abfrage: Zusammenfassung nach Department

completed_by_department


Skalieren und Optimieren von Data-Pipelines mit Polars

Abfrage: Zusammenfassung nach Department

completed_by_department = requests


Skalieren und Optimieren von Data-Pipelines mit Polars

Abfrage: Zusammenfassung nach Department

completed_by_department = requests.filter(
    pl.col("STATUS") == "Completed"
)
Skalieren und Optimieren von Data-Pipelines mit Polars

Abfrage: Zusammenfassung nach Department

completed_by_department = requests.filter(
    pl.col("STATUS") == "Completed"
).collect()
Skalieren und Optimieren von Data-Pipelines mit Polars

Abfrage: Zusammenfassung nach Department

completed_by_department = requests.filter(
    pl.col("STATUS") == "Completed"
).collect().group_by("DEPARTMENT").len()
Skalieren und Optimieren von Data-Pipelines mit Polars

Abfrage: Zusammenfassung nach Department

completed_by_department = requests.filter(
    pl.col("STATUS") == "Completed"
).group_by("DEPARTMENT").len().collect()
shape: (10, 2)
| DEPARTMENT                     | len     |
| ---                            | ---     |
| str                            | u32     |
|-------------------------------|---------|
| 311 City Services              | 4859161 |
| Sanitation                     | 3406631 |
| Aviation                       | 2337842 |
| CDOT - Department of Transport | 1468240 |
Skalieren und Optimieren von Data-Pipelines mit Polars

Auseinanderlaufende Abfragezweige

completed_by_department = requests.filter(
    pl.col("STATUS") == "Completed"
).group_by("DEPARTMENT").len()
completed_by_month = requests.filter(
    pl.col("STATUS") == "Completed"
).group_by("MONTH").len()
Skalieren und Optimieren von Data-Pipelines mit Polars

So läuft es heute im Team

completed_by_department.collect()
completed_by_month.collect()
Skalieren und Optimieren von Data-Pipelines mit Polars

Auseinanderlaufende Abfragen ausführen

results = pl.collect_all(


)
Skalieren und Optimieren von Data-Pipelines mit Polars

Auseinanderlaufende Abfragen ausführen

results = pl.collect_all([
    completed_by_department,
    completed_by_month,
])
Skalieren und Optimieren von Data-Pipelines mit Polars

Auseinanderlaufende Abfragen ausführen

results[0]  # completed_by_department
shape: (10, 2)
| DEPARTMENT           | len     |
| ---                  | ---     |
| str                  | u32     |
|----------------------|---------|
| 311 City Services    | 4859161 |
| Sanitation           | 3406631 |
| Aviation             | 2337842 |
| Transport            | 1468240 |
results[1]  # completed_by_month
shape: (12, 2)
| MONTH | len  |
| ---   | ---  |
| i64   | u32  |
|-------|------|
| 1     | 2506 |
| 2     | 4566 |
| 3     | 2739 |
| 4     | 2922 |
Skalieren und Optimieren von Data-Pipelines mit Polars

Lass uns üben!

Skalieren und Optimieren von Data-Pipelines mit Polars

Preparing Video For Download...