Arbeiten mit Datenbanken

Skalieren und Optimieren von Data-Pipelines mit Polars

Liam Brannigan

Data Scientist & Polars Contributor

Datenbank aus Polars abfragen

Konzeptgrafik: Polars sendet eine SQL-Abfrage und eine URI an eine Datenbank.

Skalieren und Optimieren von Data-Pipelines mit Polars

Datenbank aus Polars abfragen

Konzeptgrafik: Polars sendet eine SQL-Abfrage an eine Datenbank und erhält eine Ergebnistabelle über eine Datenbank-Engine.

Skalieren und Optimieren von Data-Pipelines mit Polars

Datenbanken, die Polars abfragen kann

Datenbanken, mit denen Polars arbeiten kann

  • Eingebettet → läuft lokal, kein Server
  • DuckDBanalytische Datenbank
Skalieren und Optimieren von Data-Pipelines mit Polars

Tabelle der Baugenehmigungen

SELECT *
FROM building_permits
LIMIT 5
shape: (5, 5)
| issue_date | permit_type | review_type | street_name  | work_description             |
| ---        | ---         | ---         | ---          | ---                          |
| date       | str         | str         | str          | str                          |
|------------|-------------|-------------|--------------|------------------------------|
| 2026-04-30 | Signs       | SIGN PERMIT | CLARK ST     | Wall sign install            |
| 2026-04-28 | Renovation  | SELF CERT   | OAKLEY AVE   | Add dormer to 8-unit roof    |
| 2026-03-21 | Easy Permit | EASY PERMIT | SEMINARY AVE | Parapet masonry repair       |
| 2026-03-11 | Easy Permit | EASY PERMIT | RHODES AVE   | Rebuild south chimney side   |
| 2026-03-03 | Easy Permit | EASY PERMIT | GIDDINGS ST  | Porch lintel + tuckpointing  |
Skalieren und Optimieren von Data-Pipelines mit Polars

Verbindungs-URI

import polars as pl

uri = "postgresql://analyst:[email protected]:5432/buildings"
  • Protokoll postgresql://
  • Benutzername und Passwort analyst:secret
  • Host und Port data.chicago.org:5432
  • Datenbankname buildings
Skalieren und Optimieren von Data-Pipelines mit Polars

Abfrage einer Datenbank

query = """
    SELECT issue_date, permit_type
    FROM building_permits
    WHERE issue_date >= DATE '2026-01-01'
"""







Skalieren und Optimieren von Data-Pipelines mit Polars

Abfrage einer Datenbank

query = """
    SELECT issue_date, permit_type
    FROM building_permits
    WHERE issue_date >= DATE '2026-01-01'
"""

permit_counts = (
    pl.read_database_uri(query=query, uri=uri)



)
Skalieren und Optimieren von Data-Pipelines mit Polars

Abfrage einer Datenbank

query = """
    SELECT issue_date, permit_type
    FROM building_permits
    WHERE issue_date >= DATE '2026-01-01'
"""

permit_counts = (
    pl.read_database_uri(query=query, uri=uri)
    .group_by("permit_type")
    .len()
    .sort("len", descending=True)
)
Skalieren und Optimieren von Data-Pipelines mit Polars

Gruppierte Genehmigungsanzahl

permit_counts
shape: (3, 2)
| permit_type                     | len |
| ---                             | --- |
| str                             | u32 |
|---------------------------------|-----|
| Easy Permit                     | 58  |
| New Construction                | 14  |
| Renovation                      | 11  |
Skalieren und Optimieren von Data-Pipelines mit Polars

Wähle die Engine

pl.read_database_uri(
    query=query,
    uri=uri,
    engine="connectorx",
)
  • Mehr unterstützte Datenbanken
pl.read_database_uri(
    query=query,
    uri=uri,
    engine="adbc",
)
  • Schneller für unterstützte Datenbanken
1 https://arrow.apache.org/adbc/current/driver/status.html
Skalieren und Optimieren von Data-Pipelines mit Polars

Zurück in die Datenbank schreiben

permit_counts.write_database(



)
Skalieren und Optimieren von Data-Pipelines mit Polars

Zurück in die Datenbank schreiben

permit_counts.write_database(
    table_name="permit_type_summary",
    connection=uri,

)
Skalieren und Optimieren von Data-Pipelines mit Polars

Zurück in die Datenbank schreiben

permit_counts.write_database(
    table_name="permit_type_summary",
    connection=uri,
    if_table_exists="replace",
)
  • append
  • fail
Skalieren und Optimieren von Data-Pipelines mit Polars

DuckDB-Integration

import duckdb

db = duckdb.connect("permits.duckdb")


$$

  • DuckDBeingebaute Polars-Ausgabe
Skalieren und Optimieren von Data-Pipelines mit Polars

DuckDB-Integration

import duckdb

db = duckdb.connect("permits.duckdb")

result = db.sql("SELECT * FROM permit_type_summary").pl()
shape: (3, 2)
| permit_type                     | len |
| ---                             | --- |
| str                             | u32 |
|---------------------------------|-----|
| Easy Permit                     | 58  |
| New Construction                | 14  |
| Renovation                      | 11  |
Skalieren und Optimieren von Data-Pipelines mit Polars

Lass uns üben!

Skalieren und Optimieren von Data-Pipelines mit Polars

Preparing Video For Download...