効果的なクエリ実行

Polars によるデータパイプラインのスケーリングと最適化

Liam Brannigan

Data Scientist & Polars Contributor

講師紹介

$$

$$

  • Liam Brannigan、リードデータサイエンティスト
  • ML・データエンジニアリング専門家
  • Polarsコントリビューター

本コースの講師 Liam Brannigan の写真

Polars によるデータパイプラインのスケーリングと最適化

ラップトップからクラウドへ

ラップトップからクラウドへスケールするPolarsパイプライン

Polars によるデータパイプラインのスケーリングと最適化

このコースは適していますか?

Polarsコースのページ

  • scan_csvを使ったレイジークエリの作成
  • filterselectgroup_byを使った式の記述
Polars によるデータパイプラインのスケーリングと最適化

第1章 - 最適化

クエリ最適化

Polars によるデータパイプラインのスケーリングと最適化

第1章 - 最適化

クエリ最適化

Polars によるデータパイプラインのスケーリングと最適化

第2章 - 効果的なI/O

複数のファイル形式を取り込むPolarsのイメージ

Polars によるデータパイプラインのスケーリングと最適化

第3章 - より豊富なデータ型

ネストデータをテーブルに変換する図

Polars によるデータパイプラインのスケーリングと最適化

第4章 - パイプラインのスケーリング

大規模テーブルのストリーミングイメージ

Polars によるデータパイプラインのスケーリングと最適化

シカゴのリクエストデータセット

シカゴ市長のデータ分析チーム

Polars によるデータパイプラインのスケーリングと最適化

データセットの確認

requests = pl.scan_csv("311_Service_Requests.csv",try_parse_dates=True)

シカゴ市民のすべてのサービスリクエストを記録した大規模データセット

Polars によるデータパイプラインのスケーリングと最適化

データセットの確認

requests.collect()
Polars によるデータパイプラインのスケーリングと最適化

データセットの確認

requests.collect().head(5)
shape: (5, 39)
| TYPE                          | STATUS    | DEPARTMENT     | CREATED_DATE        | ... |
| ---                           | ---       | ---            | ---                 | --- |
| str                           | str       | str            | str                 | ... |
|-------------------------------|-----------|----------------|---------------------|-----|
| Pothole in Street Complaint   | Completed | Transportation | 2019-12-16T10:09:08 | ... |
| Tree Trim Request             | Cancelled | Sanitation     | 2019-09-18T01:05:08 | ... |
| Garbage Cart Maintenance      | Completed | Sanitation     | 2021-01-24T09:14:58 | ... |
| Pothole in Street Complaint   | Completed | Transportation | 2019-03-21T10:41:01 | ... |
| Recycling Pick Up             | Completed | Sanitation     | 2021-02-16T08:28:59 | ... |
Polars によるデータパイプラインのスケーリングと最適化

処理行数の制限

requests.head(5)
Polars によるデータパイプラインのスケーリングと最適化

処理行数の制限

requests.head(5).collect()
shape: (5, 39)
| TYPE                            | STATUS    | DEPARTMENT     | CREATED_DATE        | ... |
| ---                             | ---       | ---            | ---                 | --- |
| str                             | str       | str            | str                 | ... |
|---------------------------------|-----------|----------------|---------------------|-----|
| Pothole in Street Complaint     | Completed | Transportation | 2019-12-16T10:09:08 | ... |
| Tree Trim Request | Completed | Sanitation     | 2019-09-18T01:05:08 | ... |
| Garbage Cart Maintenance        | Completed | Sanitation     | 2021-01-24T09:14:58 | ... |
| Pothole in Street Complaint     | Completed | Transportation | 2019-03-21T10:41:01 | ... |
| Recycling Pick Up               | Completed | Sanitation     | 2021-02-16T08:28:59 | ... |
  • collectの呼び出しを遅らせる
Polars によるデータパイプラインのスケーリングと最適化

部門別集計クエリ

completed_by_department


Polars によるデータパイプラインのスケーリングと最適化

部門別集計クエリ

completed_by_department = requests


Polars によるデータパイプラインのスケーリングと最適化

部門別集計クエリ

completed_by_department = requests.filter(
    pl.col("STATUS") == "Completed"
)
Polars によるデータパイプラインのスケーリングと最適化

部門別集計クエリ

completed_by_department = requests.filter(
    pl.col("STATUS") == "Completed"
).collect()
Polars によるデータパイプラインのスケーリングと最適化

部門別集計クエリ

completed_by_department = requests.filter(
    pl.col("STATUS") == "Completed"
).collect().group_by("DEPARTMENT").len()
Polars によるデータパイプラインのスケーリングと最適化

部門別集計クエリ

completed_by_department = requests.filter(
    pl.col("STATUS") == "Completed"
).group_by("DEPARTMENT").len().collect()
shape: (10, 2)
| DEPARTMENT                     | len     |
| ---                            | ---     |
| str                            | u32     |
|-------------------------------|---------|
| 311 City Services              | 4859161 |
| Sanitation                     | 3406631 |
| Aviation                       | 2337842 |
| CDOT - Department of Transport | 1468240 |
Polars によるデータパイプラインのスケーリングと最適化

クエリの分岐

completed_by_department = requests.filter(
    pl.col("STATUS") == "Completed"
).group_by("DEPARTMENT").len()
completed_by_month = requests.filter(
    pl.col("STATUS") == "Completed"
).group_by("MONTH").len()
Polars によるデータパイプラインのスケーリングと最適化

現在のチームの実行方法

completed_by_department.collect()
completed_by_month.collect()
Polars によるデータパイプラインのスケーリングと最適化

分岐クエリの実行

results = pl.collect_all(


)
Polars によるデータパイプラインのスケーリングと最適化

分岐クエリの実行

results = pl.collect_all([
    completed_by_department,
    completed_by_month,
])
Polars によるデータパイプラインのスケーリングと最適化

分岐クエリの実行

results[0]  # completed_by_department
shape: (10, 2)
| DEPARTMENT           | len     |
| ---                  | ---     |
| str                  | u32     |
|----------------------|---------|
| 311 City Services    | 4859161 |
| Sanitation           | 3406631 |
| Aviation             | 2337842 |
| Transport            | 1468240 |
results[1]  # completed_by_month
shape: (12, 2)
| MONTH | len  |
| ---   | ---  |
| i64   | u32  |
|-------|------|
| 1     | 2506 |
| 2     | 4566 |
| 3     | 2739 |
| 4     | 2922 |
Polars によるデータパイプラインのスケーリングと最適化

では、練習しましょう!

Polars によるデータパイプラインのスケーリングと最適化

Preparing Video For Download...