まとめ

Databricks における Spark SQL を使ったデータ変換

Disha Mukherjee

Lead Data Engineer

第1章

Databricks ワークスペースの概要

  • DataFrame の読み込みと確認
  • PySpark と Spark SQL によるデータの整形
Databricks における Spark SQL を使ったデータ変換

第2章

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • null・重複・不正レコードのクリーニング
  • ブロードキャスト最適化を活用した集計と結合
Databricks における Spark SQL を使ったデータ変換

第3章

Lakeflow パイプライン DAG

  • ウィンドウ関数とストリーミングクエリ
  • Databricks Jobs と Lakeflow を使った本番パイプライン
Databricks における Spark SQL を使ったデータ変換

ライブ Databricks ワークスペースで練習しましょう

並べ替えと検索ができるインタラクティブなテーブル

$$

$$

$$

  • 取引データと小売データセット
  • ライブ Databricks ワークスペースでのインタラクティブな演習
Databricks における Spark SQL を使ったデータ変換

おめでとうございます!

Databricks における Spark SQL を使ったデータ変換

Preparing Video For Download...