總結

在 Databricks 使用 Spark SQL 進行資料轉換

Disha Mukherjee

Lead Data Engineer

第 1 章

Databricks 工作區總覽

  • 載入與檢視 DataFrame
  • 以 PySpark 與 Spark SQL 整形資料
在 Databricks 使用 Spark SQL 進行資料轉換

第 2 章

total_rows = df_enriched.count()
distinct_rows = df_enriched.distinct().count()

null_rate = ( df_enriched.filter(F.col("Customer_ID").isNull()) .count() / total_rows * 100 )
print(f"Total rows: {total_rows}") print(f"Duplicates: {total_rows - distinct_rows}") print(f"Null rate: {null_rate:.2f}%")
Total rows:   33,223
Duplicates:   0
Null rate:    0.00%
  • 清理 null、重複與無效紀錄
  • 使用廣播最佳化進行彙總與連接
在 Databricks 使用 Spark SQL 進行資料轉換

第 3 章

Lakeflow pipeline DAG

  • 視窗函式與串流查詢
  • 以 Databricks Jobs 與 Lakeflow 建立正式管線
在 Databricks 使用 Spark SQL 進行資料轉換

在即時 Databricks 工作區練習

可互動表格(支援排序與搜尋)

$$

$$

$$

  • 交易與線上零售資料集
  • 在即時 Databricks 工作區進行互動式練習
在 Databricks 使用 Spark SQL 進行資料轉換

恭喜你!

在 Databricks 使用 Spark SQL 進行資料轉換

Preparing Video For Download...