整合應用

Databricks Lakehouse 入門

Gang Wang

Senior Data Scientist

情境說明

$$

  • 你是零售公司的資料工程師,正開始一個新專案
  • 目標:設定運算資源、驗證資料管線、檢查治理,並準備部署

$$

recraft: half: 一位資料工程師坐在現代化辦公桌前,筆電顯示 Databricks 風格介面,身後白板有管線流程圖,代表加入新資料專案

Databricks Lakehouse 入門

步驟 1:選擇合適的運算資源

$$

  • 管線依排程於每晚執行
  • 不需互動式開發
  • 使用具 LTS 執行環境的作業叢集(jobs cluster)最合適
  • 啟用自動調整(2–6 個工作節點)以應對變動資料量

$$

All-Purpose Jobs Cluster
Mode Interactive Automated
Management Manual Auto-terminates
Cost Higher (idle time) Cost-optimized
Databricks Lakehouse 入門

步驟 2:驗證 Medallion 管線

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze:原始資料,列數最多
  • Silver:已清理,移除 null 與重複
  • Gold:為商務報表做彙總
  • 品質提升時,列數會下降
Databricks Lakehouse 入門

步驟 3:檢查治理

$$

  • 前往 Unity Catalog,檢視 gold_daily_revenue 資料表
  • 追蹤上游血緣,確認來源為 silver_sales
  • 驗證存取控制:僅分析團隊擁有 gold 的 SELECT 權限
  • 確認對外合作夥伴已設定 Delta Sharing

$$

recraft: half: 放大鏡懸停在資料血緣圖上,節點相連並有勾勾,代表治理檢查

Databricks Lakehouse 入門

步驟 4:準備部署

$$

  • 檢閱 databricks.yml Asset Bundle
  • 確認已定義夜間作業資源
  • 檢查正式目標是否指向正確的 workspace 路徑
  • 部署前先執行 bundle validate

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Databricks Lakehouse 入門

重點整理

$$

  • Compute:依工作負載選叢集(自動化用 jobs cluster)
  • Data:驗證 Medallion 各層流向正確
  • Governance:追蹤血緣、檢查存取、確認分享
  • Deployment:檢閱 Asset Bundle、驗證、部署
Databricks Lakehouse 入門

一起來練習吧!

Databricks Lakehouse 入門

Preparing Video For Download...