整合所学

Databricks Lakehouse 入门

Gang Wang

Senior Data Scientist

情景

$$

  • 您是一名数据工程师,在一家零售公司开始一个新项目
  • 目标:配置计算资源、验证数据管道、检查治理,并准备部署

$$

recraft: half: 一位数据工程师坐在现代办公桌前,笔记本显示 Databricks 风格界面,身后白板上有管道图,表示加入新数据项目

Databricks Lakehouse 入门

步骤 1:选择合适的计算

$$

  • 管道按计划每晚定时运行
  • 无需交互式开发
  • 采用带 LTS 运行时的作业集群最合适
  • 启用自动伸缩(2–6 个 worker)以应对数据量波动

$$

All-Purpose Jobs Cluster
模式 交互式 自动化
管理 手动 自动终止
成本 更高(空闲开销) 成本优化
Databricks Lakehouse 入门

步骤 2:验证勋章模型管道

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze:原始数据,行数最多
  • Silver:清洗后,移除 null 和重复
  • Gold:为业务报表聚合
  • 质量提升时行数递减
Databricks Lakehouse 入门

步骤 3:检查治理

$$

  • 进入 Unity Catalog,检查表 gold_daily_revenue
  • 向上追溯血缘,确认来自 silver_sales
  • 验证访问控制——仅分析团队对 gold 拥有 SELECT 权限
  • 确认为外部合作方配置了 Delta Sharing

$$

recraft: half: 放大镜悬停在数据血缘图上,节点相连并带有对勾,表示治理核查

Databricks Lakehouse 入门

步骤 4:准备部署

$$

  • 查看 databricks.yml 资产包
  • 确认已定义夜间作业资源
  • 检查生产目标是否指向正确的工作区路径
  • 部署前运行 bundle validate

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Databricks Lakehouse 入门

小结

$$

  • 计算:按负载选择集群类型(自动化用 jobs cluster)
  • 数据:核验勋章分层流转是否正确
  • 治理:追溯血缘、检查访问、确认共享
  • 部署:审阅资产包、验证并部署
Databricks Lakehouse 入门

让我们一起练习吧!

Databricks Lakehouse 入门

Preparing Video For Download...