Juntando tudo

Introdução ao Databricks Lakehouse

Gang Wang

Senior Data Scientist

O cenário

$$

  • Você é engenheiro/a de dados iniciando um novo projeto em uma varejista
  • Objetivo: configurar compute, validar o pipeline de dados, checar governança e preparar a implantação

$$

recraft: half: Um engenheiro de dados em uma mesa moderna com um laptop mostrando uma interface estilo Databricks, com diagramas de pipeline em um quadro ao fundo, representando onboarding em um novo projeto de dados

Introdução ao Databricks Lakehouse

Etapa 1: Escolher o compute certo

$$

  • O pipeline roda toda noite em um agendamento
  • Sem necessidade de desenvolvimento interativo
  • Um jobs cluster com runtime LTS é a melhor escolha
  • Ative autoscaling (2–6 workers) para volume variável de dados

$$

All-Purpose Jobs Cluster
Modo Interativo Automatizado
Gestão Manual Termina automaticamente
Custo Maior (tempo ocioso) Otimizado para custo
Introdução ao Databricks Lakehouse

Etapa 2: Verificar o pipeline medallion

$$

SELECT COUNT(*) FROM bronze_sales;
-- 1,247,832 rows

SELECT COUNT(*) FROM silver_sales;
-- 1,189,456 rows (nulls removed)

SELECT COUNT(*) FROM gold_daily_revenue;
-- 365 rows (daily aggregates)

$$

  • Bronze: dados brutos, maior contagem de linhas
  • Silver: limpos, nulos e duplicatas removidos
  • Gold: agregados para relatórios de negócio
  • As contagens caem conforme a qualidade sobe
Introdução ao Databricks Lakehouse

Etapa 3: Checar governança

$$

  • Vá ao Unity Catalog e inspecione a tabela gold_daily_revenue
  • Rastreie a linhagem upstream para confirmar leitura de silver_sales
  • Verifique controles de acesso — só o time de analytics tem SELECT em gold
  • Confirme que o Delta Sharing está configurado para o parceiro externo

$$

recraft: half: Uma lupa sobre um grafo de linhagem de dados com nós de tabelas conectados e vistos de verificação, representando verificação de governança

Introdução ao Databricks Lakehouse

Etapa 4: Preparar a implantação

$$

  • Revise o Asset Bundle databricks.yml
  • Confirme que o recurso do job noturno está definido
  • Verifique se o production target aponta para o caminho certo no workspace
  • Rode bundle validate antes de implantar

$$

targets:
  production:
    workspace:
      root_path: /Shared/production
resources:
  jobs:
    nightly_sales_etl:
      schedule:
        quartz_cron: "0 0 3 * * ?"
Introdução ao Databricks Lakehouse

Resumo

$$

  • Compute: combine o tipo de cluster com a carga (jobs cluster para automação)
  • Dados: verifique se as camadas medallion fluem corretamente
  • Governança: rastreie linhagem, cheque acessos, confirme compartilhamento
  • Implantação: revise o Asset Bundle, valide, implante
Introdução ao Databricks Lakehouse

Vamos praticar!

Introdução ao Databricks Lakehouse

Preparing Video For Download...