Tipos de cluster e runtimes

Introdução ao Databricks Lakehouse

Gang Wang

Senior Data Scientist

O que é um cluster?

$$

  • Um conjunto de máquinas virtuais que executa seu código
  • Um nó driver coordena o trabalho
  • Um ou mais nós worker fazem o processamento
  • Clusters leem dados do armazenamento em nuvem

$$

$$

hierarquia: Nó Driver, Worker 1, Worker 2, Worker 3, Armazenamento em nuvem

Introdução ao Databricks Lakehouse

Clusters all-purpose

$$

  • Desenvolvimento interativo e consultas ad hoc
  • Compartilhado por vários usuários da equipe
  • Ficam em execução até você parar manualmente
  • Pense como seu carro pessoal: sempre disponível, mas você paga mesmo parado

$$

recraft: half: Um carro pessoal estacionado na garagem, sempre disponível mas gera custo mesmo ocioso, representando um recurso de computação sempre ativo

Introdução ao Databricks Lakehouse

Clusters de jobs

$$

  • Criados automaticamente quando um job inicia
  • Executam uma única tarefa e encerram
  • Sem gerenciamento manual
  • Otimização de custo para produção

$$

recraft: half: Um táxi moderno com taxímetro aceso, representando um recurso sob demanda que inicia e para automaticamente

Introdução ao Databricks Lakehouse

Quando usar qual?

$$

comparação: All-Purpose, Dev interativo, Trabalho em notebook, SQL ad hoc, Compartilhamento em equipe | Jobs, ETL noturno, Relatórios agendados, Testes automáticos, Produção

  • Erro comum: executar pipelines de produção em clusters all-purpose
Introdução ao Databricks Lakehouse

Databricks Runtime

$$

  • Pilha de software versionada que roda em todo cluster
  • Inclui Apache Spark, Delta Lake, Python, R, Scala
  • Versões LTS — suporte de longo prazo, recomendado para produção
  • ML Runtime adiciona bibliotecas de ML pré-instaladas

$$

camadas: Runtime 15.4 LTS, Apache Spark 3.5.x, Delta Lake 3.2.x, Python 3.11 / Scala 2.12 / R 4.3, Bibliotecas do sistema

Introdução ao Databricks Lakehouse

Resumo

$$

  • Clusters all-purpose — interativos, compartilhados, gestão manual
  • Clusters de jobs — automatizados, tarefa única, otimizados por custo
  • Databricks Runtime — pilha versionada (use LTS em produção)
  • Combine o tipo de cluster à carga de trabalho para controlar custos
Introdução ao Databricks Lakehouse

Vamos praticar!

Introdução ao Databricks Lakehouse

Preparing Video For Download...