Tipos de cluster e runtimes
Introdução ao Databricks Lakehouse
Gang Wang
Senior Data Scientist
O que é um cluster?
$$
Um
conjunto de máquinas virtuais
que executa seu código
Um nó
driver
coordena o trabalho
Um ou mais nós
worker
fazem o processamento
Clusters leem dados do armazenamento em nuvem
$$
$$
Clusters all-purpose
$$
Desenvolvimento
interativo
e consultas ad hoc
Compartilhado
por vários usuários da equipe
Ficam em execução até você
parar manualmente
Pense como seu carro pessoal: sempre disponível, mas você paga mesmo parado
$$
Clusters de jobs
$$
Criados
automaticamente
quando um job inicia
Executam
uma única tarefa
e encerram
Sem gerenciamento manual
Otimização de custo
para produção
$$
Quando usar qual?
$$
Erro comum:
executar pipelines de produção em clusters all-purpose
Databricks Runtime
$$
Pilha de software versionada
que roda em todo cluster
Inclui Apache Spark, Delta Lake, Python, R, Scala
Versões
LTS
— suporte de longo prazo, recomendado para produção
ML Runtime
adiciona bibliotecas de ML pré-instaladas
$$
Resumo
$$
Clusters all-purpose
— interativos, compartilhados, gestão manual
Clusters de jobs
— automatizados, tarefa única, otimizados por custo
Databricks Runtime
— pilha versionada (use LTS em produção)
Combine o tipo de cluster à carga de trabalho para controlar custos
Vamos praticar!
Introdução ao Databricks Lakehouse
Preparing Video For Download...