Gerenciando e configurando clusters

Introdução ao Databricks Lakehouse

Gang Wang

Senior Data Scientist

Encontrando seus clusters

$$

  • Todos os Clusters - tudo no workspace
  • Meus Clusters - os que você criou
  • Compartilhados comigo - clusters aos quais deram acesso a você
  • Filtrar por estado: Running, Terminated

$$

meio a meio: Um arquivo com pastas coloridas e rótulos mostrando categorias organizadas, representando filtragem e organização de clusters

Introdução ao Databricks Lakehouse

Estados do cluster

fluxograma: Pending, Running, Restarting, Terminating, Terminated

Introdução ao Databricks Lakehouse

Encerramento: o que fica e o que se perde

comparação: Preservado, Configuração, Notebooks, Armazenamento em nuvem | Perdido, Dados em memória, Bibliotecas instaladas, Arquivos temporários

  • Encerramento não é exclusão — config e notebooks permanecem
  • Dados em memória, caches e pacotes instalados via pip são limpos
Introdução ao Databricks Lakehouse

Quando reiniciar

$$

  • Instalou uma biblioteca nova que não carrega
  • Cluster está instável ou lento
  • Precisa limpar dados em cache da memória
  • Atualizou um init script ou variável de ambiente

$$

meio a meio: Um ícone de botão de energia com setas circulares ao redor brilhando em azul e verde, representando reinício ou atualização do sistema

Introdução ao Databricks Lakehouse

Autoscaling e auto-termination

$$

Autoscaling e Auto-termination

$$

  • Autoscaling adiciona ou remove workers conforme a demanda
  • Lida com picos sem superdimensionar
  • Auto-termination desliga após um período ocioso definido
  • Evita que clusters esquecidos consumam orçamento
Introdução ao Databricks Lakehouse

Políticas de cluster

$$

  • Regras definidas pelo admin para criar clusters
  • Limite tipos de nó, máx. de workers e versões de runtime
  • Faça cumprir auto-termination e tags
  • Usuários criam clusters dentro da política

$$

{
  "max_workers": 8,
  "auto_termination_minutes": 30,
  "allowed_node_types": [
    "Standard_DS3_v2",
    "Standard_DS4_v2"
  ]
}
Introdução ao Databricks Lakehouse

Resumo

$$

  • Filtre clusters para achar rápido o que precisa
  • Encerrar reduz custos, mas limpa memória e bibliotecas
  • Reinicie para carregar novas bibliotecas ou diagnosticar
  • Autoscaling e auto-termination controlam custos automaticamente
  • Políticas de cluster permitem que admins imponham padrões
Introdução ao Databricks Lakehouse

Vamos praticar!

Introdução ao Databricks Lakehouse

Preparing Video For Download...