Solucionando problemas comuns

Azure Compute Solutions

Florin Angelescu

Azure Cloud Architect

Por que o troubleshooting importa

 

Falha de pod

Comunicação entre pods

Falha de nó

 

 

  • Pods podem não iniciar

 

  • Serviços podem não rotear tráfego

 

  • Nós podem ficar sem recursos
Azure Compute Solutions

Por que o troubleshooting importa

 

Falha de pod

  • Abordagem estruturada:
    • Observar
    • Identificar
    • Testar
    • Resolver
  • Evita perder tempo nos sintomas em vez das causas raiz.
Azure Compute Solutions

Falhas de pod

 

 

Falha de pod

 

 

  • Pods não iniciam.
  • Causas:
    • Imagens de container incorretas
    • Secrets ausentes
    • Recursos insuficientes
Azure Compute Solutions

Falhas de pod

kubectl

  • kubectl describe pod - eventos
  • kubectl logs - saída

Policy

  • Verifique as políticas de pull de imagem
  • Verifique as credenciais do registry

Logs

  • Investigue os logs da aplicação
  • Analise os requests de recursos

Probe

  • Probes de readiness e liveness
  • Detecte pods com problema e reinicie-os
Azure Compute Solutions

Problemas de rede

 

 

Comunicação entre pods

 

  • Problemas de rede:

    • Impedem serviços de alcançar pods
    • Ou clientes externos
  • Verifique:

    • Serviços definidos corretamente
    • Selectors batem com labels dos pods
Azure Compute Solutions

Problemas de rede

kubectl

  • kubectl get svc
  • kubectl get endpoints

kubectl

  • Ingress controllers - configs extras
  • Certificados TLS ou regras de path

kubectl

  • Teste a conectividade
  • kubectl exec, curl

kubectl

  • Ferramentas de captura de pacotes
  • Azure Network Watcher
Azure Compute Solutions

Desafios de scaling

 

Falha no scaling

 

 

 

  • Configurações do auto-scaler erradas.
  • Nós sem capacidade.
Azure Compute Solutions

Desafios de scaling

 

Falha no scaling

  • Confira as métricas do Horizontal Pod Autoscaler:
    • kubectl get hpa
  • Garanta que o Cluster Autoscaler esteja ativo.
  • Reveja requests e limits de recursos:
    • Valores muito restritivos impedem o agendamento de pods
  • Inspecione as cotas do node pool e ajuste limites.
  • Simule carga nos testes.
  • Monitore eventos de scaling no Azure Monitor.
Azure Compute Solutions

Restrições de recursos

 

Falha de nó

 

  • Nós podem ficar sem:
    • CPU
    • Memória
    • Espaço em disco
  • Causando a ejeção de pods.
  • Monitore o uso de recursos:
    • Azure Monitor
    • kubectl top
Azure Compute Solutions

Restrições de recursos

Recursos

  • Overcommit de recursos causa instabilidade
  • Defina requests e limits realistas

Prioridade

  • Taints e tolerations -> posicionamento de pods
  • Garanta prioridade para workloads críticos

Auditoria

  • Auditorias de alocação e cotas de recursos
  • Evite gargalos

Nós

  • Múltiplos node pools com tamanhos de VM diferentes
  • Balanceie workloads com eficiência
Azure Compute Solutions

Recapitulando

 

Kubernetes

 

 

  • Troubleshooting no AKS envolve diagnosticar:
    • Falhas de pod
    • Problemas de rede
    • Desafios de scaling
    • Restrições de recursos
Azure Compute Solutions

Recapitulando

 

Kubernetes

 

 

  • Combinando ferramentas do Kubernetes com integrações do Azure:

    • Você resolve problemas mais rápido e mantém a confiabilidade
  • Playbook de troubleshooting para o time:

    • Respostas consistentes e resolução mais rápida
Azure Compute Solutions

Vamos praticar!

Azure Compute Solutions

Preparing Video For Download...