Resolución de problemas comunes

Soluciones de Azure Compute

Florin Angelescu

Azure Cloud Architect

Por qué importa el troubleshooting

 

Fallo de pod

Comunicación entre pods

Fallo de nodo

 

 

  • Los pods pueden no arrancar

 

  • Los servicios pueden no enrutar tráfico

 

  • Los nodos pueden quedarse sin recursos
Soluciones de Azure Compute

Por qué importa el troubleshooting

 

Fallo de pod

  • Enfoque estructurado:
    • Observar
    • Identificar
    • Probar
    • Resolver
  • Evita perder tiempo con síntomas en vez de causas raíz.
Soluciones de Azure Compute

Fallos de pods

 

 

Fallo de pod

 

 

  • Pods que no arrancan.
  • Causas:
    • Imágenes de contenedor incorrectas
    • Secrets faltantes
    • Recursos insuficientes
Soluciones de Azure Compute

Fallos de pods

kubectl

  • kubectl describe pod - eventos
  • kubectl logs - salida

Policy

  • Revisa las políticas de descarga de imágenes
  • Revisa las credenciales del registro

Logs

  • Revisa los logs de la aplicación
  • Revisa las solicitudes de recursos

Probe

  • Probes de readiness y liveness
  • Detecta pods no saludables y reinícialos
Soluciones de Azure Compute

Problemas de red

 

 

Comunicación entre pods

 

  • Problemas de red:

    • Impiden que los servicios lleguen a los pods
    • O a clientes externos
  • Verifica:

    • Servicios bien definidos
    • Selectores que coinciden con las etiquetas de los pods
Soluciones de Azure Compute

Problemas de red

kubectl

  • kubectl get svc
  • kubectl get endpoints

kubectl

  • Ingress controllers: configuración adicional
  • Certificados TLS o reglas de ruta

kubectl

  • Prueba de conectividad
  • kubectl exec, curl

kubectl

  • Herramientas de captura de paquetes
  • Azure Network Watcher
Soluciones de Azure Compute

Retos de escalado

 

Fallo al escalar

 

 

 

  • Ajustes del autoescalado mal configurados.
  • Los nodos no tienen capacidad.
Soluciones de Azure Compute

Retos de escalado

 

Fallo al escalar

  • Revisa métricas del Horizontal Pod Autoscaler:
    • kubectl get hpa
  • Asegura que el Cluster Autoscaler esté habilitado.
  • Revisa requests y limits de recursos:
    • Valores muy restrictivos impiden programar pods
  • Revisa cuotas del pool de nodos y ajusta umbrales.
  • Simula carga en pruebas.
  • Supervisa eventos de escalado en Azure Monitor.
Soluciones de Azure Compute

Restricciones de recursos

 

Fallo de nodo

 

  • Los nodos pueden quedarse sin:
    • CPU
    • Memoria
    • Espacio en disco
  • Lo que provoca evicción de pods.
  • Supervisa el uso de recursos:
    • Azure Monitor
    • kubectl top
Soluciones de Azure Compute

Restricciones de recursos

Recursos

  • Sobreasignar recursos genera inestabilidad
  • Define requests y limits realistas

Prioridad

  • Taints y tolerations -> ubicación de pods
  • Da prioridad a cargas críticas

Auditoría

  • Auditorías de asignación y cuotas de recursos
  • Evita cuellos de botella

Nodos

  • Varios pools de nodos con tamaños de VM distintos
  • Equilibra cargas de trabajo eficazmente
Soluciones de Azure Compute

Recapitulación

 

Kubernetes

 

 

  • El troubleshooting en AKS implica diagnosticar:
    • Fallos de pods
    • Problemas de red
    • Retos de escalado
    • Restricciones de recursos
Soluciones de Azure Compute

Recapitulación

 

Kubernetes

 

 

  • Al combinar herramientas de Kubernetes con integraciones de Azure:

    • Resuelves rápido y mantienes la fiabilidad
  • Playbook de troubleshooting para tu equipo:

    • Respuestas consistentes y resolución más rápida
Soluciones de Azure Compute

¡Vamos a practicar!

Soluciones de Azure Compute

Preparing Video For Download...