Häufige Probleme beheben

Azure Compute-Lösungen

Florin Angelescu

Azure Cloud Architect

Warum Troubleshooting wichtig ist

 

Pod Failure

Pod Communication

Node Failure

 

 

  • Pods starten evtl. nicht

 

  • Services routen evtl. keinen Traffic

 

  • Nodes können Ressourcen ausgehen
Azure Compute-Lösungen

Warum Troubleshooting wichtig ist

 

Pod Failure

  • Strukturierter Ansatz:
    • Beobachten
    • Identifizieren
    • Testen
    • Beheben
  • So vermeidest du, Symptomen statt Ursachen nachzujagen.
Azure Compute-Lösungen

Pod-Fehler

 

 

Pod Failure

 

 

  • Pods starten nicht.
  • Ursachen:
    • Falsche Container-Images
    • Fehlende Secrets
    • Zu wenige Ressourcen
Azure Compute-Lösungen

Pod-Fehler

kubectl

  • kubectl describe pod – Events
  • kubectl logs – Ausgabe

Policy

  • Image-Pull-Policies prüfen
  • Registry-Zugangsdaten prüfen

Logs

  • Anwendungs-Logs prüfen
  • Ressourcenanforderungen prüfen

Probe

  • Readiness- und Liveness-Probes
  • Ungesunde Pods erkennen und neu starten
Azure Compute-Lösungen

Netzwerkprobleme

 

 

Pod Communication

 

  • Netzwerkprobleme:

    • Verhindern, dass Services Pods erreichen
    • Oder externe Clients
  • Prüfen:

    • Services korrekt definiert
    • Selektoren passen zu Pod-Labels
Azure Compute-Lösungen

Netzwerkprobleme

kubectl

  • kubectl get svc
  • kubectl get endpoints

kubectl

  • Ingress-Controller – Zusatzkonfig
  • TLS-Zertifikate oder Pfadregeln

kubectl

  • Konnektivität testen
  • kubectl exec, curl

kubectl

  • Packet-Capture-Tools
  • Azure Network Watcher
Azure Compute-Lösungen

Skalierungsprobleme

 

Scaling Failure

 

 

 

  • Auto-Scaler falsch konfiguriert.
  • Nodes haben zu wenig Kapazität.
Azure Compute-Lösungen

Skalierungsprobleme

 

Scaling Failure

  • HPA-Metriken prüfen:
    • kubectl get hpa
  • Sicherstellen, dass der Cluster Autoscaler aktiv ist.
  • Requests und Limits prüfen:
    • Zu strenge Werte verhindern Scheduling
  • Node-Pool-Quotas prüfen und Schwellen anpassen.
  • Last im Test simulieren.
  • Skalierungsereignisse in Azure Monitor beobachten.
Azure Compute-Lösungen

Ressourcenengpässe

 

Node Failure

 

  • Nodes können ausgehen an:
    • CPU
    • Arbeitsspeicher
    • Speicherplatz
  • Führt zur Pod-Eviction.
  • Nutzung überwachen:
    • Azure Monitor
    • kubectl top
Azure Compute-Lösungen

Ressourcenengpässe

Resources

  • Übercommit führt zu Instabilität
  • Realistische Requests und Limits setzen

Priority

  • Taints und Tolerations -> Pod-Platzierung
  • Kritische Workloads priorisieren

Audit

  • Ressourcen- und Quota-Audits
  • Engpässe vermeiden

Nodes

  • Mehrere Node-Pools mit unterschiedlichen VM-Größen
  • Workloads effizient verteilen
Azure Compute-Lösungen

Zusammenfassung

 

Kubernetes

 

 

  • Troubleshooting in AKS umfasst:
    • Pod-Fehler
    • Netzwerkprobleme
    • Skalierungsprobleme
    • Ressourcenengpässe
Azure Compute-Lösungen

Zusammenfassung

 

Kubernetes

 

 

  • Kubernetes-Tools mit Azure-Integrationen kombinieren:

    • So löst du Probleme schnell und hältst die Zuverlässigkeit hoch
  • Ein Troubleshooting-Playbook fürs Team:

    • Sorgt für konsistente Reaktionen und schnellere Lösungen
Azure Compute-Lösungen

Lass uns üben!

Azure Compute-Lösungen

Preparing Video For Download...