Supervision et dépannage sur AWS
John Q. Martin
Principal Consultant

Comme à l'hôpital : accueil → service → spécialiste
Haut - Synthèse exécutive
Milieu - Santé des services
Bas - Diagnostics détaillés

Couvrez ces quatre points et vous couvrirez l'immense majorité des problèmes.

Utilisez RED comme point de départ, ajoutez la saturation pour un diagnostic plus poussé.

["AWS/ApplicationELB",
"RequestCount",
{"stat": "Sum"}]
"metrics": [
["AWS/Lambda", "Errors",
{"stat":"Sum","id":"errors"}],
[".", "Invocations",
{"stat":"Sum","id":"invocations"}],
[{"expression":
"(errors/invocations)*100",
"label":"Error Rate %"}]
]
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p50"}],
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p95"}],
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p99"}]
Requête erreurs récentes :
fields @timestamp, @message
| filter @message like /ERROR/
| sort @timestamp desc
| limit 20
Nombre d'erreurs par type :
filter @message like /ERROR/
| stats count(*) as errors
by errorType
| sort errors desc


Comme le triage aux urgences : stabiliser → diagnostiquer → traiter → vérifier

Analyse : Ressources saturées par un afflux de trafic

Analyse : La base de données est le goulot ; requêtes lentes épuisant le pool de connexions

Un petit problème dans le Service A a déclenché une cascade dans la chaîne de dépendances

Supervision et dépannage sur AWS