Monitoring and Troubleshooting AWS
John Q. Martin
Principal Consultant

Jak w szpitalu: recepcja → oddział → konsultant
Góra – podsumowanie dla kadry zarządzającej
Środek – kondycja usług
Dół – szczegółowa diagnostyka

Te cztery sygnały obejmują zdecydowaną większość problemów, które napotkasz.

Zacznij od RED, a nasycenie dodaj przy głębszej diagnostyce.

["AWS/ApplicationELB",
"RequestCount",
{"stat": "Sum"}]
"metrics": [
["AWS/Lambda", "Errors",
{"stat":"Sum","id":"errors"}],
[".", "Invocations",
{"stat":"Sum","id":"invocations"}],
[{"expression":
"(errors/invocations)*100",
"label":"Error Rate %"}]
]
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p50"}],
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p95"}],
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p99"}]
Zapytanie o ostatnie błędy:
fields @timestamp, @message
| filter @message like /ERROR/
| sort @timestamp desc
| limit 20
Liczba błędów według typu:
filter @message like /ERROR/
| stats count(*) as errors
by errorType
| sort errors desc


Jak triage na SOR-ze: stabilizacja → diagnoza → leczenie → weryfikacja

Analiza: Zasoby przeciążone przez nagły skok ruchu

Analiza: Baza danych jest wąskim gardłem – wolne zapytania wyczerpują pulę połączeń

Mały problem w usłudze A przeszedł kaskadowo przez łańcuch zależności

Monitoring and Troubleshooting AWS