Мониторинг и устранение неполадок в AWS
John Q. Martin
Principal Consultant

Как в больнице: регистратура → палата → консультант
Верх — сводка для руководства
Середина — работоспособность сервисов
Низ — детальная диагностика

Эти четыре сигнала охватывают подавляющее большинство проблем, с которыми вы столкнётесь.

Используйте RED как отправную точку, а насыщение — для углублённой диагностики.

["AWS/ApplicationELB",
"RequestCount",
{"stat": "Sum"}]
"metrics": [
["AWS/Lambda", "Errors",
{"stat":"Sum","id":"errors"}],
[".", "Invocations",
{"stat":"Sum","id":"invocations"}],
[{"expression":
"(errors/invocations)*100",
"label":"Error Rate %"}]
]
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p50"}],
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p95"}],
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p99"}]
Запрос последних ошибок:
fields @timestamp, @message
| filter @message like /ERROR/
| sort @timestamp desc
| limit 20
Количество ошибок по типу:
filter @message like /ERROR/
| stats count(*) as errors
by errorType
| sort errors desc


Как сортировка в скорой: стабилизировать → диагностировать → лечить → проверить

Анализ: ресурсы перегружены из-за всплеска трафика

Анализ: узкое место — база данных; медленные запросы исчерпывают пул соединений

Небольшая проблема в сервисе A распространилась по цепочке зависимостей

Мониторинг и устранение неполадок в AWS