Monitoramento e Solução de Problemas na AWS
John Q. Martin
Principal Consultant

"Como um hospital: recepção → enfermaria → especialista"
Topo - Resumo executivo
Meio - Saúde dos serviços
Base - Diagnóstico detalhado

Cobrindo estes quatro, você cobre a maioria dos problemas que vai encontrar.

Use RED como ponto de partida e adicione saturação para diagnóstico mais profundo.

["AWS/ApplicationELB",
"RequestCount",
{"stat": "Sum"}]
"metrics": [
["AWS/Lambda", "Errors",
{"stat":"Sum","id":"errors"}],
[".", "Invocations",
{"stat":"Sum","id":"invocations"}],
[{"expression":
"(errors/invocations)*100",
"label":"Error Rate %"}]
]
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p50"}],
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p95"}],
["AWS/ApplicationELB",
"TargetResponseTime",
{"stat": "p99"}]
Consulta de erros recentes:
fields @timestamp, @message
| filter @message like /ERROR/
| sort @timestamp desc
| limit 20
Contagem de erros por tipo:
filter @message like /ERROR/
| stats count(*) as errors
by errorType
| sort errors desc


"Como triagem do PS: estabilizar → diagnosticar → tratar → verificar"

Análise: Recursos sobrecarregados pelo surto de tráfego

Análise: Banco é o gargalo; consultas lentas esgotando o pool de conexões

Um pequeno problema no Serviço A cascateou pela cadeia de dependências

Monitoramento e Solução de Problemas na AWS