AWS 监控与故障排查
John Q. Martin
Principal Consultant
由您的跟踪数据自动生成:无需手动设置

一眼看懂:绿色 = 准点 · 琥珀色 = 延误 · 红色 = 停止

打开服务地图时,先看所有不是绿色的部分。
点击任意节点可查看:响应时间分布、HTTP 状态分解、错误类型。

API Gateway (50ms)
-> OrderService (50ms)
-> PaymentService (100ms)
-> External API (200ms)
Total: 400ms
External API = 占总延迟的 50%
对比另一条路径:
OrderService -> DynamoDB
Total: 120ms (fast)


Query 1 (10-30ms)
-> Query 2 (30-50ms)
-> Query 3 (50-70ms)
-> Query 4 (70-90ms)

Get user list (10-20ms)
Get user 1 details (20-30ms)
Get user 2 details (30-40ms)
... ×100 sequential queries
修复:批量查询、预加载
修复:批量请求、消息队列、缓存

修复:预置并发、优化初始化
Service A [Error]
-> Service B [Timeout 5s]
-> Service C [Timeout 5s]
-> Database [Timeout 5s]
匹配的超时块沿跟踪层级逐层堆叠
修复:超时、断路器、回退

对比分组:
response_time > 1000ms,按持续时间排序
# 高延迟告警
aws cloudwatch put-metric-alarm \
--alarm-name HighLatency \
--metric-name ResponseTime \
--namespace AWS/XRay \
--statistic Average \
--period 300 \
--threshold 1000 \
--comparison-operator GreaterThanThreshold
# 高错误数告警
aws cloudwatch put-metric-alarm \
--alarm-name HighErrorCount \
--metric-name ErrorCount \
--namespace AWS/XRay \
--statistic Sum \
--period 300 \
--threshold 50 \
--comparison-operator GreaterThanThreshold
AWS 监控与故障排查