Giám sát và Khắc phục sự cố trên AWS
John Q. Martin
Principal Consultant
Tự động tạo từ dữ liệu trace của bạn: không cần cấu hình thủ công

Nhìn nhanh: xanh = đúng giờ · vàng = trễ · đỏ = dừng

Khi mở service map, hãy xem ngay mọi thứ không phải màu xanh.
Nhấp vào bất kỳ nút nào để xem: phân bố thời gian phản hồi, phân rã trạng thái HTTP, loại lỗi.

API Gateway (50ms)
-> OrderService (50ms)
-> PaymentService (100ms)
-> External API (200ms)
Tổng: 400ms
External API = 50% tổng độ trễ
So sánh đường khác:
OrderService -> DynamoDB
Tổng: 120ms (nhanh)


Query 1 (10-30ms)
-> Query 2 (30-50ms)
-> Query 3 (50-70ms)
-> Query 4 (70-90ms)

Lấy danh sách user (10-20ms)
Lấy chi tiết user 1 (20-30ms)
Lấy chi tiết user 2 (30-40ms)
... ×100 truy vấn tuần tự
Cách khắc phục: gộp truy vấn, eager loading
Cách khắc phục: gộp yêu cầu, hàng đợi thông điệp, caching

Khắc phục: provisioned concurrency, tối ưu khởi tạo
Service A [Error]
-> Service B [Timeout 5s]
-> Service C [Timeout 5s]
-> Database [Timeout 5s]
Các khối timeout xếp chồng theo phân cấp trace
Khắc phục: timeout, circuit breaker, fallback

So sánh nhóm:
response_time > 1000ms, sắp xếp theo thời lượng
# Cảnh báo độ trễ cao
aws cloudwatch put-metric-alarm \
--alarm-name HighLatency \
--metric-name ResponseTime \
--namespace AWS/XRay \
--statistic Average \
--period 300 \
--threshold 1000 \
--comparison-operator GreaterThanThreshold
# Cảnh báo số lỗi cao
aws cloudwatch put-metric-alarm \
--alarm-name HighErrorCount \
--metric-name ErrorCount \
--namespace AWS/XRay \
--statistic Sum \
--period 300 \
--threshold 50 \
--comparison-operator GreaterThanThreshold
Giám sát và Khắc phục sự cố trên AWS