标准答案
- CPU 高可能是正常批处理,平均延迟正常也可能掩盖少量用户的严重超时,因此需要结合错误率、分位延迟、队列积压和业务成功率。
- 告警条件应有时间窗口、最小请求量和基线对比,避免低流量单个失败或瞬时尖峰频繁唤醒。
- 按用户影响和处理紧急度分级,紧急告警必须有明确负责人和可执行 Runbook,低优先级信号可进入工作时间处理。
- 定期回看误报、漏报和未被处理的告警,删除无价值规则并补充缺失的症状。
题目解析
告警的目标是促成正确行动,而不是证明系统“有监控”。太多无行动价值的通知会让真正事故被淹没。
减少噪音不意味着降低敏感度。正确方式是让条件更接近用户影响,并为不同阶段提供预警和紧急两类信号。
常见误区
- 每条错误日志都触发即时告警。
- 只设置机器 CPU 阈值,不看服务队列和用户失败。
- 告警没有负责人和处理说明,收到后只能临时找人。