标准答案
- 发布前定义关键指标基线和阈值,例如请求错误率、P99、下单成功率、消息积压和关键依赖失败率。
- 先暂停继续扩大流量,区分错误是否集中在新版本、特定租户、特定接口或全局依赖。
- 若核心业务指标越过阈值或错误持续扩大,应优先回滚到已验证制品;可局部关闭的功能则先用开关止血。
- 恢复后保留时间线、版本、配置和样本证据,避免只凭日志片段猜测原因。
题目解析
错误率绝对值必须和历史基线比较。低流量接口单个失败可能看起来很高,而高流量核心接口很小的抖动也可能造成大量用户失败。
“继续观察”只有在指标稳定、影响可控、回滚成本高且有明确观察窗口时才合理。没有事先标准,观察通常只是拖延决策。
常见误区
- 只看服务存活率,不看用户侧成功率和收入相关指标。
- 发布错误后继续扩大范围,试图用更多样本确认故障。
- 回滚代码却忘记同步回退高风险配置或数据迁移。