标准答案

  1. 发布前定义关键指标基线和阈值,例如请求错误率、P99、下单成功率、消息积压和关键依赖失败率。
  2. 先暂停继续扩大流量,区分错误是否集中在新版本、特定租户、特定接口或全局依赖。
  3. 若核心业务指标越过阈值或错误持续扩大,应优先回滚到已验证制品;可局部关闭的功能则先用开关止血。
  4. 恢复后保留时间线、版本、配置和样本证据,避免只凭日志片段猜测原因。

题目解析

错误率绝对值必须和历史基线比较。低流量接口单个失败可能看起来很高,而高流量核心接口很小的抖动也可能造成大量用户失败。

“继续观察”只有在指标稳定、影响可控、回滚成本高且有明确观察窗口时才合理。没有事先标准,观察通常只是拖延决策。

常见误区

  • 只看服务存活率,不看用户侧成功率和收入相关指标。
  • 发布错误后继续扩大范围,试图用更多样本确认故障。
  • 回滚代码却忘记同步回退高风险配置或数据迁移。

作者信息