标准答案

  1. 先确认影响范围、开始时间、受影响用户和核心业务指标,按既定标准分级并指定事故负责人。
  2. 止血优先选择可逆且低风险的动作,例如回滚、关闭开关、限流、摘除故障实例或切换备用依赖。
  3. 沟通使用同一状态频道,定期更新已知事实、当前措施、用户影响和下一次更新时间,避免多人各自发布猜测。
  4. 恢复后验证请求成功率、数据一致性、消息积压、对账和监控基线,再进入复盘与长期改进。

题目解析

事故中最稀缺的是注意力。清晰的角色和时间线能让排查、执行和外部沟通并行,而不是所有人同时改配置。

只修触发错误的那一行并不等于事故结束。重复消息、错误数据、积压任务和用户侧缓存可能在服务恢复后继续造成影响。

常见误区

  • 没有确认影响范围就执行高风险操作。
  • 多人同时修改生产配置,之后无法还原谁改变了什么。
  • 服务恢复后不做数据校验和用户影响确认。

作者信息