标准答案

  1. 开头写清触发症状、用户影响、适用服务和优先查看的仪表盘或查询入口。
  2. 每一步给出可观察证据和预期结果,例如错误率、队列长度、日志字段或健康状态。
  3. 止血动作按风险排序,标明权限、影响、回滚方式和何时必须升级给领域负责人。
  4. 结尾定义恢复验证和后续记录要求,避免服务表面恢复后漏掉数据补偿或监控清理。

题目解析

Runbook 的执行人可能不是编写者,因此语言要具体、操作要可复制、依赖和权限要明确。抽象的“检查日志”“重启服务”在事故中没有帮助。

文档应通过演练和真实事故持续更新。每次值班中出现的卡点,都是需要补进 Runbook 的信息。

常见误区

  • 只描述系统原理,没有实际查询、阈值和动作。
  • 让值班人员执行不可逆操作,却没有备份或回滚说明。
  • 文档长期不演练,链接、命令和权限早已失效。

作者信息