标准答案
- 开头写清触发症状、用户影响、适用服务和优先查看的仪表盘或查询入口。
- 每一步给出可观察证据和预期结果,例如错误率、队列长度、日志字段或健康状态。
- 止血动作按风险排序,标明权限、影响、回滚方式和何时必须升级给领域负责人。
- 结尾定义恢复验证和后续记录要求,避免服务表面恢复后漏掉数据补偿或监控清理。
题目解析
Runbook 的执行人可能不是编写者,因此语言要具体、操作要可复制、依赖和权限要明确。抽象的“检查日志”“重启服务”在事故中没有帮助。
文档应通过演练和真实事故持续更新。每次值班中出现的卡点,都是需要补进 Runbook 的信息。
常见误区
- 只描述系统原理,没有实际查询、阈值和动作。
- 让值班人员执行不可逆操作,却没有备份或回滚说明。
- 文档长期不演练,链接、命令和权限早已失效。