标准答案

  1. 定期把备份恢复到隔离环境,验证文件可读、版本兼容、密钥和解压工具都可用。
  2. 验证恢复后的表数量、行数、校验值、关键订单或账户余额等业务不变量,而不只是数据库进程能启动。
  3. 时间点恢复要验证全量基线与日志链是否连续,并能准确停在目标时间或事务位置。
  4. 演练要测量实际恢复耗时、并发资源、网络带宽和人工操作步骤,确认能满足 RTO。
  5. 还要检查应用配置、对象存储、搜索索引、消息、密钥、权限和下游依赖如何与恢复后的数据重新对齐。

题目解析

真正的事故恢复不是把一份库导入新机器就结束。恢复后的服务可能因证书过期、密钥丢失、索引未重建、消息重复投递或 DNS 路由未切换而无法对外提供正确功能。

演练应保留证据和改进项:哪个步骤耗时最长、哪里依赖个人记忆、哪份脚本不可重复。没有演练的备份能力只是未经验证的假设。

常见误区

  • 在生产环境直接试恢复或验证,给现网数据与资源带来风险。
  • 只校验总行数,不校验关键业务状态、外键关系和敏感数据访问权限。

作者信息