标准答案
- 基础备份提供一个一致的恢复起点,WAL 归档提供从该起点之后的变更记录;要恢复到目标时间,基础备份和中间连续的 WAL 都必须可用。
- PITR 可以按时间点、恢复目标名称或事务位置停止重放,但它恢复的是数据库状态,不会自动还原外部支付、消息或文件系统副作用。
- pg_dump 是逻辑备份,适合对象级迁移和部分恢复,但不能单独提供物理数据库的任意时间点恢复;物理基础备份与 WAL 归档要按同一恢复方案管理。
- 备份链要有异地或隔离存储、加密、保留策略、归档失败告警和容量监控,并明确 RPO、RTO 以及最近可恢复时间,而不是只看“备份任务成功”。
- 恢复演练要验证角色、权限、扩展、应用连接、数据校验和恢复后的新时间线;演练记录应包含实际耗时、缺失依赖和下一次改进动作。
题目解析
PITR 的核心是“基础备份加连续 WAL”,不是把某个备份文件复制到另一台机器。只要 WAL 归档中断、归档文件损坏或保留期覆盖不到目标时间,恢复链就可能在中途停止。
恢复目标需要和业务损失定义对应:RPO 决定最多能丢多长时间的数据,RTO 决定多久恢复服务。归档延迟、跨区域传输和演练耗时都应该纳入这两个指标。
恢复数据库后还要重新建立备份、归档和监控链路。否则数据库虽然能提供查询,下一次故障仍然没有可靠的恢复起点,恢复动作本身反而制造了新的风险。
常见误区
- 误区:有一份最新 pg_dump 就等于能恢复到故障前。改正:逻辑备份不能替代物理备份和连续 WAL;根据 RPO 选择完整的恢复链。
- 误区:WAL 归档任务偶尔失败不影响恢复。改正:缺失的 WAL 可能让整个时间点恢复链断裂,必须监控归档延迟、失败数和可恢复时间。
- 误区:备份文件能下载就算备份可用。改正:定期在隔离环境实际恢复,校验关键数据并记录达到 RTO 所需的真实时间。