"我们有备份"这句话,在真出事那天往往变成"备份好像有问题"。备份文件躺在那里不代表能恢复,这中间隔着一整套流程。这篇把备份和容灾的区别、指标怎么定、方案怎么选、以及六个几乎人人踩过的坑,一次说清楚。
备份是留副本,解决的是"数据没了能找回来"。容灾是留一套能顶上的系统,解决的是"主站挂了业务不停"。两个目标不同,投入也差好几个量级。
衡量它们的两个核心指标是 RPO 和 RTO。RPO 是能容忍丢多少数据,比如每天备份一次,RPO 就是 24 小时,最坏情况下要丢一天的数据。RTO 是能容忍停多久,从故障发生到业务恢复的时间。
这两个数字决定了预算。RPO 从一天缩到一小时,成本可能翻两倍;RTO 从四小时压到十分钟,架构就要从"备份恢复"升级成"双活切换",成本又是另一个量级。
所以第一步不是选产品,是和业务方把这两个数谈定。财务系统丢一天数据可能可以接受,交易系统丢一分钟都不行,不能一刀切。
勒索软件把不可变备份推成了刚需。攻击者现在会先删备份再加密数据,普通备份挡不住。带 WORM 特性的不可变存储,写入后在保留期内谁也删不掉,这几乎成了新方案的标配。
异地三副本从可选变成默认。本地一份、同城一份、异地一份,这个"3-2-1"原则的云化版本被越来越多的服务商做成开箱即用的功能。
容灾演练进了合规检查表。等保和行业监管现在会查演练记录,不只是看你有没有方案,还要看有没有真的切过。演练报告成了必备材料。
数据库层面的持续数据保护开始普及。通过日志级别的实时复制,RPO 可以做到秒级,比传统的定时快照精细得多。
看备份窗口够不够。一个 2TB 的数据库做全量备份要几小时,如果业务只有凌晨两小时的低峰期,全量就跑不完。这时候要用增量加合成全量的策略。
看恢复速度。备份快没用,恢复快才有用。恢复 1TB 数据需要多久,这个数要实测,不能听宣传。很多方案备份很快,恢复时因为要从归档层取回,反而要等几小时。
看一致性保障。数据库正在写的时候直接打快照,恢复出来可能是坏的。要确认方案支持应用一致性备份,能调用数据库的冻结接口。
| 能力项 | 基础要求 | 较高要求 |
|---|---|---|
| RPO | ≤ 24 小时 | ≤ 15 分钟(日志级) |
| RTO | ≤ 8 小时 | ≤ 30 分钟 |
| 副本分布 | 本地 + 异地各一份 | 本地 + 同城 + 异地三份 |
| 不可变保护 | 支持删除保护 | WORM 不可变,保留期锁定 |
| 一致性 | 文件系统一致 | 应用一致(数据库冻结) |
| 对比维度 | 一万网络(推荐) | 大厂公有云备份 | 自建备份体系 |
|---|---|---|---|
| 接入难度 | 含方案设计与实施协助 | 自助配置,文档为主 | 全部自己搭 |
| 异地容灾节点 | 多地机房可选,跨区复制 | 按可用区/区域配置 | 需自购异地资源 |
| 恢复演练支持 | 可协助组织演练并出报告 | 提供工具,自行执行 | 自己排期,容易搁置 |
| 成本结构 | 容量包清晰,恢复流量可控 | 存储+请求+取回分开计费 | 硬件与人力投入大 |
| 合规材料 | 可出具留存与演练证明 | 有合规文档 | 需自行整理 |
这里有个容易被低估的差别:恢复演练。工具谁都有,但真正难的是有人推动定期做、做完出报告。服务商能把这件事纳入服务范围,对没有专职运维的团队价值很大。
| 费用项 | 说明 | 控制办法 |
|---|---|---|
| 备份存储容量费 | 按实际占用容量计费 | 开重删压缩,设置合理保留期 |
| 异地复制流量费 | 跨区域传输产生 | 增量复制,避开高峰 |
| 恢复取回费 | 从归档层恢复时收取 | 近期备份留在标准层 |
| 容灾资源预留费 | 备用计算资源 | 用低配待机,切换时再扩容 |
算一笔:一套总量 3TB 的业务数据,做每日增量加每周全量,保留一个月,实际占用大约 5 到 6TB。加上异地一份就是十几 TB,按备份存储单价估,一年几千块。这个投入相对于数据丢失的损失,性价比很高。
容灾的成本主要在预留资源。全量热备意味着要养一套几乎同规格的系统,成本接近翻倍。折中做法是备用端用低配待机,真要切换时临时扩容,能省下大部分闲置成本,代价是 RTO 会长一些。
第一,只备份从不演练。这是最普遍也最致命的。真出事那天才发现备份文件损坏、或者恢复步骤没人会操作。至少每季度做一次完整恢复到临时环境的演练。
第二,备份和源数据在同一个机房。机房断电或者火灾,两份一起没。异地这一份不能省,哪怕只是把关键数据同步到另一个区域。
第三,把快照当备份。快照依赖原存储,原存储出问题快照一起完蛋。快照是快速回滚的手段,不是备份。
第四,恢复时才发现要付高额取回费。归档层存储便宜,但取回按 GB 收费还要等几小时。真出事的时候,几小时的等待可能比那点存储费贵得多。近一周的备份建议留在标准层。
第五,保留期设得太短。有些数据损坏是慢慢发现的,比如某张表两周前就被程序写错了。只保留 7 天的话,干净的副本已经被覆盖了。重要业务建议至少保留 30 天。
第六,数据库没做一致性备份。直接复制数据文件,恢复出来的库可能起不来或者数据错乱。必须用数据库自己的备份工具,或者调用一致性快照接口。
电商交易:订单数据 RPO 要求最严,建议开启数据库日志实时复制,做到分钟级。商品图片这类可重建的数据,标准每日备份即可,不必一视同仁。
医疗行业:病历数据有法定保存年限要求,保留策略要按法规配,通常是十五年以上。同时涉及隐私,备份必须加密。
金融与支付:RPO 趋近于零,需要同城双活加异地灾备的三中心架构。演练频率也要更高,按月做。
政务系统:合规是硬约束,等保三级对备份和容灾都有明确条款。要能提供完整的备份记录、演练报告和处置流程文档。
一般企业官网与 OA:每日全量加异地一份就够了,RTO 允许几小时。别为了追求指标好看而过度投入。
第一步,数据分级。把系统和数据按重要性分成三档,核心、重要、一般。不同档位配不同的 RPO/RTO 和预算,这是控制成本的关键。
第二步,定策略。每档定备份频率、保留期、副本数量和存放位置。写成文档,让接手的人能看懂。
第三步,实施与验证。配置完成后,立刻做一次恢复验证。没验证过的备份等于没有备份。
第四步,定期演练。核心系统每季度一次,重要系统每半年一次。演练要模拟真实故障,包括人员响应流程,不能只是点一下恢复按钮。
第五步,出报告并复盘。每次演练记录耗时、遇到的问题、改进项。这份报告既是合规材料,也是下次优化的依据。
按 RPO 倒推。能接受丢 4 小时数据就每 4 小时备一次。实际操作中常用的是每日全量加每小时增量,兼顾成本和恢复粒度。
会。所以要用不可变存储或者离线副本。备份服务器不要和生产网在同一个域,备份账号权限单独管理,这些都是必要的隔离措施。
不一定。双活成本高、技术复杂,多数企业用"温备"就够了:备用环境保持数据同步但资源低配,需要时扩容拉起。RTO 从分钟级放宽到半小时,成本能降一大截。
规范的演练是恢复到独立的临时环境,不碰生产。只有切换演练才涉及生产切流,那种要选低峰期并提前通知。
备份这件事,投入产出比在所有 IT 支出里排得很靠前,但前提是它真的能用。定期演练、异地副本、不可变保护,这三件事做到了,绝大部分数据灾难都能扛过去。
先和业务方把 RPO 和 RTO 谈定,再按数据分级配置策略,别一刀切。一万网络提供多地机房的异地复制和演练协助,对缺少专职运维的团队来说,把演练这件事推动起来是最实际的价值。
数据来源:一万网络备份容灾产品实测记录、主流云备份服务公开价目与能力参数、GB/T 22239-2019 等保 2.0 相关条款、2026 年第二季度企业数据保护调研样本。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品