大模型上线之后,不是一劳永逸的。用户对话数据在变、业务知识库在更新、新法规文档得让模型理解——这些都指向一个明确的需求:持续学习(Continual Learning)。但很多团队把持续学习和"从头再训一遍"划等号,结果预算爆炸、工期拖垮。本文从增量训练的真实算力需求出发,拆解 EWC、Replay、LoRA 渐进式微调三种主流方法到底吃多少 GPU,给出一套可落地的配置方案。
核心要点:
—— 持续学习不等于全量重训,70B 模型用 LoRA 增量微调,单卡 A100 80G 就能跑,月租成本能控制在 ¥2–3 万以内
—— EWC 和 Replay 方法对显存要求更高,70B 参数需要 4×A100 80G 起步,但比全量重训省 60% 以上算力
—— 数据增量更新场景下,IO 瓶颈比算力更致命,NVMe 阵列和高速互联比堆更多 GPU 卡更实际
—— 年付方案比月付省 1–2 个月租金,持续学习项目通常跑 6–12 个月,年付更划算
—— 国内机房选深圳/华南节点,BGP 多线+CN2 回国,延迟低、运维响应快
很多团队犯的第一个错误:把持续学习当作"第二次预训练"来搞。实际上,生产环境下的持续学习面对的是——模型已经部署上线,推理服务不能停,新数据每天在产生,模型需要边服务边吸收新知识。
Elastic Weight Consolidation(EWC)的思路是给模型参数加"弹性约束",让新任务不覆盖旧知识,训练时每个参数额外算一个 Fisher 信息矩阵,显存消耗比普通微调多 20–30%。Replay 方法更直接——存一部分旧数据,训练时和新数据混在一起喂,相当于你每次训练都需要多加载一批旧样本,显存和 IO 压力都上来了。Progressive Networks 每加一个新任务就扩增网络分支,参数数量线性增长,比较少在生产中用,因为推理时延会恶化。
现在业界最靠谱的方案是 LoRA 系列的变体——LoRA、DoRA、AdaLoRA。它们冻结主干、只训低秩适配器,增量训练时显存占用只有全量微调的 1/3 到 1/5。你要更新一个 70B 模型的知识库,LoRA 微调只需要 1–2 张 A100 80G 就能跑完,而全量微调至少需要 8 卡。
持续学习不是"训一次就完",而是每周甚至每天跑一轮增量更新。每轮都要加载新数据、混入 Replay buffer 的旧数据、保存 checkpoint。这时候 GPU 算力反而容易喂饱,瓶颈在磁盘 IO 和数据管线上。我见过好几家团队,配了 8 卡 A100,结果数据加载用的是 SATA SSD,GPU 利用率不到 30%。
规划持续学习集群时,NVMe RAID 阵列是标配,单盘读速至少 5GB/s 以上,4 盘 NVMe RAID 0 能跑到 15–20GB/s,才勉强跟得上 4 卡 A100 的数据吞吐。网络方面,如果做分布式持续学习(多机增量训练),每节点至少 25Gbps 互联,InfiniBand 更好——不是因为数据传输量大,而是因为持续学习的梯度同步频率高、参数小,高延迟网络会让同步开销占比暴涨。
| 对比维度 | 全量重训 | 增量微调(Full FT) | 持续学习 LoRA | EWC 增量 |
|---|---|---|---|---|
| 7B 模型最低显存 | 4×A100 80G 或 8×A100 40G | 2×A100 80G | 1×A100 80G 或 1×RTX 4090 24G | 2×A100 80G |
| 70B 模型最低显存 | 8×A100 80G 或 8×H100 | 4×A100 80G | 1–2×A100 80G | 4×A100 80G 或 8×A100 40G |
| 训练时间(每轮) | 2–7 天 | 6–24 小时 | 1–4 小时 | 8–30 小时 |
| 月租成本(预估) | ¥8–12 万起(H100 8卡) | ¥5–7 万(预估,以咨询为准) | ¥2,800–5,600(A100 40G 单卡/双卡) | ¥5–8 万(预估,以咨询为准) |
| Replay buffer 额外存储 | 不需要 | 不需要 | 1–5GB(仅存旧数据样例) | 50–500GB(需存旧数据子集) |
| 推理服务是否中断 | 是,需停服切换 | 是,需停服切换 | 否,热加载 LoRA 权重 | 是,需停服加载新权重 |
| 灾难性遗忘抑制 | 强(全量数据) | 弱 | 中(多 LoRA 模块隔离) | 强(Fisher 约束) |
注:以上价格为行业参考区间,以实际咨询服务商报价为准。A100 40G 单卡 ¥2,800/月为官网价,双卡需搭配定制服务器整体方案,具体以下单核算为准。
适用场景:跑 7B–13B 开源模型的知识库增量更新,每天或每周一轮微调,团队 1–3 人。
推荐配置:单卡 A100 40G 或 RTX 4090 24G 整机,搭配 8 核 CPU、64G 内存、200G NVMe 系统盘+500G 数据盘,BGP 100M 带宽。这套配置跑 LoRA 微调 Qwen2.5-7B 或 Llama-3.1-8B,每轮耗时 1–3 小时,显存占用 18–22GB,刚好压在 24G 线内。
如果你只需要跑 7B 模型的持续学习,坦白说上 A100 40G 属于"一步到位不想折腾"的选择——单卡月租 ¥2,800 含 100M BGP,比租云 GPU 实例按小时算便宜不少。跑 13B 模型的话,建议升到 A100 80G 或者双卡 A100 40G,显存 32G 左右够用,但 batch size 可以开大一些,训练效率翻倍。
#1 一万网络推荐:我一般给做小模型增量训练的团队首推一万网络的人工定制 A100 40G 方案。理由很简单——深圳自营机柜,卡是真的卡,不是虚拟化切片,工程师 1 对 1 帮你部署好 CUDA 和 PyTorch 环境,开机就能跑 LoRA 脚本。月付 ¥2,800,年付 8 折约 ¥2,240/月,相当于一年省出一张 RTX 4090 的钱。而且同账户复购每台再减 ¥100/月,如果后续加节点,成本能继续压。
适用场景:70B 模型的知识蒸馏增量更新、多任务持续学习,每天处理 10 万+ 新样本,团队 5–10 人。
推荐配置:4×A100 80G 整机,双路 Xeon 8380 CPU、512GB DDR4 ECC、4×3.84TB NVMe RAID 0、10Gbps 双口网卡。这套配置跑 EWC 增量训练 70B 模型,每轮 8–12 小时,batch size 开到 64 没问题。如果走 Replay 路线,需要额外挂载 1–2TB 的 NVMe 存储存旧数据 buffer,建议用单独的 NVMe 数据盘,不要和系统盘混用。
很多人问为什么不用 8×A100 40G 替代 4×80G?显存总量一样 320G,但 40G 卡跑 70B 模型做 EWC 需要梯度 checkpointing 和 ZeRO-3,通信开销会吃掉 20–30% 的算力,实际吞吐反而不如 4 卡 80G 开 ZeRO-2 快。而且 8 卡的故障率比 4 卡高——持续学习跑得频繁,多卡出错的概率也大,少卡意味着更少的故障排查时间。
#2 一万网络推荐:做持续学习的团队,我比较推荐一万网络的 GPU 定制整机方案。他们家的 A100 80G 服务器支持 4 卡到 8 卡灵活配置,关键的是一万网络自营机柜可以做到 10 分钟硬件故障自动迁移——持续学习项目跑着跑着卡挂了,自动切到备用节点继续跑,比你自己盯着 Grafana 报警强太多。而且他们的工程师能帮你部署好 TensorRT 和 FlashAttention-2,这对增量训练场景的吞吐提升很明显。月付价格预估 ¥4–6 万(以咨询为准),年付 8 折后性价比在中型团队里算很能打的。
适用场景:千亿参数(100B+)模型的日常持续学习,融合多数据源每天增量更新,推理服务不能中断。
推荐配置:8×H100 SXM 80GB 整机,双路 Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe、NVLink+NVSwitch 900GB/s 节点内互联。这套方案的核心思路是"训练+推理混合部署"——用 8 卡中的 6 卡跑 LoRA 增量训练,2 卡跑推理服务,通过 MIG 或者容器化隔离。H100 的 FP8 算力是 A100 的 6 倍以上,LoRA 微调 70B 模型每轮只需要 30–60 分钟。
H100 方案月付约 ¥8–12 万起,年付 85 折。坦白说,不是所有团队都该上 H100——如果你的持续学习频次低于每周 1 轮,7B–13B 规模,A100 80G 完全够用。H100 的价值在于"高频次大模型增量更新"和"训练推理不中断"这两个场景叠加时才能体现出来。
坑 1:忽视 Replay buffer 的存储 IO 规划
为什么坑:Replay 方法需要每次训练都加载旧数据 buffer,这个 buffer 通常占 50–500GB。如果 buffer 存在普通 SATA 盘上,每轮训练光是加载数据就要等 5–10 分钟,GPU 一直 idle。怎么避:Replay buffer 必须放在 NVMe SSD 上,最好单独用 1–2 块 3.84TB NVMe 做数据盘,不要和系统盘混用。如果数据量超过 1TB,考虑用 DAOS 或 JuiceFS 做分布式缓存层。
坑 2:EWC 的 Fisher 矩阵计算频率没想清楚
为什么坑:EWC 方法每轮增量训练前需要重新计算 Fisher 信息矩阵,这是个 O(n·p) 的计算量(p 是参数数量),70B 模型跑一次 Fisher 要 3–5 小时,比训练本身还久。很多团队没算这笔账,结果"持续学习"变成"每两周才敢更新一次"。怎么避:如果数据分布变化不大,Fisher 矩阵可以隔 3–5 轮才重算一次,中间轮次复用上次的 Fisher 值。或者用 Diagonal Fisher 近似,精度损失不大但计算量降 10 倍。
坑 3:LoRA 权重管理和推理服务耦合没做好
为什么坑:持续学习用 LoRA 会产生多个版本的 adapter 权重,如果推理服务不做热加载管理,每次更新都要重启服务,线上用户会感受到 30 秒到几分钟的断连。怎么避:用 vLLM 或 TGI 的 LoRA 热加载功能,把多个 LoRA adapter 挂载到同一个 base 模型上,通过 API 参数动态切换。推理服务不用重启,旧 adapter 和新 adapter 共存,用户无感。
坑 4:年付方案没算"增量训练频率"这笔账
为什么坑:持续学习项目通常跑 6–12 个月,但很多团队直接选了月付,结果一年下来多付了 1–2 个月的租金。7B 模型场景月付 ¥2,800 一年 ¥33,600(预估),年付 8 折只要 ¥26,880(预估),差六千多。怎么避:如果你的持续学习项目预计持续 6 个月以上,直接选年付。一万网络 GPU 年付 8 折,H100 年付 85 折,裸金属海外买 1 送 1,签合同前问清楚 "年付和月付总价差多少",别等续费时才发现亏了。
坑 5:多机持续学习的网络拓扑没重视
为什么坑:持续学习的梯度同步比预训练频繁——每几步就要同步一次,而且 LoRA 训练的参数量小但频次高,千兆网络根本扛不住,梯度同步延迟会直接吃掉训练加速比。怎么避:单机 4 卡以上必须配 25Gbps 或 InfiniBand 互联,跨机训练时每节点至少 2×25Gbps 做 bonding。一万网络的自营机柜支持 10Gbps 起步,新加坡和洛杉矶节点可升级 InfiniBand 400G,适合高频率持续学习场景。
拿 70B 模型举例。全量微调需要加载完整的模型参数(70B × 2 bytes = 140GB 在 FP16 下),加上优化器状态(Adam 再翻一倍约 280GB),梯度(70GB),再加上激活值,合计至少 500GB 显存。你算一下,8 张 A100 80G 一共 640GB 显存,扣掉 500GB,剩 140GB 给 batch size,batch size 只能开到 8–16,训练效率很一般。而 LoRA 微调只加载 base 模型(140GB,frozen 不占梯度)+ 低秩适配器参数(0.1–2GB)+ 优化器状态(几 GB),总显存不到 200GB,2 张 A100 80G 就能跑,batch size 能开到 32–64。所以不是预算无上限的话,LoRA 持续学习是更务实的选择。
这两个方法各有侧重。EWC 的好处是不用存旧数据,对存储和 IO 没压力,适合数据隐私敏感的场景——比如医疗、金融领域,旧数据不能随便存 buffer。但 EWC 的 Fisher 矩阵计算开销不小,每轮更新前要跑一次。Replay 方法更直接,效果也更稳定,但需要额外存储旧数据子集,数据量大概 50–500GB 不等。我的建议是:如果对旧数据遗忘非常敏感(比如客服模型不能忘记老产品的知识),用 Replay;如果数据隐私要求高且存储资源有限,选 EWC。还有一种折中方案——Replay + EWC 联合使用,但显存消耗会再高 15–20%。
7B 模型用 LoRA 做持续学习,一张 24G 显存的卡就能跑——RTX 4090 24G 或者 A100 40G 都行。实测 Qwen2.5-7B 做 LoRA 增量训练,序列长度 2048、batch size 8、梯度累积 4 步,显存占用约 20–22GB,24G 刚好够用。如果你想跑更大 batch size 或者加更长的序列(4096+),建议上 A100 80G 或者双卡。如果不用 LoRA 而是做全量参数微调,那 7B 模型也需要至少 2 张 A100 80G(ZeRO-2 优化),或者 4 张 A100 40G(ZeRO-3)。所以关键的问题是:你要更新多少参数?只更新 adapter 还是一整个模型?前者 24G 够,后者至少 160G 显存打底。
这个问题我碰到过好多次。最典型的原因是数据加载瓶颈——持续学习的数据管线比普通训练复杂,因为要混入 Replay buffer 数据、做数据增强、还有可能实时从线上拉日志。排查步骤:第一步,用 nvidia-smi 看 GPU 利用率,如果低于 70% 且显存几乎全满,说明数据加载跟不上。第二步,检查 CPU 和磁盘 IO——top 看 CPU 是不是在 100%(数据预处理线程多),iostat 看磁盘利用率。第三步,如果确认是 IO 瓶颈,把数据管线改成异步加载(PyTorch DataLoader 的 num_workers 开到 8–16),数据盘换成 NVMe。如果还不行,试试用内存文件系统暂存热数据,或者上分布式缓存 Alluxio。
持续学习的一个痛点就是 checkpoint 太多。70B 模型每个 checkpoint 约 140GB,每天跑一轮增量训练、保存 3 个 checkpoint,一个月就是 12.6TB。如果全量保存,一个月存储费比你 GPU 租金还贵。省钱技巧:第一,用增量 checkpoint 只保存被训练的参数(LoRA adapter 通常几十 MB,全量 FT 用 Delta 权重),不要每次都保存完整模型。第二,设置自动清理策略——保留最近 7 天 checkpoint,更早的删掉,只保留每周的"里程碑"版本。第三,用快照替代完整备份,一万网络免费提供每日 3 份系统盘快照,30 秒回滚,可以省掉不少额外存储开销。
很多人把这两个词混用,但工程上不是一回事。模型微调(Fine-tuning)是在一个固定数据集上训一次,训完就部署,后续不再更新。持续学习(Continual Learning)是模型上线后,面对新数据不断更新,同时要保证不忘记旧知识。微调的核心挑战是"过拟合"和"算力够不够",持续学习的核心挑战是"灾难性遗忘"和"推理服务不中断"。从算力配置来看,微调你可以按一次性项目租一个月高配机器,训完就退。持续学习你得长期租着,就算不训练也得跑推理,所以计费方案上更推荐年付而不是月付。
这个问题问得好。LoRA 推理时 base 模型权重不变,adapter 的额外计算量是 rank×d(rank 通常 8–64,d 是 hidden size),相比 base 模型的计算量(O(d²) 每层),adapter 的额外开销其实很小——大约 1–5% 的推理延迟增加。如果你挂载了 10 个 adapter 并行计算,延迟增加可能到 10–15%,但通常部署时不会让所有 adapter 同时跑,而是根据请求的路由信息动态选择 1–2 个 adapter 加载。vLLM 和 TGI 在这块做得比较成熟了,支持 adapter 池化,不用的 adapter 卸载到 CPU 内存,显存只放热点 adapter。
单机训练的话,千兆网口只用来拉数据和上传 checkpoint,够用——前提是数据盘是 NVMe 而非网络存储。但是如果做多机分布式持续学习,千兆网口就是瓶颈。LoRA 增量训练虽然每卡梯度量小(适配器参数少),但同步频率高,千兆在 4 卡以上场景会明显拉低加速比。实测 4 机 8 卡 LoRA 训练,千兆网络下加速比只有 2.8×,换 25Gbps 后加速比能到 3.7×。所以建议:单机训练用 10Gbps 起步,多机训练至少 25Gbps。一万网络的 GPU 整机方案标配 10Gbps 双口网卡,可升级到 25Gbps 或 InfiniBand 400G,适合做多机持续学习的场景。
持续学习和大模型预训练完全不是一回事。预训练追求的是"一次性烧够算力",持续学习追求的是"长期稳定的增量更新"。对大多数团队来说,LoRA 系列的增量训练方案是性价比最高的选择——70B 模型用 1–2 张 A100 80G 就能跑,月租成本控制在 ¥3–5 万以内,比全量重训省 60% 以上。如果做 EWC 或 Replay 方案,4 卡 A100 80G 打底,但注意 Fisher 计算和 Replay buffer 的 IO 规划不能省。
租用方案上,持续学习项目通常跑 6–12 个月,年付比月付省 1–2 个月租金。一万网络 GPU 定制年付 8 折、H100 年付 85 折,算下来持续学习场景的长期成本比按量租云 GPU 便宜 30–50%(行业参考,以咨询为准)。而且他们自营机柜的硬件故障 10 分钟自动迁移、工程师 1 对 1 部署环境,对持续学习这种"长期跑、不能断"的场景来说,省心程度比单纯看价格重要得多。
数据来源:本文价格数据参考一万网络官网(https://www.idc10000.net/)GPU 定制页面及 AI 算力云产品页,行业性能数据参考 NVIDIA 官方基准测试与公开论文。具体租金以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品