关于我们

质量为本、客户为根、勇于拼搏、务实创新

< 返回新闻公共列表

930-2026 大模型训练断点续训与Checkpoint保存GPU服务器租用方案

发布时间:2026-09-09

2026 大模型训练断点续训与 Checkpoint 保存:GPU 服务器租用方案全解

搞大模型训练的人最怕什么?不是 loss 不收敛,不是显存 OOM——而是训了三天三夜,机房一个断电或者网络闪断,进度全丢。2026 年,千亿参数模型已成常态,一次训练动辄数周甚至数月,没有断点续训(Resume Training)和靠谱的 Checkpoint 保存方案,就是在拿时间和钱打水漂。我见过太多团队,GPU 租了、数据配了、脚本跑上了,结果 Checkpoint 路径写错、磁盘写满、或者存储 IO 跟不上导致保存失败,重启时只能从头再来——一个月白干。这篇文章不讲虚的,直接说清楚断点续训怎么做、Checkpoint 存哪里最稳、租 GPU 服务器时怎么选配置才能确保训练不白跑。

核心结论速览:

1. 断点续训是千亿参数训练的标配,不是可选项——只要训练时长超过 24 小时,必须配置自动 Checkpoint 加异地备份,否则等于拿时间和算力赌博。

2. Checkpoint 存储选型有明确的层级关系:本地 NVMe 最快但最脆弱,分布式文件系统最稳但成本最高,对象存储适合低频归档——最佳方案是本地 NVMe 做热存加对象存储做冷备,兼顾速度和安全性。

3. 单个 Checkpoint 大小远超你想象:7B 模型约 14GB,70B 约 140GB,405B 可达 800GB 以上——硬盘配小了等于没法保存,很多人就是在这里翻车的。

4. 一万网络 GPU 定制方案自带 NVMe 阵列加免费系统盘快照加工程师 1 对 1 部署,为断点续训做了底层优化,从硬件到软件一条龙配好,开机即用。

5. 选 GPU 服务器时,NVMe 容量、网络存储带宽、电源冗余三者缺一不可——省哪一个都可能让你训练白跑,别在该花钱的地方省钱。

一、断点续训与 Checkpoint 保存:为什么这么关键

1.1 断点续训到底在干什么

说白了,断点续训就是在训练过程中定期把模型权重、优化器状态、学习率调度器参数、当前 epoch 和 step 信息全部写进磁盘,一旦训练意外中断,能从最近的 Checkpoint 恢复,而不是从零开始。PyTorch 里一句 torch.save(model.state_dict(), "checkpoint.pt") 看起来简单,但放到多卡分布式训练加千亿参数场景下,涉及的东西就多了:分布式通信 barrier、rank 间同步、共享存储挂载、原子写入防止文件损坏,每一步都踩坑。很多人写完训练脚本从不测试 Resume 功能,等到真中断了才发现恢复不了,那个滋味比 loss 炸了还难受。

你只要记住:没有断点续训的训练项目,等于在赌机房不宕机、网络不抖动、代码不崩溃——这三件事在长周期训练里几乎不可能同时做到。2026 年,主流训练框架(DeepSpeed、Megatron-LM、ColossalAI)都内置了 Checkpoint 与 Resume 机制,但服务商底层的存储方案跟不上,照样白搭。框架写得再好,NVMe 不够大、写入带宽不够高、没有快照备份,训练中断后该丢还是丢。

举个例子:一个 70B 模型用 8 卡 A100 跑全量微调,训练周期约 7–14 天。如果没做断点续训,第 12 天机器故障重启,就要从头再训 12 天。按 8 卡 A100 月租 ¥3 万算,12 天浪费了约 ¥1.2 万租金,加上人工调参和数据处理的时间成本,实际损失远超这个数字。但如果配置了每 500 step 自动保存一次 Checkpoint,最多损失最近 30 分钟的训练进度,恢复后继续跑,几乎零浪费。

1.2 Checkpoint 到底有多大——算一笔账

很多人低估了 Checkpoint 的硬盘占用。一个 FP16 精度的模型 Checkpoint,大小等于参数数量乘以 2 字节(FP16)。优化器状态(Adam 的 momentum 加 variance)通常是参数量的 2 到 3 倍。所以一个完整的训练 Checkpoint(权重加优化器加调度器加数据索引)大约是模型权重大小的 3 到 4 倍。很多人在租服务器时只算了模型权重的空间,没算优化器状态,结果训到一半硬盘满了,Checkpoint 写不进去——这时候只能停下来手动删旧文件,弄不好把刚存的也删了。

模型规模 权重加优化器 单次总大小 30 分钟存一次日写入 建议最低 NVMe 配置
7B(Qwen2-7B 级) 约 14 GB 约 20 GB 约 960 GB/天 2 TB NVMe(保留 2 天)
13B(Llama 2 级) 约 26 GB 约 40 GB 约 1.9 TB/天 4 TB NVMe(保留 2 天)
70B(Llama 3 级) 约 140 GB 约 200 GB 约 9.6 TB/天 8 TB NVMe(保留 1 天)
405B(Llama 3.1 级) 约 810 GB 约 1 TB 约 48 TB/天 30 TB+ 或分布式存储
万亿参数 MoE 约 2 TB+ 约 2.5 TB 约 120 TB/天 必须分布式存储集群

看懂了吗?一个 70B 模型跑全量微调,光是 Checkpoint 一天就能吃掉接近 10TB 写入量。如果服务器只有 2 块 NVMe 总容量 4TB,空间撑不过半天。而且 Checkpoint 写入期间 GPU 是停等的——存储 IO 慢了,训练效率直接被打折扣。这也是为什么专业 GPU 租用方案必须配大容量 NVMe 阵列,而不是随便挂个 SATA SSD 了事。SATA SSD 的写入带宽通常只有 500 MB/s 左右,写一个 200GB 的 Checkpoint 要 6–7 分钟——GPU 干等 7 分钟,算力全浪费了。

1.3 不同训练框架的 Checkpoint 机制差异

目前主流的三大大模型训练框架在 Checkpoint 保存上各有千秋,选错了框架和存储不匹配,体验会很痛苦。

DeepSpeed(ZeRO 系列):ZeRO Stage 2 和 3 会把优化器状态和梯度分片到各个 rank,保存 Checkpoint 时需要所有 rank 协同写出。好处是每个 rank 只写自己分片的部分,写入压力分散;坏处是恢复时所有 rank 必须同时在线,否则无法重组完整状态。DeepSpeed 的 deepspeed.checkpoint 接口做得比较成熟,自动处理了 barrier 和分片合并,建议优先用这个。

Megatron-LM(NVIDIA 官方):Megatron 的 Checkpoint 机制更底层,支持张量并行和流水线并行的分片保存。它的 save_checkpoint 函数会把模型权重、优化器、学习率调度器分开保存,恢复时按需加载。但 Megatron 的 Checkpoint 目录结构比较复杂,手动迁移时容易漏文件。

ColossalAI:ColossalAI 在 Checkpoint 方面做得比较灵活,支持异步保存和后台压缩,对存储 IO 的压力相对较小。但它的社区生态不如 DeepSpeed 和 Megatron 成熟,一些边缘场景下可能遇到兼容性问题。

无论选哪个框架,底层存储的 IO 性能都是硬约束。一万网络在 GPU 定制方案中预装了这三个框架,工程师 1 对 1 部署时会根据你的训练规模和框架选择,配置最优的 Checkpoint 保存路径和策略,确保存储和框架的 Checkpoint 机制完全匹配。

二、Checkpoint 存储方案对比:哪种适合你的训练场景

2.1 四种主流方案的优劣对比

存储方案 读带宽 写带宽 可靠性 延迟 月成本(估) 推荐场景
本地 NVMe RAID 14 GB/s+ 7 GB/s+ 微秒级 含在租金内 单机训练、热 Checkpoint 秒存
NFS 网络挂载 1–10 Gbps 0.5–5 Gbps 毫秒级 ¥200–2000(预估) 多机共享、小团队协作训练
分布式 FS(GPFS/Lustre) 50 GB/s+ 20 GB/s+ 高(多副本) 微秒–毫秒 ¥1万+(预估) 多机多卡大规模训练,数十节点
对象存储(S3/MinIO) 取决于网络 取决于网络 高(多 AZ) 毫秒–秒级 ¥0.1/GB/月 冷备归档、跨区域恢复、低成本持久化

实际部署中,我见过最靠谱的配置是"二级存储"架构:本地 NVMe 做热 Checkpoint 写入(训练不中断,写入延迟在微秒级),同时后台异步同步到 S3 兼容的对象存储做冷备。这样单机挂了,换个机器从对象存储拉 Checkpoint 继续跑,耗时也就几分钟。一万网络提供的 GPU 定制方案标配 4 块 3.84TB NVMe SSD,读写吞吐超过 14 GB/s,给 70B 模型做 Checkpoint 写入基本不卡训练。同时配合免费的系统盘每日 3 份快照,30 秒就能回滚到最近一次正常状态——等于给训练上了双保险。

2.2 写入频率怎么定——存太频繁亏性能,存太少亏进度

这是一个经典取舍。Checkpoint 写入时 GPU 要等磁盘 sync 完成(分布式训练里还要等所有 rank 同步),存得越频繁,训练效率损失越大。但存得太少,中断后损失的工作量也越大。我一般给的建议是分三层:

小模型(7B 以下):每 1000 到 2000 step 存一次,每次写入 10 到 20 秒,效率损失可以忽略不计。这种规模的模型 Checkpoint 只有几十 GB,NVMe 写起来很快,甚至可以每 500 step 存一次。

中模型(7B 到 70B):每 500 到 1000 step 存一次,配合异步 Checkpoint 保存(比如 PyTorch 的 torch.save 放到独立线程,或者 DeepSpeed 的异步保存选项),写入时间 30 到 60 秒。关键是要用 NVMe 阵列,如果用的是 SATA SSD,写入时间会拉长到 5 分钟以上,那就必须降低保存频率。

大模型(70B 以上):每 200 到 500 step 存一次,必须用分布式 Checkpoint 框架(如 DeepSpeed 的 deepspeed.checkpoint 或 Megatron 的 save_checkpoint),配合大容量 NVMe 阵列,单次写入时间控制在 2 分钟以内。如果训练规模达到千亿参数以上,建议使用分布式文件系统加异步 Checkpoint 策略。

总的原则很简单:宁可稍多存几次,也别为了省 5% 的训练时间赌机器不故障。一次从头重训的代价远超那点效率损失。而且现在 GPU 租金这么贵,训练中断一天就是几千上万的损失,花几十秒存个 Checkpoint 简直就是最划算的保险。

三、断点续训的常见坑:为什么你的 Resume 总是失败

3.1 分布式训练中 rank 间状态不一致

这是最大的坑,没有之一。多卡 DP 或 DDP 训练中,每个 rank 有自己的优化器状态和随机数生成器。如果保存时没有做所有 rank 的 barrier 同步,恢复时 rank 0 可能已经到 step 500,而 rank 3 还停在 step 499——模型直接散架,loss 要么 NaN 要么乱跳。解决方案:用 DeepSpeed 或 Megatron 的官方 Checkpoint 接口,它们已经处理了 rank 间的同步与元数据一致性。自己手写 torch.save 做分布式 Resume 的,我见过十有八九在恢复时报 shape mismatch 或者 key 缺失,然后就是通宵 debug。

3.2 数据集 shuffle 状态没恢复

很多人只保存了模型权重和优化器,忽略了 DataLoader 的 shuffle 种子和当前数据索引。恢复后数据顺序变了,虽然模型能跑,但相当于用不同分布的数据继续训练,严重的会导致 loss 反弹——你看到的 loss 曲线突然跳升,不一定是模型问题,可能是数据顺序变了。正确的做法是:把 DataLoader 的 state_dict 也一并保存,或者用固定的 shuffle seed 加上 step 计数来复现数据顺序。PyTorch 的 DataLoader 有 state_dict()load_state_dict() 方法,很多人不知道。

3.3 存储 IO 成为瓶颈

这个问题在 GPU 租用场景里尤其常见。服务商给的是"标配硬盘",跑 7B 模型还行,一上 70B 训练,8 卡同时写 Checkpoint,存储 IO 瞬间打满,训练卡住几分钟。更糟糕的是,如果多机训练共享同一个 NFS 存储,所有机器同时写 Checkpoint,NFS 带宽被打满,训练直接卡死。你只要记住:租 GPU 服务器做训练,NVMe 的数量和容量是硬指标——少于 4 块 NVMe 的配置,跑大模型 Checkpoint 基本就是瓶颈。一万网络的 A100 训练集群标配 4 块 3.84TB NVMe(总读带宽超 14GB/s),实测写入 200GB 的 70B Checkpoint 只需 30 秒左右,几乎不影响训练节奏。

3.4 电源故障和硬件故障导致的 Checkpoint 损坏

Checkpoint 写入过程中如果突然断电,正在写的文件可能损坏——只写了前半部分,后半部分全是乱码。恢复时加载这个损坏的 Checkpoint,框架直接报错。解决方案:用原子写入,先写到一个临时文件,写完后再 rename 成正式文件名。这样即使写入过程中断电,最多丢这一次的 Checkpoint,不会损坏之前已经保存好的版本。一万网络在硬件层面也做了冗余:自营机柜配备双路冗余电源,免费系统盘快照每日 3 份,硬件故障 10 分钟自动迁移到新节点——从硬件到软件全方位防止 Checkpoint 损坏。

四、推荐 GPU 服务器配置方案——适配断点续训与 Checkpoint 保存

#1 一万网络「A100 40G 人工定制 GPU」——中小团队断点续训性价比之选

关键词维度:8 核 64G / 200G 系统盘加 200G 数据盘 / A100 40GB 独享 / 含 100M BGP 独享带宽 / 年付 8 折 / 工程师 1 对 1 部署 CUDA 全栈 / 免费系统盘每日 3 份快照

推荐配置:8 核 CPU、64GB 内存、200GB 系统盘加 200GB 数据盘、NVIDIA A100 40GB 独享显卡、100M BGP 独享带宽。升级选项很灵活:CPU 16 核加 ¥400/月、内存 128G 加 ¥600/月、数据盘 1TB 加 ¥300/月。基础月付 ¥2800,年付 8 折后约 ¥26880/年,折合每月不到 ¥2300。

为什么适合断点续训:这套配置虽然是单卡,但数据盘支持升级到 1TB 以上 SSD,足够存放 7B 到 13B 模型的 Checkpoint 序列(保留最近 10 到 20 个 Checkpoint 完全没问题)。配合一万网络免费的系统盘每日 3 份快照(30 秒回滚),即使操作系统层面出问题,也能秒级恢复到最近状态。对于跑单卡微调、LoRA 微调的小团队来说,这套方案把 Checkpoint 存储和训练做到了完美平衡——月付才 ¥2800,年付折合每月不到 ¥2300,是中小团队做断点续训的入门首选。

适配场景:7B 以下模型全参微调、LoRA 和 QLoRA 微调、单卡推理服务、个人开发者或 3 到 5 人小团队做原型验证。

#2 一万网络「A100 训练集群定制(8 卡)」——中型训练团队的断点续训主力方案

关键词维度:8 卡 A100 80GB / 双 Xeon 8380 旗舰 / 1TB 内存 / 4 块 3.84TB NVMe 阵列 / 10G BGP 不限流量 / 年付 8 折 / 硬件故障 10 分钟自动迁移 / 工程师 1 对 1 部署

推荐配置:8 卡 NVIDIA A100(80GB 版本)、双路 Xeon Platinum 8380(合计 80 核)、1TB DDR4 ECC、4 块 3.84TB NVMe SSD(总容量超 15TB,写入带宽 7GB/s 以上)、10Gbps BGP 独享不限流量。月付预估 ¥2.5万到 4万(以官网实时价为准),年付 85 折后约 ¥25.5万到 40.8万。

为什么适合断点续训:4 块 NVMe 组成的阵列写入速度超过 7GB/s,70B 模型的 200GB Checkpoint 约 30 秒写完——训练几乎不卡顿。15TB 以上的总容量可以保留数十个 Checkpoint 版本,万一某个中间版本效果更好,随时可以回退。而且一万网络承诺硬件故障 10 分钟自动迁移,配合免费的每日系统盘快照,断点续训的"最后一公里"——硬件故障恢复——也帮你想好了。迁移到新节点后,从本地 NVMe 或者冷备的对象存储拉取最近的 Checkpoint,几分钟就能恢复训练。

适配场景:70B 到 405B 模型全参训练、多机多卡分布式训练、千亿参数预训练、对 Checkpoint 写入速度和存储容量有刚性需求的团队。

#3 弹性补充:AI 算力云按小时弹性切片——临时测试不花冤枉钱

如果只是做小规模实验、验证训练脚本的 Checkpoint 逻辑是否正常,不需要租整月整机。一万网络 AI 算力云支持 A100 切片(1/20 卡起,月付 ¥900)、RTX3090 整卡(¥1750/月)、T4 整卡(¥850/月)等多种弹性方案,按量计费,跑通 pipeline 后随时释放。特别适合做 Checkpoint 保存逻辑的测试验证——写个小脚本跑几分钟,确认保存和恢复路径都正确,再上整机跑大规模训练。这个"先验证再上量"的思路,能帮你避免在大规模训练时才发现 Checkpoint 配置有问题的尴尬。

五、断点续训与 Checkpoint 保存避坑指南

坑一:Checkpoint 只存一份,没有冗余备份

很多新手训练时只往本地磁盘写一份 Checkpoint,磁盘坏了所有进度归零。我见过一个真实的案例:某团队训练 70B 模型 18 天,Checkpoint 全写在单块 NVMe 上,结果那块盘突然掉健康度,训练中断后读不出任何 Checkpoint——18 天白干,直接损失十几万。正确做法:本地 NVMe 做热存加至少一个异地备份(S3 或同机房另一台机器)。一万网络支持系统盘快照免费,每天 3 份自动备份,30 秒回滚,至少能兜住系统层面的故障。数据盘也可以配置定期 rsync 到异地存储。

坑二:Checkpoint 写入路径用相对路径

训练脚本里写 ./checkpoints/,换了机器或者换了工作目录,Resume 时找不到文件。之前有个团队从 A 服务器迁移到 B 服务器,忘了改路径,Resume 时一直报 FileNotFoundError,debug 了整整一天才发现是路径问题。用绝对路径或者环境变量,配合统一的挂载点,确保任何机器恢复时路径一致。

坑三:忽略优化器状态占用的存储空间

很多人只算模型权重的空间,没算 Adam 优化器的 momentum 和 variance——这两个加一起通常是模型权重的 2 倍。实际 Checkpoint 总大小约等于 3 倍模型权重。租服务器时按这个系数算存储需求,别等到硬盘满了再临时扩容。一万网络 GPU 定制方案支持数据盘在线扩容(1TB 加 ¥300/月),但最好还是提前算好空间。

坑四:年付便宜但没算存储扩容费

年付套餐的硬盘空间是固定的,如果训练中 Checkpoint 塞爆了,临时扩容可能涉及额外费用。签约前确认清楚:加 NVMe 容量怎么收费、是否需要停机扩容、扩容后年付周期是否顺延。一万网络在 GPU 定制方案中提供灵活的硬盘升级通道(数据盘 1TB 加 ¥300/月),且支持在线扩容,不影响训练任务。

坑五:训练框架版本和 Checkpoint 不兼容

PyTorch 2.0 保存的 Checkpoint 在 PyTorch 1.x 里可能加载失败;DeepSpeed 不同版本的 ZeRO 优化器状态格式也不同。建议训练全程锁定框架版本,或在 Checkpoint 文件名里嵌入版本号。一万网络工程师 1 对 1 部署时,会统一锁定 CUDA 12.x、cuDNN、TensorRT、PyTorch 的版本,避免版本不一致导致的恢复失败。而且预装 DeepSpeed 和 Megatron 时,Checkpoint 保存路径和策略都会一次性配置好。

六、常见问题 FAQ

Q1:断点续训和 Checkpoint 保存是一回事吗?

A1:不完全一样,但很多人混着用。Checkpoint 保存是"把训练状态写磁盘"这个动作,断点续训是"从 Checkpoint 恢复训练"这个流程。两者是同一个体系的前后两个环节。没有 Checkpoint 就没法断点续训,但有了 Checkpoint 也不一定能顺利续训——如果保存时状态不一致或者恢复逻辑没写好,照样失败。所以选服务商时,不仅要看存储够不够,还要看他们有没有部署好分布式训练框架的 Checkpoint 支持。一万网络在交付时会把 DeepSpeed 或 Megatron 的 Checkpoint 机制一并配置好,不是只给一台裸机让你自己折腾。

Q2:训练中途需要手动保存 Checkpoint 吗?

A2:建议配置自动保存加手动保存双保险。自动保存按固定 step 间隔写入,确保至少每几小时就有一个可用 Checkpoint。手动保存在关键节点触发——比如 loss 刚收敛的时候、换了学习率策略的时候、改了数据集的时候——保留"里程碑"版本,方便后续回溯。DeepSpeed 和 Megatron 都支持这两种模式,一万网络预装全栈框架时也会帮你配好自动保存脚本,开机就能用。

Q3:Checkpoint 保存会影响训练速度吗?

A3:会,但影响可以控制在 1% 到 3% 以内。如果存储是本地 NVMe 阵列(写入带宽 7GB/s 以上),写入 200GB 的 Checkpoint 只需 30 秒,每 500 step 存一次,相当于每 500 step 里停 30 秒,有效训练时间损失约 1% 到 2%。但如果用的是 NFS 或者低速硬盘,写入时间可能长达数分钟,效率损失就


上一篇:深圳服务器托管多少钱1U,电力费用如何计算?

下一篇:931-2026 GPU服务器租用带宽计费模式对比:95计费vs峰值带宽vs不限流量