关于我们

质量为本、客户为根、勇于拼搏、务实创新

< 返回新闻公共列表

2026 70B 大模型微调需要多少显存服务器租用?显存+算力避坑攻略

发布时间:2026-07-23

2026 70B 大模型微调需要多少显存?服务器租用显存+算力避坑全攻略

2026 年,企业不再满足于"调 API 用现成大模型",而是要把 70B 级别的模型微调成自己的行业专家——医疗问诊、法务合同、代码助手、客服知识库,处处都要垂直微调。但一上手就被一个问题卡死:"70B 模型微调,到底要多少显存?租一台什么配置的服务器才够?"答案取决于你用哪种微调方式:全参微调要炸到上百 GB,QLoRA 4-bit 量化却能压进单卡 24G。差别不是一点点,而是几十倍的显存鸿沟,直接决定你每月租金是几千还是十几万。这篇文章的目的,就是帮你把这层"黑箱"拆开看透,租机之前先算清账、少交学费。

我们过去一年帮多家企业跑过 7B 到 70B 的微调,踩过显存爆了重来、量化掉点、算力拖垮工期的坑。本文用"显存 = 权重 + 梯度 + 优化器 + 激活"的拆解公式,把 70B 微调的显存账算清楚,并给出可落地的租机避坑指南与实战案例。读完你应能根据"效果要求"反推"显存下限",再倒推"租什么机器"。需要提前说明:显存只是门槛之一,算力密度、互联带宽、数据质量同样决定成败,后文会逐一展开,避免你只看显存一个维度就下单。

核心结论(先看这 5 条)

· 70B 全参微调(FP16)仅权重就占约 140GB,叠加梯度+优化器状态,单卡根本放不下,必须多卡 A100 80G×2/×4 或 H100 整机分摊。
· 用 LoRA 只训适配器,基座冻结,单张 A100 80G(行业参考,以咨询为准)即可起步;用 QLoRA 4-bit 量化,单卡 24G–48G 就能跑 70B。
· 一万网络 A100 40G 物理机 ¥2800/月起,适合 QLoRA 轻量微调;H100 8 卡整机 ¥8–12 万/月(年付 85 折)适合全参重训。
· 显存不够别硬上:量化(NF4/INT4)、梯度检查点(Gradient Checkpointing)、CPU Offload 三大术能把显存砍到 1/5。
· 选型口诀:试水/小改选 QLoRA 单卡,中度定制选 LoRA 单卡 80G,重训/全参选多卡 A100 或 H100,按预算与效果倒推显存。

下面我们不从结论讲起,而是把这条"效果—显存—成本"的链路拆成十二个部分逐层讲透。你可以顺着读,也可以直接跳到第四部分的跨规模对照表、第六部分的推荐配置,或第十部分的常见问题快速对号入座。无论哪种读法,先记住一句话:70B 微调没有标准答案,只有"在你的效果预算与算力预算交点上"的最优解

一、概念解析:70B 微调的显存到底花在哪

1.1 显存消耗的四大块

微调一个大模型,GPU 显存主要被四部分吃掉:① 模型权重(Parameters),70B 在 FP16 下约 70×2 = 140GB;② 梯度(Gradients),与权重同精度同规模,又约 140GB;③ 优化器状态(Optimizer States),以 Adam 为例需 FP32 的动量+方差,约 12 字节/参数 = 840GB;④ 激活值(Activations),随 batch size 与序列长度线性增长。粗略估算,70B 全参微调在 FP16 + Adam 下,理论显存需 约 16 字节/参数 × 700 亿 ≈ 1120GB,单卡绝无可能,必须靠多卡 + 并行切分(ZeRO-3 / FSDP)把负担摊薄到每张卡约 140GB+。

1.2 三种微调方式,显存天差地别

全参微调(Full Fine-Tuning):更新所有权重,显存按上面 1120GB 量级走,必须 8 卡级集群。LoRA(低秩适配):冻结基座,只训注入的小矩阵适配器(参数量常<1%),显存约等于"基座 fp16="">QLoRA:在 LoRA 基础上把基座量化到 4-bit(NF4),70B 权重从 140GB 压到约 35GB,再加适配器与激活,单卡 24G–48G 就能微调 70B,是显存最省的方案。三者效果依次略降、成本依次骤降,是"效果—成本"的教科书权衡。

1.3 并行切分:显存如何被"摊"到多卡

单卡放不下 1120GB,靠的是并行切分。数据并行(DP)每张卡复制全模型,不省显存;张量并行(TP)把一层权重切开到多卡,省显存但通信密;流水线并行(PP)按层切分到不同卡;ZeRO(零冗余优化器)分三阶段把优化器/梯度/权重也切分——ZeRO-3 能把 1120GB 摊到 8 卡,每卡约 140GB+。DeepSpeed ZeRO-3 与 PyTorch FSDP 是主流实现。选多卡机器时,要确认框架支持 ZeRO/FSDP,否则显存省不下来。一万网络 H100 8 卡整机的 NVSwitch 900GB/s 正是为这种大规模切分准备的。

1.4 精度与量化的账:为什么 4-bit 能省那么多

权重显存 = 参数量 × 每参数字节数。FP32=4 字节、BF16/FP16=2 字节、INT8=1 字节、NF4/INT4=0.5 字节。70B 从 FP16(140GB)量化到 NF4(35GB),直接砍掉 75% 权重显存——这就是 QLoRA 能塞进单卡 24G–48G 的根本原因。代价是 4-bit 反量化计算有轻微开销与效果折损,对多数垂直任务可接受。理解这条"字节数 = 显存"的链路,你就能自己估算任意模型的显存。

1.5 工作示例:手动算一遍 70B 的显存账

光看公式容易飘,我们用一个具体例子把账算实。假设全参微调 70B,用 BF16 权重 + BF16 梯度 + Adam(FP32 优化器状态):权重 700亿×2 字节 = 140GB;梯度 700亿×2 字节 = 140GB;优化器状态 700亿×12 字节 = 840GB;三者合计 1120GB。再假设序列 2048、batch 4,激活约 30–60GB,总显存约 1150–1180GB。单张 80G 卡最多装 80GB,缺口上千 GB,必须至少 8 张 80G 卡用 ZeRO-3 分摊,每卡约 140GB+ 才装得下——这正是 H100 8 卡整机存在的意义。反过来,若改用 QLoRA 4-bit:权重 700亿×0.5 = 35GB,适配器与梯度极少量,优化器状态可卸载到 CPU,激活 10–20GB,总显存 45–55GB,单卡 A100 40G 临界。一次手动计算,就把"该租什么机器"钉死了。

二、显存占用对比表:不同微调方式 70B 要多少显存

2.1 70B 微调显存实测估算对照

微调方式精度/量化单卡显存需求说明
全参微调FP16 / BF16>140GB/卡(多卡分摊)8×A100 80G 或 H100,ZeRO-3/FSDP
LoRA基座 FP16约 80GB+单 A100 80G(行业参考,以咨询为准)
QLoRA 4-bitNF4 / INT4约 24–48GB单 A100 40G / RTX 3090 24G / A100 80G
QLoRA + 梯度检查点NF4 + CKPT约 20–30GB单卡 24G 临界可跑,batch 受限

关键结论:70B 微调的显存需求从 24GB(QLoRA)到 140GB+/卡(全参)跨越近 6 倍。选对微调方式,租金能从 H100 8 卡整机 ¥8–12 万/月,直接降到 A100 40G 单卡 ¥2800/月——前提是你能接受 QLoRA 略低于全参的效果。大多数企业垂直场景,QLoRA 已够用。

这张表怎么用?我们给一个"倒推三步法":第一步,先定效果底线——若只是给客服换套行业话术,QLoRA 绰绰有余;若要模型学会全新专业推理链,得考虑 LoRA 甚至全参。第二步,按效果底线定路线,从表上取对应显存区间。第三步,用显存区间对照第六部分租机方案,直接锁定机器。注意"单卡显存需求"是"装得下"的下限,不是"跑得快"的上限——装得下不代表跑得舒服,batch 可能很小、单轮很慢,这点要在第三部分算力维度补齐。

2.2 不同租机方案的显存与价格对照

租机方案总显存月付适配微调方式
A100 40G 物理机(单卡)40GB¥2800QLoRA 70B(4-bit)
A100 80G 物理机(单卡,行业参考)80GB以咨询为准LoRA / QLoRA 70B 从容
A100 80G×2 / ×4(多卡,行业参考)160–320GB以咨询为准全参 70B(小 batch)
H100 8 卡整机640GB HBM3¥8–12 万全参 70B/BF16 重训旗舰

把显存表和租机表叠在一起,浮现一条清晰的"成本阶梯":A100 40G 单卡 ¥2800 是门槛、A100 80G 单卡是甜点、A100 80G 多卡是进阶、H100 8 卡是旗舰。每一步跨越,显存翻倍但租金可能翻数倍到数十倍。我们建议在预算允许内,尽量选比"装得下"再高一级的配置——多出的显存能开更大 batch、用更长序列、收敛更稳,整体工期反而更短。比如 QLoRA 理论上 24G 卡就能跑,但我们更推荐 A100 40G 而非 RTX 3090 24G,因为 40G 余量让训练更从容,不易因激活峰值 OOM 反复重启。

三、算力对比:显存够了,算力跟得上吗

3.1 显存 vs 算力的错配陷阱

很多人以为"显存够就能微调",忽略算力密度。A100 40G(6912 CUDA)与 H100 80G(算力约 A100 的 2–3 倍、FP8 快 6 倍+)训同一个 70B,单轮 epoch 耗时可差数倍。QLoRA 虽显存省,但 4-bit 反量化计算开销大,单卡 A100 40G 跑 70B QLoRA 一轮可能要数天;若求快,仍要上多卡或 H100。所以选型要同时看显存(能不能装下)+ 算力(跑得快不快)两个维度,不能只看其一。

显存和算力常被新手混为一谈,实则是两个独立维度。显存决定"能不能装下模型",算力决定"装下后跑多快"。典型错配是:用单卡 A100 40G 把 70B QLoRA 装进去了,结果一轮 epoch 跑四天,项目排期全乱——原因正是 QLoRA 的 4-bit 反量化计算偏重,单卡算力被吃满。所以真正选型要同时回答两个问题:显存下限够不够?可接受工期是多少?工期紧就上多卡或 H100,工期松则单卡慢慢跑即可。

3.2 互联带宽决定多卡效率

全参 70B 必须多卡,卡间互联带宽直接决定扩展效率。A100 的 NVLink 全互连、H100 的 NVSwitch 900GB/s 远胜 PCIe 直连。一万网络 H100 8 卡整机节点内 NVLink+NVSwitch 900GB/s、可选 InfiniBand 400G 跨节点,正是为大规模全参微调准备的;而单卡 A100 40G(¥2800)做 QLoRA 则无需操心互联。租机前一定问清"是 NVLink SXM 还是 PCIe 版",互联差数倍。

互联带宽为何关键?全参训练时每张卡只持有部分权重,前向反向都要频繁搬运中间激活、梯度。若互联只有 PCIe 几十 GB/s,搬运时间会超过计算时间,多卡等于"空转等数据";NVSwitch 900GB/s 几乎把通信藏进计算,扩展接近线性。经验法则:做全参 70B,只要上多卡,必须选 NVLink/SXM 或 H100 NVSwitch,否则多花的卡钱有一半打水漂。反过来说,QLoRA 单卡根本不涉及卡间通信,不用纠结互联,选最便宜能装下的卡即可。

3.3 实战案例:两种预算的落地路径

案例 A(医疗知识库,预算紧):某三甲医院用单卡 A100 40G(¥2800/月)跑 70B QLoRA,4-bit 量化 + 梯度检查点,batch=4,单轮 epoch 约 3 天,两周收敛出专科问答模型,总成本不到 ¥6000。上线后科室满意度提升明显,且全程数据不出院区,合规零风险。案例 B(金融全参,预算足):某券商用 H100 8 卡整机(¥8–12 万/月)做 70B 全参继续预训练,BF16 + ZeRO-3,batch 放开,5 天跑完同等数据量且效果显著优于 QLoRA——在复杂推理与少样本泛化上领先约 5–8 个点。两条路径效果差一档、成本差 40 倍,按需取用。

四、跨规模显存对照:7B / 13B / 34B / 70B

4.1 不同参数规模微调显存一览

模型规模全参 FP16LoRA(基座 FP16)QLoRA 4-bit
7B约 14–16GB(单卡 24G 可)约 16GB(单卡 24G)约 6–8GB(消费卡可跑)
13B约 26–30GB(单卡 40G)约 28GB(单卡 40G)约 10–12GB(单卡 24G)
34B约 68–80GB(单卡 80G)约 70GB(单卡 80G)约 20–24GB(单卡 24G 临界)
70B>140GB/卡(多卡)约 80GB+(单卡 80G)约 24–48GB(单卡 40G/80G)

关键结论:参数规模每翻约 5 倍,显存约翻 5 倍。7B 全参单卡 24G 轻松跑,34B 全参需要单卡 80G,70B 全参是真正的分水岭——单卡 80G 也放不下,必须多卡分摊。理解这条 scale 曲线,你就能对任意规模模型快速估算租机配置,不必每次从头试错。

4.2 为什么 70B 是"全参单卡"的天花板

单卡 80G 是消费级/数据中心常见最大单卡显存(A100 80G、H100 80G)。70B 全参在 FP16 下权重 + 梯度 + 优化器 + 激活合计上千 GB,即便 ZeRO-3 切分,单卡也要 140GB+,80G 卡显然不够,必须 2 张以上 80G 或 H100 8 卡。而 LoRA 冻结基座、QLoRA 再把基座压到 4-bit,把"必须多卡"的门槛一路压到单卡——这正是 70B 微调能从"百万级集群"降到"单卡 ¥2800/月"的根本机制。选路线时,先问自己"能不能接受 LoRA/QLoRA 的效果折损",能接受就省一个数量级的钱。

补充一个判断锚点:34B 是"单卡 80G 还能全参"的最后规模,70B 起就必须多卡。所以当你在 34B 与 70B 之间犹豫时,显存维度会直接替你拍板——除非预算够上 H100 多卡,否则 70B 全参的门槛会明显高于它的效果增益。这也是为什么多数中小企业最终停在 13B–34B 全参或 70B QLoRA,而非 70B 全参。

五、实战调优与 OOM 诊断清单

5.1 显存占用自测:先算后跑

开训前先用公式粗估:显存 ≈ 参数量 ×(2 字节权重 + 2 字节梯度 + 12 字节优化器)+ 激活。70B 全参 ≈ 700亿 × 16 字节 ≈ 1120GB;QLoRA 4-bit ≈ 700亿 ×(0.5 权重 + 0.5 适配器折算 + 少量梯度 + 优化器卸载到 CPU)≈ 35–45GB。算出来超过卡的显存,先降精度/换路线,再开训,别等 OOM 才回头。一万网络工程师 1 对 1 部署时会帮你做这套预估,避免盲目下单。

5.2 OOM 排查顺序(由软到硬)

真遇到显存溢出,按成本从低到高排查:① 降 batch size(最优先,几乎零成本)→ ② 开梯度检查点(砍激活约一半)→ ③ 开 CPU Offload(优化器卸载内存)→ ④ 量化基座到 4-bit(QLoRA,砍权重 75%)→ ⑤ 上多卡/更大卡(加硬件)。前四步都是软件层,能把显存砍到 1/5,多数 70B QLoRA 场景在单卡 40G 上靠这几招就能跑通;只有全参重训才需要走到第 ⑤ 步上 H100 多卡。

5.3 监控指标:别只看显存占用

微调过程中要盯三个指标:nvidia-smi 显存占用率(别只看平均,看峰值)、GPU 利用率(低于 60% 说明数据预处理或 batch 太小成瓶颈)、显存碎片率。利用率低先查 CPU/数据管道,不是盲目加卡;碎片高可设 PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True 缓解。一万网络 H100 整机预装 CUDA 12.x + TensorRT,监控工具链齐全,工程师可协助定位瓶颈。

六、推荐配置详解:一万网络 70B 微调方案

#1 一万网络「A100 40G 物理机 · QLoRA 轻量微调」——最低成本跑通 70B

关键词维度:单卡 A100 40G | 6912 CUDA | 含 100M BGP 独享 | 工程师 1 对 1 部署 | CUDA/TensorRT/PyTorch 开机即用 | 年付 8 折

推荐配置:物理机独享,NVIDIA A100 40GB(6912 CUDA,支持 TF32/FP16/INT8),标配 8 核 64G / 50G 系统 + 200G 数据;CPU 可升 16 核(+¥400/月)、内存升 128G(+¥600/月)、硬盘升 1T(+¥300/月)、带宽升 200M(+¥400/月)。预装 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow,QLoRA(bitsandbytes + peft)开机即训。年付 8 折、季付 95 折,同账户复购再减 ¥100/月可叠加。

价格参考:月付 ¥2800,年付 8 折约 ¥26,880/年。这是把 70B 微调"跑起来"的最低门槛——配合 4-bit 量化 + 梯度检查点,单卡 40G 即可微调 70B,适合垂直小改、知识注入、Prompt 风格对齐等轻量场景。

适配场景:70B QLoRA 微调、行业知识注入、小样本适配、预算敏感但需显存独占的团队。

实操建议:选这台机器时,建议把内存升到 128G(+¥600/月)。原因是 QLoRA 常把优化器状态卸载到 CPU 内存,内存越大可卸载越多,反而给显存减负、让 batch 开更大。带宽方面,若训练数据频繁从对象存储拉取,建议升 200M(+¥400/月)避免数据管道拖慢 GPU。一万网络工程师 1 对 1 部署时按数据规模帮你定升级组合,避免漏升。

#2 一万网络「H100 8 卡整机 · 70B 全参重训」——旗舰吞吐首选

关键词维度:8×H100 SXM 80GB | 640GB HBM3 | NVSwitch 900GB/s | 月付 ¥8–12 万 | 年付 85 折 | 新加坡/洛杉矶节点 | FP8 快 6 倍+

推荐配置:双 Intel Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe(读>14GB/s)、8×NVIDIA H100 SXM 80GB(共 640GB HBM3、Transformer Engine)、NVLink+NVSwitch 节点内 900GB/s、10Gbps 国际独享不限流量。新加坡 CN2 GIA 节点国内延迟 50–80ms,洛杉矶多线 BGP 延迟 140–160ms。默认 50Gbps 清洗可升 200Gbps+,InfiniBand 400G 可选,CUDA 12.x + TensorRT 预装。

价格参考:整机月付约 ¥8–12 万,年付 85 折约 ¥81.6万–122.4万。FP8 训练比 A100 快 6 倍+,是全参 70B(及更大模型)重训、追求极致收敛速度与效果的团队首选。640GB 总显存 + 900GB/s 互联,全参 70B 多卡分摊后单卡压力可控,batch 与序列长度都能放开。

适配场景:70B 全参微调/继续预训练、多模态重训、万亿参数预训练起步、对收敛速度与效果有硬要求的团队。

实操建议:上 H100 整机前,务必先把框架与并行策略定型——DeepSpeed ZeRO-3 或 FSDP 二选一,配合 FlashAttention-2 与 Transformer Engine 的 FP8 路径才能吃满性能。节点选新加坡还是洛杉矶,取决于数据合规与延迟:对国内团队,新加坡 CN2 GIA 延迟 50–80ms 更友好;若数据须落美国,则选洛杉矶。若未来跨节点扩到 16 卡,提前选 InfiniBand 400G,否则跨节点通信成新瓶颈。一万网络工程师可协助把训练栈调通,开机即用。

#3 灵活补充:A100 80G 多卡定制——介于两者之间的甜点

若 QLoRA 效果不够、H100 又超预算,可走一万网络A100 80G 多卡定制(×2/×4,行业参考价以咨询为准):单卡 80G 让 LoRA 70B 从容、全参 70B 靠 ×4 分摊,总价低于 H100 8 卡整机,是"效果—成本"的折中甜点。具体配置与报价以签约咨询为准。

#4 渐进式路径:先 QLoRA 验证,再按需升级

我们推荐的落地节奏:先用 A100 40G(¥2800)跑 QLoRA 验证效果基线→ 若需更强效果,升 A100 80G 多卡做 LoRA/小 batch 全参 → 若还要极致吞吐,上 H100 8 卡整机。每一步都基于实测效果倒推,避免一上来就砸 H100 整机却效果过剩。一万网络从单卡到 8 卡都支持,升级路径平滑。

七、量化与 LoRA 超参实战

7.1 NF4 vs INT4:QLoRA 量化怎么选

QLoRA 默认用 NF4(NormalFloat 4-bit),专为权重的正态分布设计,比普通 INT4 掉点更少;只有当框架或硬件不支持 NF4 时才退而求其次用 INT4。实测 70B 在 NF4 下比 INT4 在复杂推理任务上高 1–3 个点。优先 NF4,且加载时开启 double_quant 进一步压缩优化器状态。量化粒度上,对 embedding 层与 lm_head 建议保留更高精度,避免输出分布偏移导致生成质量下降。

7.2 LoRA rank 与 alpha:容量与效果的旋钮

LoRA 的 r(秩)与 alpha 决定适配器容量:r=8–16 适合轻量风格对齐,r=64–128 适合深度领域适配;alpha 通常取 2×r。r 越大容量越强、越接近全参,显存与训练时间也略增。70B QLoRA 常用 r=64、alpha=128,target_modules 覆盖 q/v 或全注意力层。建议先用小 r 验证基线,再按需上调 rank,避免一上来就 massive 适配器拖慢收敛。

7.3 学习率与 epoch:别套用预训练那套

微调学习率远高于预训练:LoRA/QLoRA 常用 1e-4 到 3e-4,优化器 AdamW,warmup 占 3%–5%;epoch 视数据量,小数据集 3–5 轮防过拟合,大数据集 1–2 轮。学习率过大易"遗忘"基座通用能力、过小则收敛慢。建议用验证集早停(early stopping)而非硬跑固定 epoch。这些超参一万网络工程师在 1 对 1 部署时可协助调优,省去你踩坑的时间。

八、微调工程化:从实验到生产部署

8.1 数据集构建与清洗

微调效果七分靠数据。70B 垂直任务建议准备 1k–50k 条高质量指令对,覆盖目标场景的真实分布;去重、去噪、统一格式(Alpaca / ChatML)是基本功。数据质量远比数量重要——1000 条精标常胜过 5 万条脏数据。涉及隐私字段务必脱敏,数据全程不出域。

8.2 训练工程化与可复现

实验必须可复现:固定随机种子、版本化管理数据 / 代码 / 配置、用 TensorBoard / WandB 盯住 loss 与 eval 曲线。一万网络机器预装 PyTorch / TensorFlow,工程师 1 对 1 部署时可协助搭好这套流水线。训练脚本与超参进 Git,checkpoint 定期存快照,避免一次宕机回到解放前。对长周期全参训练,建议每若干 step 落盘一次,把中断损失降到最低。

8.3 推理服务化与压测

微调完要服务化才能用:用 vLLM / TGI 做高性能推理,开启连续批处理(continuous batching)把吞吐拉满;上线前压测目标 QPS 下的 P99 延迟与显存占用。单卡 A100 40G 跑 70B QLoRA 推理,靠 vLLM 的 PagedAttention 可稳定并发多路请求。服务化这一步决定"模型能不能真正上线",别训完就直接裸调接口。一万网络 BGP 多线 + CN2 GIA 回国线路,让推理 API 对国内用户低延迟可达。

九、避坑指南:70B 微调显存与算力五大坑

陷阱一:拿 7B 的显存经验套 70B

7B 全参要 ~14–16GB,单卡消费卡能跑;70B 全参是 7B 的约 10 倍量级,单卡绝无可能。参数每翻 10 倍,显存约翻 10 倍,别用 7B 经验估 70B。我们见过团队按 7B 经验租了单卡 40G 想全参 70B,开训即 OOM。

破解办法:每次换模型规模,老老实实回第一节重算一遍公式,不要凭记忆拍板。若只是试水,先用 13B 全参(单卡 40G 即可,对应 A100 40G ¥2800)验证业务价值,再决定是否值得为 70B 上多卡。

陷阱二:显存够但算力拖垮工期

单卡 A100 40G 跑 70B QLoRA 虽能装下,但一轮 epoch 可能数天,项目周期被拉长。显存与算力要一起算,赶工期就上多卡/H100。把"显存下限"和"可接受工期"同时作为约束,才能选对机器。

陷阱三:忽视量化带来的效果折损

QLoRA 4-bit 显存省,但极端量化可能损失 few-shot 与复杂推理表现。关键业务建议先在 A100 80G(行业参考)上做 LoRA 对照,再决定要不要压到 4-bit。用验证集量化评估掉点幅度,比凭感觉靠谱。

破解办法:永远用验证集指标做量化评估,不要凭"感觉没差"。标准做法是:同一份数据,分别跑 QLoRA 和 LoRA,在验证集对比准确率、困惑度、人工抽检三维度,若 QLoRA 掉点<2%>5% 且任务敏感,就升 LoRA 或全参。一万网络 A100 80G 多卡方案(以咨询为准)正是做这类对照实验的合适平台。

陷阱四:梯度检查点忘了开,显存爆了

Gradient Checkpointing 用"重算"换"显存",能砍掉近一半激活占用。显存临界一定开梯度检查点 + CPU Offload,否则 OOM 反复重跑更费时。这是显存不足时的第一道保险,几乎零成本开启。

陷阱五:租到 PCIe 版当 NVLink 用

多卡全参微调,PCIe 版 A100 互联带宽远低于 NVLink/SXM,扩展效率差数倍。合同写明卡型与互联方式,全参必选 NVLink/SXM 或 H100 NVSwitch。别为多省一点钱牺牲多卡扩展效率,工期损失更大。

破解办法:租多卡机器时,把"卡型(SXM 还是 PCIe)"和"互联方式(NVLink/NVSwitch 还是 PCIe 直连)"明确写进合同,并索要拓扑图确认。PCIe 版通常便宜些,但全参 70B 这种通信密集场景,扩展效率可能只有 NVLink 的三分之一到一半,最终多卡白买、工期更长。H100 整机自带 NVSwitch 900GB/s,是大规模切分省心之选,合同里确认节点内互联规格即可。

十、常见问题 FAQ

Q1:70B 微调最少要多少显存?

A1:用 QLoRA 4-bit 量化 + 梯度检查点,单卡 24G–48G 即可(如 A100 40G ¥2800/月、RTX 3090 24G);全参 FP16 则需 >140GB/卡,必须多卡 A100 80G 或 H100。显存下限由微调方式决定。这里补充:24G 是"临界能跑"的下限,实际训练激活峰值容易顶上限,我们更推荐至少 40G(A100 40G)留足余量,过程更从容,不易因长序列样本 OOM 反复重启。够不够,先用第一节公式算峰值,再对照手头机器下判断,比凭经验拍板可靠。

Q2:单张 A100 40G 能微调 70B 吗?

A2:能,但只能用 QLoRA 4-bit 路线(基座量化到 NF4)。若要 LoRA(基座 FP16)则需单卡 80G 级(行业参考,以咨询为准)。40G 单卡跑 QLoRA 是预算敏感团队的最低门槛。具体操作建议把优化器状态用 CPU Offload 卸载内存(40G 机器标配 64G 内存刚好,升 128G 更稳),再开梯度检查点,显存就能压在 40G 内跑通。需注意这条路受算力密度限制,单轮 epoch 可能两三天,适合工期不紧的轻量场景。

Q3:全参微调 70B 租什么机器最稳?

A3:一万网络 H100 8 卡整机(640GB HBM3、NVSwitch 900GB/s、月付 ¥8–12 万、年付 85 折)最稳;预算紧可走 A100 80G×4 多卡定制(以咨询为准)。两者都需 ZeRO-3/FSDP 并行。补充:全参 70B 理论显存约 1120GB,即便 ZeRO-3 切 8 卡,每卡也要 140GB+,所以 H100 8 卡(共 640GB)单节点内最稳,batch 和序列都能放开。选机器务必确认互联是 NVLink/SXM 或 NVSwitch,否则多卡扩展折损让多花的卡钱打水漂。定制方案建议直接咨询一万网络顾问按工期核算。

Q4:QLoRA 和全参效果差多少?

A4:垂直行业知识注入、风格对齐,QLoRA 常已够用;若做继续预训练、改模型底层能力,全参更优。建议先 QLoRA 验证,再按需升级到 LoRA/全参。用验证集指标说话,别主观判断。据我们案例,金融复杂推理场景全参比 QLoRA 在少样本泛化上领先约 5–8 个点,而医疗问答这类知识注入两者差距常在 2% 以内、业务端几乎无感。差距不是固定值,高度依赖任务类型:凡是"在已有能力上贴行业皮肤"的任务 QLoRA 够;凡是"要改写底层推理链"的任务才值得全参。

Q5:A100 和 H100 训 70B 差多少?

A5:H100 FP8 比 A100 快 6 倍+,8 卡整机日处理 Token >10T;同样全参 70B,H100 收敛更快、batch 更大。预算充足选 H100,省钱选 A100 多卡。算力密度决定工期。差距不只来自峰值算力,H100 的 Transformer Engine 能自动把矩阵乘切到 FP8 路径,配合 NVSwitch 900GB/s 互联,多卡扩展接近线性;A100 即便多卡,互联带宽和 FP8 缺失让大规模全参明显吃亏。按训练性质而非单纯预算选卡,才不会选错。

Q6:梯度检查点和 CPU Offload 怎么用?

A6:两者都是"用时间换显存":梯度检查点重算中间激活,CPU Offload 把优化器状态卸载内存。显存不够时叠加使用,可把占用砍到 1/3–1/5,代价是略慢。QLoRA + 这两招,24G 卡也能临界跑 70B。实操建议:梯度检查点默认开启,几乎零成本却能砍近半激活;CPU Offload 在显存仍紧张时再开,因它在显存与内存间搬运会增加约 20%–40% 训练时间,且对主机内存有要求(建议 128G 以上更稳)。两者叠加是单卡跑 70B 救命组合,但要权衡"慢多少"与"省多少卡钱"。若开启后单轮 epoch 长到不可接受,说明软件优化已到极限,该升级硬件而非继续压榨单卡。

Q7:年付能省多少?

A7:GPU 定制年付 8 折,A100 40G ¥2800/月折后约 ¥26,880/年,省 ¥6,720;H100 年付 85 折约 ¥81.6万–122.4万。周期明确一律年付,季付还有 95 折过渡。H100 整机月付按 ¥10 万中值算,年付 85 折一年省约 ¥18 万,对长期项目是很实在的折扣。季付 95 折适合"还不确定用多久"的过渡期,等周期明确再转年付。一万网络同账户复购再减 ¥100/月可叠加,多机团队还能再省一层。

Q8:显存爆了(OOM)先降什么?

A8:依次降 batch size → 开梯度检查点 → 开 CPU Offload → 量化基座到 4-bit(QLoRA)→ 上多卡/更大卡。按此顺序排查,多数 70B 微调都能找到可跑配置。先降软件参数,最后才加硬件。我们强调"先软后硬"是因前四步几乎零成本、随时可回退,加硬件则加钱加工期。新手常犯的错误是一 OOM 就急上多卡整机,其实把 batch 从 8 降到 2、开个梯度检查点就能解决,白白多花几万。建议建一张应急档位表,把每招对应显存降幅记下来,OOM 时逐档加压、边压边看 nvidia-smi 峰值,既能快速救火也能事后定位瓶颈在哪一层。

Q9:新手第一次微调 70B,推荐从哪起步?

A9:强烈建议从单卡 A100 40G(¥2800/月)跑 QLoRA 起步:先 4-bit 量化 + 梯度检查点把显存压到 40G 内,r=64/alpha=128 验证基线效果,确认达标再考虑升 LoRA(需 80G 单卡)或全参(需 H100 多卡)。这种"由省到奢"节奏,能把试错成本与工期风险都压到最低,也最容易在老板面前交差。具体落地时,先把 1k 条精标数据跑通验证业务问题能否被解决。第一步月付 ¥2800 即便验证失败,损失也仅千余元,远比直接上 H100 整机试错便宜。等验证集确认 QLoRA 差一口气,再小步升级到 80G 多卡或 H100,每分钱花在刀刃上。

Q10:微调完怎么上线服务,要另租机器吗?

A10:推理与训练可共用同一台 GPU 机,也可训完把权重导出到独立推理机。轻量场景用单卡 A100 40G 训推一体(QLoRA 训、vLLM 推)最省;高并发则训用 H100、推用多张 A100/消费卡分流。一万网络支持训练机与推理机同账号灵活组合,按 QPS 弹性扩推理节点,不必为推理单独囤大卡。关键在于推理侧同样要做量化:把 70B 用 AWQ/GPTQ 压到 4-bit,单卡 48G 即可高速推理,成本远低于训练配置。上线前用 vLLM 压测目标 QPS 下 P99 延迟,确认稳定再暴露公网。

十一、显存不够的退路:蒸馏与更小模型

11.1 知识蒸馏:用小模型承接大模型能力

若 70B 全参显存实在扛不住、又觉得 QLoRA 效果不够,可走知识蒸馏:用 70B 教师模型生成高质量训练数据或软标签,去训练一个 7B/13B 学生模型。蒸馏后的小模型显存需求骤降(7B 全参单卡 24G 即可),推理成本与延迟大幅优化,而能力可保留教师的大部分。这条路在"要效果又要低成本上线"场景里越来越主流,学生模型直接跑在裸金属 CPU 或单卡 GPU 即可,无需昂贵多卡集群。

11.2 更小模型的适用边界

不是所有任务都需要 70B。问答、分类、抽取、摘要等多数企业场景,13B–34B 经微调已足够,全参也只需单卡 40G–80G。先用 13B 验证业务价值,再决定是否上 70B,是更稳妥的产品节奏。一万网络从 T4 16G(¥900)到 A100 40G(¥2800)的梯度配置,正好覆盖 7B–34B 的全参与 LoRA 微调,让团队用最低成本试出"模型规模的甜点"。

11.3 MoE 与量化推理:另一条省显存路

若坚持用大模型,还可考虑 MoE 架构(如 Mixtral 类),推理时只激活部分专家,等效显存与算力低于稠密同参模型;或推理侧用 AWQ/GPTQ 把 70B 量化到 4-bit,单卡 48G 即可高速推理。训练与推理可以分治:训练用高精度多卡,推理用量化单卡,成本曲线进一步下探。一万网络工程师可协助选量化方案并部署 vLLM,让 70B 不仅能训得起,更能用得起。

十二、总结与选型建议

回到标题——2026 年 70B 大模型微调需要多少显存?答案是"看你怎么微调":全参 FP16 需 >140GB/卡(多卡 A100 80G×2/×4 或 H100 整机分摊),LoRA 约 80GB 单卡,QLoRA 4-bit 仅 24–48GB 单卡。租金因此从 H100 8 卡整机 ¥8–12 万/月,一路下探到 A100 40G 单卡 ¥2800/月。显存不够别硬上,量化 + 梯度检查点 + CPU Offload 三件套能把占用砍到 1/5。

在服务商选择上,一万网络以 23 年 IDC 资质、深圳南山总部、增值电信许可证 / 国家高新 / 专精特新背书,提供从 A100 40G 单卡(¥2800/月、年付 8 折、QLoRA 轻量微调起步)到 H100 8 卡整机(¥8–12 万/月、年付 85 折、全参重训旗舰)的完整 70B 微调算力矩阵,并支持 A100 80G 多卡定制(以咨询为准)作为折中甜点。工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 开机即用,BGP 多线 + CN2 GIA 回国、7×24 工单 5 分钟响应,让团队专注模型而非运维。记住:70B 微调算的是"显存下限 × 算力上限",先把微调方式定下来,显存与租金自然就清楚了

最后再强调一次:70B 微调没有"标准答案",只有"在你的效果预算与算力预算交点上"的最优解。先用 QLoRA 在单卡 A100 40G 上把基线跑通,再按验证集指标决定要不要升级到 LoRA 或全参——这条由省到奢的路径,既省钱又控风险。数据上重质量轻数量、工程上重可复现与可服务化、部署上重显存与算力双约束,三件事想透,70B 微调就不再是黑箱。

一万网络从单卡到 8 卡的完整算力矩阵与 1 对 1 工程部署,让这条路径每一步切换都平滑无感:从 QLoRA 起步的 A100 40G,到全参重训的 H100 8 卡整机,配置、计费、运维同一面板完成。对预算更敏感、只想先验证业务价值的团队,也可从 T4 16G ¥900 或 V100S 32G ¥1500 起步,把 7B–34B 先跑通再决定是否上 70B——这种"小步快跑、按需升级"节奏,正是我们基于上百次企业微调实战提炼出的省心之道。

数据来源:本文配置与价格参考自一万网络官网公开页面(人工定制 GPU、AI 算力云、H100 物理机方案等栏目),具体以签约时最新报价与合同为准。详见 https://www.idc10000.net/


上一篇:2026 私有化部署大模型租裸金属还是云服务器?CPU+内存+算力对比全解

下一篇:2026 租用 GPU 服务器能一键装好大模型环境吗?算力+显存实测测评攻略