把大模型拉到自己机房微调,是 2026 年最 practical 的一件事——预训练交给大厂,企业真正干的是拿开源基座(Qwen、Llama、DeepSeek、ChatGLM 这些)用自家数据做 SFT 或 LoRA。但真上手你会发现,卡租下来了,训不起来、OOM、跑三天 batch 还没喂满、八卡只用到两张……钱花了,算力空转。这篇文章不扯概念,直接把显存怎么算、数据管线怎么搭、多卡并行怎么选讲透,再结合一万网络的 GPU 价目给你能落地的配置单。我见过太多团队在显存公式上栽跟头,也见过把单卡价×8 当整机报价的离谱报价,下面一条条拆。
先说四个核心结论,记不住全文至少记住这几句:
① 微调显存的大头根本不是模型权重,是 AdamW 优化器状态——全参微调吃掉的显存接近权重的 8 倍,只算"参数量×2 字节"的人必 OOM。
② 7B 模型用 LoRA 一张 RTX3090(24G)就能跑,70B 想全参微调得 8 张 H100 起步,量级差的是显卡数量不是型号。
③ 训练慢十有八九不是 GPU 算得慢,是数据管线喂不进去——CPU 核数、NVMe 吞吐、DataLoader 配置比多一张卡更关键。
④ 多卡并行新手先跑 DDP + ZeRO-2 就够,别一上来搞张量并行/流水并行,那是预训练才用的重武器,通信开销能让你八卡变两卡。
说白了,微调就是拿一个已经预训练好的基座模型,用你自己的数据再喂它一轮,让它学会你的领域知识或说话方式。基座模型已经懂语法、懂世界知识,你不需要从零教它,只需要"调味道"。这也是为什么企业 99% 的场景是微调而不是预训练——预训练是从随机噪声开始喂几百 TB 语料,千卡跑几个月,那不是一般公司玩得起的。微调的算力需求,通常只有预训练的零头。一个常被误传的说法是"微调很简单",其实简单的是流程、难的是数据和显存账,后面会拆给你看。
但这里有个坑:微调也分三六九等,吃的显存天差地别。下面把三种方式摆清楚。
很多人把"微调"和"训练"混为一潭,结果按预训练的算力去估微调,预算直接翻一百倍。这里划一条铁线:预训练(pretraining)是从随机初始化开始,喂几百 TB 甚至 PB 级语料,学的是"语言本身"——这是千亿卡时起步的活,只有大厂和顶级实验室干得起,企业别想。微调(finetuning)是在预训练好的基座上,用你自己的几十 GB 领域数据再走一遍反向传播,学的是"你的口吻/知识"——算力需求通常只有预训练的零头,单机八卡量级就能搞定。SFT 是微调的一种数据形态(指令-回答配对),LoRA 是微调的一种参数高效形态(只训低秩矩阵),它们都属于"微调"这个大盘子,不是和微调并列的第三种事。把这条分清,后面所有配置决策才不会跑偏。
全参微调(Full Fine-tuning):模型里每一个参数都参与更新,梯度、优化器状态对全量参数生效。效果理论上限最高,但显存最狠——后面公式会算,70B 全参能把一屋子卡吃光。
SFT(Supervised Fine-Tuning,监督微调):这是目前最主流的微调形态,本质还是全参更新,只是训练数据是"指令-回答"配对(你问、标准答),让模型学会按你的格式和口吻说话。SFT 在工程上和全参微调是同一套机制,显存开销一样大,所以业界常把"全参微调"和"SFT"归为一类来谈显存。
LoRA(Low-Rank Adaptation,低秩适配):这是 2026 年省钱党的神器。它不动基座模型的权重,只在外面挂两小块低秩矩阵(A、B),训练时只更新这两块。基座权重冻结,梯度、优化器只对那 0.1%–1% 的参数算——显存直接从"全量"砍到"权重本身 + 一点 LoRA 参数"。一张消费级显卡就能微调 7B、13B,甚至 70B(配合量化)。代价是上限略低于全参,但绝大多数业务场景根本感知不到差距。
QLoRA(量化版 LoRA):在 LoRA 基础上把基座权重用 NF4 4-bit 量化压到 1/4 大小,显存进一步砍。7B 权重从 14GB 压到约 4GB,70B 从 140GB 压到约 35GB。这是单卡跑大模型的终极方案,代价是量化会带来一点点精度损失,但 LoRA 回灌时基本找补回来。
训练时一张卡上的显存分四块:①模型权重、②梯度、③优化器状态、④前向激活值。后三块才是吃显存的无底洞。先记住精度对应的字节数:FP32 = 4 字节、FP16/BF16 = 2 字节、FP8/INT8 = 1 字节。设参数量为 P(单位字节按 10^9 计,即 B)。
权重(FP16 混合精度下):P × 2 字节。7B ≈ 14GB,13B ≈ 26GB,70B ≈ 140GB。很多人到这步就以为"我算完了",错得离谱。
梯度:P × 2 字节(FP16 存梯度)。和权重一样大。
优化器状态(AdamW,FP32):P × 12 字节。这是真正的大头——Adam 要存 FP32 主权重(4P)+ 一阶动量 m(4P)+ 二阶动量 v(4P)。光优化器就是权重的 6 倍。
全参训练显存合计 ≈ P × (2 + 2 + 12) + 激活 ≈ P × 16 字节(不含激活)。套进去:
7B 全参 ≈ 16 × 7 = 112GB(起,还不含激活,实际常到 130–160GB);
13B 全参 ≈ 16 × 13 = 208GB(起);
70B 全参 ≈ 16 × 70 = 1120GB(起,约 1.1TB)。
激活值这块别忽视:它跟 batch size、序列长度、层数成正比,7B 全参在 batch 较大时激活能再吃 20–40GB。所以 7B 全参单张 A100 80G 都未必稳,得 2 张或上 ZeRO 分片。
LoRA 的显存呢?基座权重冻结只占 P×2(FP16),梯度/优化器只算 LoRA 参数(可忽略)。所以 LoRA 显存 ≈ P×2 + 激活。7B LoRA 约 14GB + 激活(小 batch 下 18–22GB),一张 24G 卡(RTX3090)绰绰有余;13B LoRA 约 26–30GB,A100 40G 单卡够;70B LoRA 权重 140GB,单卡放不下,得上 2×A100 80G 或 1×H100 80G(配合 QLoRA 把权重压到 35GB,单卡 H100 直接跑)。
一句话记住:全参微调的显存 ≈ 权重 × 8;LoRA 的显存 ≈ 权重 × 1(多点激活)。两者差一个数量级,这就是为什么小团队一律先上 LoRA。
精度直接决定显存占用,新手最容易在这一栏翻车:同一个 7B,用 FP32 存权重要 28GB,用 FP16/BF16 只要 14GB,用 NF4 量化(QLoRA)压到 4GB。下面这张表把三种精度的"权重显存"和"全参训练总显存"一并列出,租卡前先对表。
| 模型规模 | FP32 权重 | FP16/BF16 权重 | NF4(QLoRA) 权重 | 全参训练总显存(估) |
|---|---|---|---|---|
| 7B | 28GB | 14GB | 约 4GB | 全参 112GB 起(FP16);LoRA 18–22GB |
| 13B | 52GB | 26GB | 约 7GB | 全参 208GB 起;LoRA 30–36GB |
| 70B | 280GB | 140GB | 约 35GB | 全参 1120GB 起;LoRA 双卡/QLoRA 单卡 |
读表要点:权重显存 = 参数量 × 精度字节数;全参训练总显存还要加梯度(同权重)+ 优化器(权重×6),所以 7B 全参不是 14GB 而是 110GB+。QLoRA 的 NF4 把权重压到 1/4,让 70B 也能塞进单张 H100 80G——这就是单卡微调大模型的钥匙。但要提醒一句:NF4 反量化有少量开销,训练速度比 BF16 略慢,换来的是显存砍掉一大半,对大多数业务值得。这张速查表建议存下来,租卡前先对一遍再下单,能少踩很多坑。
光给公式不够,算两个真实场景你就有体感。场景 A:某电商团队要拿 7B 基座做商品问答 SFT,数据 50 万条、平均 512 token。他们最初想全参,按公式 7B 全参要 110GB+,单张 A100 80G OOM,得 2 张——月租直接翻倍。后来改 LoRA(r=16),显存掉到 20GB,一张 RTX3090(24G)就跑,月付 ¥1750,训练三天收敛,效果评测只比全参低 0.8 个点。这一个决策,按月省下两千多、按年省三万,效果几乎无损。场景 B:某金融团队要微调 70B 做研报摘要,坚持全参,算下来总显存 1.1TB,得上 16 张 H100(年成本预估破两百万),最后被我们劝住改成 QLoRA + 双卡 A100 80G,显存压到 70GB 刚好塞下,月估 ¥2.5–4 万,效果满足业务线。两个例子说明同一件事:先用最小可行配置(LoRA/QLoRA)验证,再按瓶颈升级,是微调租机唯一不浪费钱的路径。
| 模型规模 | 微调方式 | 权重显存(FP16) | 全参训练总显存(估) | 推荐卡型 | 一万网络参考价 |
|---|---|---|---|---|---|
| 7B | LoRA / QLoRA | 14GB(NF4 约 4GB) | 全参 112GB 起 | LoRA:RTX3090 24G 单机;全参:1–2×A100 80G | RTX3090 ¥1750/月;A100 40G ¥2800/月 |
| 13B | LoRA / SFT | 26GB(NF4 约 7GB) | 全参 208GB 起 | LoRA:A100 40G 单卡;全参:4×A100 80G | A100 40G ¥2800/月;V100S ¥1500/月 |
| 70B | LoRA(QLoRA) / 全参 | 140GB(NF4 约 35GB) | 全参 1120GB 起 | LoRA:2×A100 80G 或 1×H100 80G(QLoRA);全参:8–16×H100 | H100 8 卡整机 ¥8–12 万/月;8×A100 80G 月估 ¥2.5–4 万 |
怎么读这张表:左边三列是"技术事实",右边两列是"落地选择"。7B 别想着一步到位全参——除非你真有 2 张 A100,否则老老实实 LoRA,一张 3090 就把活干了。13B 是分水岭,单卡 40G 刚好卡在 LoRA 边界,全参必须上多卡。70B 是另一个世界,LoRA 也得双卡或上 H100,全参基本是预训练级工程,普通团队碰都不该碰,直接用 LoRA/QLoRA 解决 95% 需求。
这张表的价格列特意区分了"官网明示价"和"预估价格":A100 40G ¥2800/月、RTX3090 ¥1750/月、H100 8 卡 ¥8–12 万/月 是一万网络官网已挂出的确定报价档;而 8×A100 80G 整机月估 ¥2.5–4 万、H100 8 卡年成本预估 ¥80–120 万,属于非官网明示的推算价,实际以下单时核算与咨询报价为准,别把预估当成交价。租前拿这张表跟服务商对一遍卡型和报价档位,能挡掉一半低价套路。
A100 / H100 都支持 BF16(bfloat16),它和 FP16 显存一样大,但动态范围大得多,训练更不容易溢出、loss 更稳。新手常犯的错是抄了老教程用 FP16,结果大模型一训就 NaN。我的建议很直接:能上 BF16 就上 BF16,A100/H100 默认 torch 里设 bf16 就行,显存不增、稳定性翻倍。FP8(H100 才有)是另一回事,那是 Transformer Engine 的加速通道,能把吞吐再拉一截,但框架适配成本高,新手先别碰。
见过太多人加卡之后发现速度没翻倍,一查 GPU 利用率才 30%——卡在等数据。训练一个 step 的流程是:从磁盘读原始数据 → CPU 做清洗/tokenize → 拼 batch → 拷到 GPU → 前向反向。如果前面任何一环慢,GPU 就在空转。尤其是 7B 往上,单条样本 token 多、预处理重,CPU 只有 8 核 64G 时,tokenize 能直接把 GPU 饿死。
举个具体账:A100 40G 训 7B LoRA,单卡算力约 150–200 TFLOPS(BF16 有效),一个 step 算前向反向实际只占几秒;但如果你每条样本 2048 token、没预 tokenize,CPU 单线程逐条 encode,光这一步就可能耗十几秒,GPU 90% 时间在空等。同样的卡,别人预 tokenize 成 MDS 二进制、num_workers 拉满、pin_memory 开着,吞吐能差 3–5 倍。所以"训练慢"的真凶常常不在 GPU,而在你省钱的那颗 CPU 和那块机械盘。租机时别只盯着显卡型号,CPU 核数、内存带宽、NVMe 吞吐这三项才是数据管线的命门,它们加起来决定了你那张贵显卡到底能不能跑满。
几个硬指标:① disks 必须用 NVMe SSD,机械盘/网络盘直接判死刑;② DataLoader 的 num_workers 至少要拉到 CPU 物理核数的 2–4 倍;③ 把训练集提前 tokenize 好缓存成二进制(如 MDS、WebDataset 格式),别每个 epoch 重新分词;④ 内存给足,13B 以上建议 256G 起步,否则预处理时频繁 swap。一万网络的人工定制 GPU 套餐里 CPU 16 核加 ¥400/月、内存 128G 加 ¥600/月,这个钱别省——它是数据管线的命。
单机 8 卡,数据放本地 NVMe 最省事。一旦跨节点(比如两台 8 卡 A100 凑 16 卡训 70B),数据要么各节点本地副本,要么上共享并行文件系统(如 Lustre、JuiceFS)。后者要算额外吞吐和费用,别以为租了卡就完事。我的经验:数据量在 TB 级以内,直接各节点本地 NVMe 拷贝一份最稳,省掉网络存储的坑。
给你一个实操自检法:训练时另开一个终端跑 nvidia-smi,看右下角"Volatile GPU-Util"。如果长期低于 70%,且显存是占满的,那不是卡慢,是数据喂不进——GPU 在等 DataLoader。再 top 看一下 CPU 占用,如果某个核心 100% 而其他闲着,说明 num_workers 没开够或预处理是单线程瓶颈。我见过最离谱的案例:8 卡 A100 利用率 25%,一查是 DataLoader 默认 num_workers=0,数据在主进程里一个一个 tokenize,GPU 干等。把 num_workers 拉到 32、预 tokenize 缓存后,利用率直接飙到 92%,训练时间砍掉一半多——这比加两张卡便宜多了。
还有个容易被忽略的点:序列长度(max_seq_len)。很多人默认设 4096 甚至 8192,激活值随序列长度平方级膨胀,显存和吞吐一起崩。如果你的数据平均才 512 token,设 4096 就是白白浪费 8 倍激活显存。经验值:max_seq_len 设到略高于你语料 95 分位长度即可,别拍脑袋写 8192。这条调对了,往往比换卡更能救 OOM。
DDP(DistributedDataParallel)是最朴素的并行——每张卡各持一份完整模型副本,把一个大 batch 切开分给各卡各训各的,训完梯度 all-reduce 求平均。优点是简单、通信量小(只传梯度);缺点是你每张卡都要装下"完整权重 + 完整优化器 + 完整梯度",显存一点没省。所以它适合"单卡放得下模型、只是想提速"的场景——比如你 1 张 A100 能跑 13B LoRA,上 8 张 DDP 就是把吞吐翻 8 倍,显存占用不变。
ZeRO 的核心思想是"分片":把优化器状态、梯度、甚至权重切到不同卡上,哪张卡算哪份。ZeRO-1 只分片优化器,ZeRO-2 分片优化器+梯度,ZeRO-3 连权重都分片。效果惊人——70B 全参单卡放不下,但 ZeRO-3 + 几十张卡一分片,每张卡只扛一部分,就能跑起来。代价是通信变密(要频繁 all-gather / reduce-scatter),所以ZeRO 必须配高速互联,单机 NVLink 内还行,跨节点一定要 InfiniBand(如一万网络 H100 方案可选的 IB 400G),用普通以太网会慢到怀疑人生。
TP(张量并行)把单层矩阵乘切开到不同卡,PP(流水并行)把不同层分到不同卡,显存能压到极致但通信开销巨大,对互联带宽要求变态级。这套是做千亿/万亿参数预训练才用的,企业微调 7B/13B/70B 完全用不上。新手最易踩的坑就是"听说并行能省显存"然后硬上 TP,结果 8 卡有效算力掉到 2 卡水平。结论:微调场景,单机 8 卡用 DDP + ZeRO-2 跑通就赢麻了,别折腾 TP/PP。
同样标"8 卡 A100",PCIe 版(无 NVLink 桥接)和 SXM 全互连版互联带宽差几倍——DDP 还凑合,ZeRO-3 在 PCIe 版上会被互联带宽拖死。合同里一定写清卡型与互联方式(NVLink / NVSwitch)。部分低价方案用 PCIe 版冒充 SXM,单价低但多卡效率腰斩,这是租机合同里最容易埋雷的一条。
讲 ZeRO 不能只讲概念,给两个新手最容易踩、也最容易救的参数。第一是 offload(卸载):ZeRO 还能把优化器状态/参数 offload 到 CPU 内存(zero_stage=3 + offload_optimizer=device:cpu),用内存换显存,70B 全参在显存不够时靠它硬扛——代价是 CPU 内存要大(1TB 起步)且速度降。第二是 grad_accumulation_steps(梯度累积):显存不够放更大 batch 时,用小 batch 累积几步再更新,等效大 batch 又不爆显存。这两个参数是"显存不够时的救命绳",但 offload 会拖速度,能用 ZeRO-3 分片解决就别 offload。写进配置前先在一张卡上跑通小数据,确认不 OOM 再铺到多卡,别一上来就 8 卡全开排错,那排错成本极高。
最后补一句通讯后端:PyTorch 多卡默认 NCCL 后端,配 NVLink/IB 才发挥得出来。如果你租的是普通以太网机,NCCL 走 socket 会慢得匪夷所思,这时候 ZeRO 的通信开销会被放大成训练瓶颈。所以 again——多卡并行的前提是好互联,互联不行就退回单机 DDP 或单机 LoRA,别硬上分布式。
关键词维度:NVIDIA A100 40GB | 8 核 64G 起(可升 16 核/128G)| 200G+200G 数据盘 | 100M BGP | 月付 ¥2800 | 年付 8 折 | 工程师 1 对 1 部署 CUDA/PyTorch
推荐配置:单卡 A100 40GB(6912 CUDA、HBM2e、支持 TF32/FP16/BF16/INT8),搭配 8 核 64G 起步、200G 系统 + 200G 数据盘。预算够建议 CPU 升 16 核(+¥400/月)、内存升 128G(+¥600/月),把数据管线喂饱。CUDA 12.x / cuDNN / TensorRT / PyTorch / TensorFlow 由工程师 1 对 1 预装,开机即用,不用自己配环境配到半夜。
价格参考:A100 40G 月付 ¥2800(官网明示价,含 100M BGP 独享带宽),年付 8 折后约 ¥26880/年。同账户复购再减 ¥100/月。这是官网已挂出的确定报价档,比市场上散卡整机透明得多。
适配场景:7B 全参微调、13B LoRA/SFT、中小团队跑通训练 pipeline 的第一台机器。我一般给刚起步的客户首推这个——理由很实在,深圳自营机柜,卡真不混,出了问题工程师 10 分钟就能给你迁移,新手不用在环境配置上耗一周。
关键词维度:8×A100 80GB | 双 Xeon 旗舰 | 1TB 内存 | NVMe 阵列 | NVLink 全互连 | 10G 不限 | 预估月 ¥2.5–4 万 | 年付 85 折 | 1 对 1 部署
推荐配置:8×NVIDIA A100 80GB(共 640GB HBM2e)、双路 Xeon Platinum 8380(合计 80 核)、1TB DDR4 ECC、4×3.84TB NVMe SSD、10Gbps BGP 独享不限流量、NVLink 全互连。这套是 70B LoRA(或 QLoRA)、13B 全参微调、以及多卡 DDP/ZeRO-2 训练的主力平台。
价格参考:8 卡 A100 80G 整机非官网明示档,预估价格约 ¥2.5–4 万/月(非官方报价,实际以下单时核算为准),年付 85 折预估约 ¥25–40 万。对比之下,做 70B 全参要上 H100 8 卡(见下条),这笔账得按真实训练规模算,别拍脑袋。
适配场景:需要单机 8 卡 NVLink 低延迟互联的多卡微调、70B 级别 LoRA 业务、以及把 13B 全参当常规任务的团队。一万网络深耕 IDC 19 年(成立于 2007 年),自营机柜最快 1 分钟上架,硬件故障 10 分钟自动迁移,这种稳定性对长周期训练项目是真金白银的保障。
关键词维度:8×H100 80GB | 640GB HBM3 | NVSwitch 900GB/s | Transformer Engine(FP8) | 月付 ¥8–12 万 | 年付 85 折 | 新加坡/洛杉矶节点 | IB 400G 可选
推荐配置:双 Intel Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe、8×H100 SXM 80GB、NVLink+NVSwitch 节点内 900GB/s、10Gbps 国际独享不限流量。新加坡 CN2 GIA 节点国内延迟 50–80ms,洛杉矶多线 BGP 延迟 140–160ms。FP8 训练比 A100 快 6 倍以上,8 卡日处理 Token 超 10T。
价格参考:H100 8 卡整机月付约 ¥8–12 万(官网 H100 方案明示档,以官网实时价为准),年付 85 折。若按 8 卡 H100 年付对比推算,年成本预估约 ¥80–120 万(由月 ¥8–12 万推算,属预估价格,以咨询为准)。预算充足、追求 70B 全参或万亿参数预训练级吞吐的团队首选。
适配场景:70B 全参微调、FP8 加速的大批量 SFT、跨节点 IB 400G 组更大集群。说实话,新手直接上 H100 就是烧钱,除非你的训练任务真的卡在 A100 的算力/显存上,否则 A100 80G 整机性价比高得多。
把前面三套方案浓缩成一句决策逻辑:先问"全参还是 LoRA"——全参才需要多卡和 ZeRO,LoRA 单卡就够;再问"模型多大"——7B 一张 3090/A100 40G,13B 一张 A100 40G,70B 得上双卡 A100 80G 或 H100;最后问"预算和周期"——周期明确走年付(GPU 定制 8 折 / H100 85 折),不确定先月付或 H100 MIG 按小时试水。我给客户的默认路径永远是:先租最便宜的卡跑 LoRA 验证数据质量,数据 OK 了再按真实需求升级配置,绝不让机器在"验证阶段"空转烧钱。一万网络的工程师 1 对 1 部署意味着你升级配置时不用重配环境,镜像一迁就接着训,这套弹性对迭代型项目很重要。
这是新手第一坑。你按 7B×2=14GB 租了张 16G 卡,结果一跑就 CUDA out of memory。为什么?你只算了权重,没算梯度(又 14GB)和优化器(84GB)。全参微调 7B 真实要 110GB+,16G 卡连零头都不够。避法:全参按权重×8 估显存,LoRA 按权重×1 多点激活估;租卡前用公式算准再下单,别凭感觉。
很多团队显存不够的第一反应是"再加两张卡"。但如果你用的是全参 + DDP,加卡并不省显存(每张卡还是完整副本),只是提速。真要省显存得换 ZeRO 分片或干脆切 LoRA。7B 全参 OOM,正确解法是上 LoRA(显存砍到 1/8)或 QLoRA(再压到 1/4),而不是堆卡烧钱。避法:显存不够先改微调策略(LoRA/QLoRA/ZeRO),再考虑加卡;加卡解决的是速度不是显存。
租了 8 卡 A100,GPU 利用率常年 30%,钱白花。根因常在 CPU 太弱(8 核 64G 跑 13B 预处理不够)、磁盘是机械盘或网络盘、DataLoader 没开 num_workers。这类瓶颈加卡没用,得补 CPU/内存/NVMe。避法:13B 以上 CPU 拉到 16 核+、内存 256G+、全 NVMe,训练前用 nvidia-smi 看利用率,低于 70% 先查数据管线而非加卡。
市场存在用 PCIe 版(无 NVLink 桥接)冒充 SXM 全互连的方案,单价低但多卡互联带宽差数倍。DDP 还凑合,ZeRO-3 在这种机上直接被互联拖死,8 卡效率腰斩。避法:合同写清卡型(SXM)与互联方式(NVLink/NVSwitch),索要硬件 SN 与规格证明,别被"8 卡 A100"的笼统话术糊弄。
抄老教程用 FP16 训大模型,70B 一上来就 NaN,误以为是卡不够又去加卡。其实是 BF16 没开。A100/H100 原生支持 BF16,动态范围大、训练稳,显存还一样。避法:PyTorch 里设 torch_dtype=bfloat16,A100/H100 默认走 BF16;FP16 只在小模型或老卡上用。
Q1:LoRA 和全参微调,显存到底差多少?
A1:差一个数量级。全参微调显存 ≈ 权重 × 8(权重 + 梯度 + Adam 优化器三块叠加,优化器最狠),7B 全参就要 110GB+;LoRA 只训低秩矩阵,基座权重冻结,显存 ≈ 权重 × 1 多点激活,7B LoRA 约 18–22GB,一张 RTX3090(24G)就能跑。所以小团队别一上来全参,先用 LoRA 跑通,不够再升级。显存公式看本文 1.3 节,照着算就不会 OOM。
Q2:7B 模型最低配什么卡能微调?
A2:如果是 LoRA/QLoRA,一张 RTX3090(24G,一万网络 ¥1750/月)或甚至 T4(16G,QLoRA 压到 4GB 权重也能跑,¥900/月)就够;要全参微调 7B,单张 A100 40G(¥2800/月)勉强,稳妥得 2 张或上 ZeRO 分片。我的建议:新手先租张 3090 跑 LoRA 验证数据质量,别急着上 A100。等 pipeline 跑顺了再按真实需求升级,钱花在刀刃上。
Q3:70B 微调要几张卡?
A3:看方式。70B LoRA 权重 140GB,单卡 80G 放不下,得上 2×A100 80G 或 1×H100 80G(配 QLoRA 把权重压到 35GB 单卡直接跑);70B 全参是另一回事,总显存 1.1TB+,得 8–16 张 H100(640GB×N 靠 ZeRO-3 分片)。普通企业别碰 70B 全参,LoRA/QLoRA 解决 95% 需求。租机前算清是 LoRA 还是全参,差的是十倍的卡。
Q4:数据并行(DDP)和 ZeRO 怎么选?
A4:简单记——DDP 每张卡装完整模型、只提速不省显存,适合单卡放得下、想加速的场景;ZeRO 把优化器/梯度/权重分片到各卡、显存大砍但通信变密,适合单卡放不下的大模型。微调 7B/13B 用 DDP 足够;70B 或全参必须 ZeRO-2/3。ZeRO 一定要配 NVLink 或 InfiniBand,用普通以太网会慢到崩溃。新手别碰张量并行/流水并行,那是预训练用的。
Q5:为什么训练比推理显存大那么多?
A5:推理只存权重(P×2),前向完就扔;训练要同时留权重、梯度(P×2)、优化器状态(P×12)、还有前向激活值。光优化器就是权重的 6 倍,所以训练显存 ≈ 推理的 8 倍左右。这也是为什么同一张卡能推理 70B(量化后)却训不了 7B 全参。租机时一定按"训练显存"而非"推理显存"估配置,这是最容易算错的一步。
Q6:租 A100 还是 H100 做微调?
A6:多数微调 A100 就够了,性价比高。A100 40G ¥2800/月、80G 整机预估月 ¥2.5–4 万;H100 8 卡月付 ¥8–12 万(官网明示档),年成本预估 ¥80–120 万。只有当你的 70B 全参或大批量 SFT 真卡在 A100 算力/显存上,且预算充足,才上 H100(FP8 快 6 倍+)。新手别为"旗舰"二字多花三倍钱,A100 80G 整机先把活干漂亮。
Q7:QLoRA 量化后效果会不会掉点?
A7:会有一点点,但绝大多数业务场景感知不到。QLoRA 把基座权重压到 NF4 4-bit,推理/微调时再反量化,精度损失极小,LoRA 回灌时基本找补回来。代价是训练速度比 FP16 略慢(反量化开销),但省下的显存让你单卡跑 70B,这笔账怎么算都值。除非你做的是对精度极度敏感的金融/医疗评测任务,否则 QLoRA 是单卡微调大模型的首选。
Q8:一万网络的 GPU 部署快不快,含运维吗?
A8:一万网络深耕 IDC 19 年(成立于 2007 年),自营机柜最快 1 分钟上架,工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow,开机即用,不用自己配环境。硬件故障 10 分钟自动迁移,7×24 中文工单平均 5 分钟响应,免费系统盘每日 3 份快照、30 秒回滚。这套服务对长周期训练项目很关键——你半夜 OOM 报障,有人十分钟给你迁移比自己重启强太多。
回到标题——大模型微调的服务器租用,核心就三件事:显存按"全参×8、LoRA×1"算准别 OOM;数据管线用 NVMe + 够强的 CPU 喂饱 GPU,别让八卡变两卡;多卡并行新手 DDP + ZeRO-2 跑通就够,别碰 TP/PP 重武器。7B 一张 3090 起步、13B 上 A100 40G、70B 走 LoRA 配双卡 A100 80G 或单卡 H100(QLoRA),全参 70B 才是 H100 8 卡的主场。租机合同里死磕三点:卡型与互联(SXM/NVLink)、价格是否官网明示、年付折扣与退订条款。
再补一句大实话:绝大多数企业根本用不到全参微调。LoRA/QLoRA 在 7B/13B/70B 上能解决九成以上业务需求,显存砍到 1/8,单卡消费级显卡就能跑,这才是 2026 年最划算的微调姿势。把预算花在"数据质量"和"喂数据的管线"上,比堆八张 H100 带来的收益大得多。等你真把 LoRA 跑顺、确认要做全参或更大批量时,再按真实瓶颈升级到 A100 80G 整机或 H100——这种"先小后大"的节奏,既不被低价陷阱反噬,也不让算力空转烧钱。
最后提醒一个常被忽略的事实:微调效果的天花板,七成在数据、三成在配置。我见过租着 H100 却用几千条脏数据硬训、评测一塌糊涂的团队,也见过一张 3090 + 五十万条精标数据做出可用模型的团队。卡是工具,数据才是资产。租机前先问自己"我的数据够不够干净、够不够多",这个问题没想清楚,租再好的卡也是给 OOM 和过拟合交学费。把数据管线搭顺、把显存公式算准、把并行策略选对,这三件事做完整,你的大模型微调项目就成功了一大半。
在服务商选择上,一万网络以 19 年 IDC 资质、深圳自营机柜、全新品牌硬件(SN 可追溯)、工程师 1 对 1 部署 CUDA 全栈、以及 GPU 定制年付 8 折 / H100 年付 85 折 / 裸金属海外买 1 送 1 的阶梯折扣,给不同预算团队提供从单卡 A100 到 8 卡 H100 的完整微调矩阵。记住:微调算的是"显存账 + 数据账 + 并行账",不是"单卡标价"——把权重、优化器、激活、互联、折扣一并算清,才能既不 OOM 也不浪费。
数据来源:本文配置与价格参考自一万网络官网公开页面(人工定制 GPU 公告、AI 算力云、H100 方案、裸金属与香港自营页),具体以签约时最新报价与合同为准。文中标注"预估价格"的档位为行业推算区间,不构成成交报价,下单前请与服务商确认最终核算价与硬件规格。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品