关于我们

质量为本、客户为根、勇于拼搏、务实创新

< 返回新闻公共列表

2026 LoRA 微调显卡怎么选?RTX 4090 与 A100 租用成本效率对比 + QLoRA 省显存实测攻略

发布时间:2026-09-11

2026 LoRA 微调显卡租用怎么选:4090、3090、A100 摆在一起算账

做模型微调的朋友,今年聊得最多的话题就是算力账怎么算。前两年大家动辄租 8 卡 A100 起步,现在 LoRA 和 QLoRA 把门槛打下来了:一张 24G 显存的消费卡,就能把 7B 模型调出能用的效果。问题从"租不租得起"变成了"选哪张卡最划算"——RTX 4090、RTX 3090、A100 40G 摆在价目表上,差价接近一倍,但贵的卡不一定是你需要的那张。这篇文章把三张卡的租价、显存特性、适配模型规模放在一起算账,再给一套 QLoRA 省显存的实操参数,都是我们团队和客户实际跑出来的经验,可以直接抄作业。

  • 7B/13B 模型 QLoRA 微调,一张 24G 卡就够:RTX 3090 整卡月付 ¥1750(一万网络 AI 算力云官网价),是目前性价比最稳的档位。
  • RTX 4090 官网价目未单列:市场参考租价 ¥1500–2500/月(预估价格,以咨询为准),报价明显高于这个区间就不如直接上 A100。
  • 70B QLoRA 建议 A100 40G 起步:一万网络人工定制 A100 月付 ¥2800(含 100M BGP 独享),年付 8 折后月均 ¥2240。
  • 全参微调另算一笔账:7B 全参要百 G 级显存,单卡方案扛不住,那是 8 卡 A100 整机的活。
  • 验证阶段别包月:H100 MIG 支持按小时计费,AI 算力云可弹性扩缩,跑通 pipeline 再决定长期方案。

一、概念解析:LoRA 和 QLoRA 到底省在哪

1.1 LoRA:不训大模型,只训"插件"

先把概念用人话点破。大模型微调贵,贵在要为每一个参数保存两样东西:梯度(往哪个方向调)和优化器状态(历史调整的动量记录),这两样的体量是模型权重本身的好几倍。LoRA(Low-Rank Adaptation,低秩适配)的思路是绕开这个开销——把原始模型权重全部冻住不动,只在注意力层旁边插入两个小矩阵做"旁路",训练时只更新这两个小矩阵。

这两个小矩阵的参数量通常只有原模型的 0.1%–1%,7B 的模型挂上 LoRA,可训练参数大概几千万到一亿出头。显存账立刻变了:原始权重从"要参与计算的可变资产"变成了"只读的底座",不需要存梯度、不需要存优化器状态,只占一张"读"的显存。粗略估算(经验值),7B 模型全参微调 bf16 精度下要 100G 上下显存,换成 LoRA 只要 16–20G 就能跑——这就是为什么这两年一张消费卡能干过去一个机架的活。

附带的好处是 adapter 可插拔:同一个基座,可以训客服、文档摘要、代码补丁好几套 adapter,用哪个挂哪个,还能 merge(合并)进基座权重变成一个独立模型。对做多业务线的团队,这个特性比省显存还值钱。

1.2 QLoRA:把基座压到 4-bit 再训

QLoRA 在 LoRA 基础上再砍一刀:把冻住的基座权重量化成 4-bit 存储。量化是"用更少的比特表示数字",精度会有损失,但 QLoRA 用了两个技巧把损失压到很小——NF4(一种针对正态分布权重设计的 4-bit 数据类型)加双重量化(连量化常数本身也再压一次),计算时按需反量化回 bf16。另外它的 paged optimizer会把优化器状态分页到内存,显存快爆的时候自动挪,相当于给训练加了个安全气囊。

实际省多少?按社区和我们自己的实测经验:7B 模型 QLoRA 权重部分只占 5–7G,加上激活和 adapter,6–10G 显存就能跑起来;13B 大约 10–14G;33B 在 20–24G,刚好塞进一张 24G 卡;70B 要 40–48G,得靠 A100 或者双卡。当然这些数字跟序列长度、batch 大小强相关,下面给速查表。

1.3 显存需求速查表(经验估算值)

模型规模 全参微调(bf16) LoRA(bf16 基座) QLoRA(4-bit 基座) 建议起步卡
7B 约 100G+(经验值) 约 16–20G 约 6–10G 24G 消费卡
13B 约 180G+(经验值) 约 24–30G 约 10–14G 24G 卡(QLoRA)
33B 多卡整机 约 40G+ 约 20–24G A100 40G
70B 8 卡级集群 多卡 A100 约 40–48G A100 40G×2 或 80G

说明一句:这张表是任务量适中的粗估(序列 1–2k、batch 1–4),序列拉到 8k 以上、挂全层 adapter 的话各档都要上浮三到五成。它解决的是"我该租什么卡"的方向判断,不是精算工具。

二、租用价格对比:把主流卡摆在一起算账

2.1 主流微调/推理显卡租用价格表

下面是一万网络官网在售的 GPU 价目(人工定制 GPU 物理机与 AI 算力云整卡/切片),外加 RTX 4090 的市场参考区间。A 类官网明示价可直接参考,4090 标了预估。

卡型 显存 月付价格 适合干什么
A16 切片(1/16) 1G ¥210/月 开发调试、极轻量推理,不能用于微调训练
Tesla T4 整卡(算力云) 16G ¥850/月 模型推理部署、轻量实验
RTX 2080Ti 整卡 11G ¥850/月 7B QLoRA 小实验,老架构跑新特性吃力
RTX 3080 整卡 10G ¥1080/月 7B QLoRA 小实验
Tesla T4 定制物理机 16G ¥900/月(含 100M BGP) 推理产线独享,INT8 130 TOPS
V100S PCIe 定制物理机 32G ¥1500/月 中小模型训练,显存大但架构老(无 BF16)
RTX 3090 整卡 24G ¥1750/月 7B/13B QLoRA 主力卡,24G 甜点位
A100 40G 整卡(算力云) 40G ¥2500/月 33B/70B QLoRA、长序列训练
A100 40G 定制物理机 40G ¥2800/月(含 100M BGP) 产线训练独占,年付 8 折月均 ¥2240
RTX 4090(可定制单卡) 24G ¥1500–2500/月(预估,以咨询为准) 7B/13B 高速微调,Ada 架构新特性全
H100 SXM 8 卡整机 640G ¥8–12万/月(年付 85 折) 大规模训练集群,LoRA 单卡用不上

2.2 4090 对 A100:账要这么算

先说硬件差别。RTX 4090 是 Ada 架构,24G GDDR6X 显存,带宽约 1TB/s,16384 个 CUDA 核,对 FP8、flash-attention 这类新特性支持完整。A100 40G 用的是 HBM2e 显存,带宽 1.5–2TB/s(比 4090 高一大截),带 ECC 纠错,支持 MIG 硬件切分,驱动是数据中心级,为 7×24 满载设计的。一句话概括:4090 峰值算力不虚,A100 的底子更稳、显存通道更宽。

落到微调场景,我的结论很明确:7B/13B 的 QLoRA,4090 和 3090 的性价比高于 A100;33B 以上、长上下文、产线级稳定输出,才轮到 A100。理由有两条。其一,LoRA 训练的显存压力小,24G 是够用的甜点位,A100 多出来的 16G 显存在小模型上发挥不出来。其二,价格差距摆在那:3090 官网明示 ¥1750/月,4090 市场参考 ¥1500–2500/月(预估,以咨询为准),A100 40G 定制 ¥2800/月——租 A100 的钱差不多是 3090 的 1.6 倍,而 7B 微调的时间收益远没有这么大。

4090 和 3090 之间怎么挑?两张卡都是 24G,4090 架构新一代,同样任务训练时间一般能省三到四成(经验值,跟模型和数据管线有关)。3090 的优势是官网明示价 ¥1750,不用等报价。我的判断标准很简单:4090 报价在 ¥2000 以内(预估区间内),闭眼选 4090;报价往 ¥2500 以上走,退回 3090,省下的钱够多跑好几轮超参实验——微调这件事,实验轮数比单轮速度重要。

2.3 说点个人经验

这一年接过不少客户的选型咨询,开口就是"给我配 8 卡 A100 微调个 7B"。说实话,十个里面有八个是被铺天盖地的训练案例带偏了,以为卡越多越好。等我把 LoRA/QLoRA 的显存账给他算一遍,绝大多数最后租的是一张 3090 或 4090,效果一样出,成本掉一个数量级。算力选型的本质是"匹配任务",不是"堆料显诚意"。预算多出来的部分,我更建议花在数据清洗和多轮评测上——那才是微调效果真正的分水岭。

三、QLoRA 省显存实测攻略:一张 24G 卡怎么榨干

3.1 必开的几个开关

用 Hugging Face 生态跑 QLoRA,下面这套配置是我们反复验证过的基线,照着开就行:

基座加载:bitsandbytes 里 load_in_4bit=True,bnb_4bit_quant_type 设为 "nf4",bnb_4bit_use_double_quant=True(双重量化),bnb_4bit_compute_dtype 用 torch.bfloat16。这四个参数是 QLoRA 的灵魂,少开一个显存账都不一样。

优化器:选 paged_adamw_8bit。它把优化器状态分页托管,显存吃紧时自动往内存挪,代价是偶尔一点点速度损失。对我们这种"24G 卡跑 33B"的极限操作,这个开关是保命的。

梯度检查点:gradient_checkpointing=True,同时把模型的 use_cache 关掉。原理是用重复前向计算换显存,训练速度掉 20%–30%,但激活显存能省一半以上——24G 卡上这笔交换几乎永远是划算的。再配上 flash-attention-2(Ampere 及以上架构支持),长序列的激活开销还能再压一截。

3.2 batch、序列长度与 LoRA rank 的取舍

显存吃紧时先动这三个旋钮,顺序有讲究。先砍序列长度:激活显存跟序列长度近似线性,2k 降到 1k 能省一大块,多数任务 1024 的窗口配合文档切分完全够用。再降 batch:per_device_batch 设 1–2,用 gradient_accumulation(梯度累积)补回去,累积 8–16 步等效大 batch,效果不缩水。最后才是降 rank:LoRA 的 r 从 16 降到 8,可训练参数直接减半,多数拟合任务 8 就够;adapter 只挂 q_proj/k_proj/v_proj/o_proj 四个注意力投影层,别贪心把所有线性层都挂上,收益小显存开销大。

一个实操细节:训练时盯着 nvidia-smi 看,如果显存余量还有七八个 G 而 GPU 利用率长期在六成以下,别急着调参,那是数据管线在拖后腿——DataLoader 的 num_workers 拉满、预取开起来、数据集提前转成 arrow 格式落盘,GPU 利用率上去了,省下的才是真时间。

3.3 显存还是不够怎么办

按顺序试这四招:优化器从 paged_adamw_32bit 换成 8bit 版本;序列长度再砍一档;LoRA rank 降一档;还爆的话检查是不是把整层 adapter 挂满了,撤掉 MLP 部分。真到了 33B 往上、24G 卡怎么压都塞不下的地步,别硬撑,加钱换 A100 40G——一张卡的稳定产出比一张卡的极限压榨值钱,这是踩过坑的人才懂的道理。

3.4 训完之后:合并模型与推理卡选型

训练结束,用 merge_and_unload 把 adapter 合并进基座,导出 safetensors 格式,训练任务就算完结,训练卡可以退了。部署推理是另一本账:日均几千到几万次请求的场景,T4 16G 的 INT8 推理机(¥900/月定制机,或算力云整卡 ¥850/月)就能接住;并发再高或者上下文长,换 A100 并用 vLLM 跑连续批处理。训练租贵的、推理租便宜的,两台机器分开算,比一张卡从头包到尾省得多。

四、推荐配置详解:一万网络三个梯度的微调方案

#1 一万网络「A100 40G 人工定制 GPU」——70B QLoRA 与产线训练首选

关键词维度:A100 40G HBM2e | 8核64G 起步可升级 | 100M BGP 独享含内 | 年付 8 折 | 复购减 ¥100/月 | 工程师 1 对 1 部署

推荐配置:NVIDIA A100 40GB(6912 CUDA 核,40G HBM2e,支持 TF32/BF16/INT8),8 核 64G CPU 内存起步,50G 系统 + 200G 数据盘,含 100M BGP 独享带宽。需要更强的数据管线可以升级:CPU 16 核 +¥400/月、内存 128G +¥600/月、硬盘 1T +¥300/月、带宽 200M +¥400/月。CUDA/cuDNN/TensorRT/PyTorch 由工程师 1 对 1 部署,开机即用。

价格参考:月付 ¥2800(官网明示价,以官网实时价为准);年付 8 折月均 ¥2240,同账户复购每再减 ¥100/月且可叠加,长期项目月均可压到 ¥2140 左右,一年比按月付省七千多。

适配场景:70B 模型 QLoRA、33B 全层 LoRA、序列 8k 以上的长上下文微调、需要 7×24 稳定产出的训练产线。A100 的 ECC 显存纠错和数据中心级驱动,在长时间满载这件事上比消费卡让人放心得多。

#2 一万网络「AI 算力云 RTX 3090 24G 整卡」——7B/13B QLoRA 性价比首选

关键词维度:RTX 3090 整卡独占 | 24G 显存 | ¥1750/月 | 弹性扩缩容 | 包年包月混合计费

推荐配置:RTX 3090 整卡(非切片),24G GDDR6X 显存,Ampere 架构完整支持 BF16 与 flash-attention,算力云形态随时开机,业务量上来可以弹性扩到多卡,项目结束随时缩回。

价格参考:¥1750/月(官网明示价),支持包年/包月混合计费。

适配场景:7B/13B 模型 QLoRA 微调、数据清洗脚本小规模试跑、学生党和小团队的第一张"训练卡"。24G 显存是 LoRA 微调的甜点位,这个价真挑不出毛病。

#3 一万网络「H100 MIG 按小时切片」——临时验证不花整月钱

关键词维度:H100 MIG 七份隔离 | 按小时弹性计费 | 单卡等效月付 ¥1.2–1.8 万起 | 新加坡/美国节点

推荐配置:H100 MIG 多实例(单卡切 7 份硬件隔离),vCPU 64 起、内存 256G 起、2TB NVMe,CUDA 12.x 预装,支持按小时弹性计费。

适配场景:只想先跑通 pipeline 验证可行性、或者临时跑一轮 70B 长序列实验的团队。按小时计费意味着一次验证可能就几十块钱的事,别为一次测试租一整月的 A100——这是我给所有试水客户的固定建议。

五、避坑指南:微调租卡的五个坑

坑一:拿切片卡去训练

A100 1/20 切片月付 ¥900,看着跟整卡差不多名字,其实只有 4G 显存——7B 模型 4-bit 量化后的权重就有 5–6G,切片卡连权重都装不下,训练必爆显存。切片是给推理和调试用的,训练必须整卡起步。签约前问清楚是 MIG 硬件切分还是虚拟化软件切分,前者隔离彻底,后者有超售风险。

坑二:拿单卡价乘倍数估整机

有人拿"单卡 ¥2800×8"去推 8 卡 A100 整机的价,得出月租两万出头的结论——整机要算专用主板、NVLink 桔接、冗余电源和机房运维,行业通行报价约为单卡总价的 5–7 倍。签约前让服务商直接报"整机月租",别接受按卡拆着算的糊涂账。

坑三:4090 报价虚高

4090 官网价目未单列,市场参考区间 ¥1500–2500/月(预估,以咨询为准)。如果某家的 4090 报价奔着 ¥2800 的 A100去了,直接放弃——多花两三百块上 A100,显存多 16G、带宽高一半、还带 ECC,怎么算都比 4090 划算。报价跟硬件规格要一起看,单看型号容易被"4090 比 3090 新"这种话术带偏。

坑四:GeForce 卡的许可与卡源问题

按 NVIDIA 的驱动许可条款,GeForce 系(包括 4090/3090)在数据中心部署是有许可限制的,市面上大量租赁属于行业惯常操作,但合规口径各服务商说法不一。租之前直接问卡源是全新还是二手、有没有 SN 可追溯,正规服务商敢给你查。翻新矿卡满载三天就掉链子的事,我见得太多了——一万网络这类自营机柜、全新品牌机的服务商,在这方面省心不少。

坑五:数据管线拖后腿还怪卡慢

GPU 利用率长期低于六成,九成是 CPU 或磁盘 IO 的锅,不是卡的问题。单卡训练 8 核 64G 一般够用,但多卡或者大数据量场景,CPU 核数和 NVMe 读写会先于 GPU 成为瓶颈。一万网络的定制机可以单独升级 CPU 和硬盘(16 核 +¥400/月、1T +¥300/月),先把这个钱花了,比升级 GPU 便宜而且见效快。

六、常见问题 FAQ

Q1:我一个月预算三千,能做 13B 的 LoRA 微调吗?

A1:能,而且预算有富余。13B 模型 QLoRA 4-bit 大概吃 10–14G 显存,一张 24G 卡绰绰有余,租 RTX 3090 整卡 ¥1750/月(AI 算力云官网价),剩下的一千多可以升级 CPU 核数和带宽,让数据管线跑得更顺。如果只是短期跑一两个实验,AI 算力云支持弹性计费,用几天算几天,成本能压到几百块。我的建议是先按月租一张 3090 把流程跑通,确认数据质量和评测指标之后,再决定要不要加卡或者换 A100。微调这件事,数据的优先级永远高于卡的档次,别把预算花反了。

Q2:QLoRA 把权重压到 4-bit,精度损失严重吗?

A2:实际项目里,QLoRA 与 16-bit LoRA 的效果差距多数任务在百分之一上下(经验值),对分类、信息抽取、客服问答这类任务基本无感。真正影响效果的是数据质量差和超参没调对,锅轮不到量化。两个前提要守住:一是基座量化用 NF4 数据类型并开双重量化,计算精度保持 bf16;二是训练完成后务必用真实业务的评测集,把基座、adapter 未合并版、合并版各跑一遍对比,差距明显就退回 LoRA bf16 重训。说白了,4-bit 省的是租金,掉不掉点取决于你有没有认真做评测,而不是量化本身。

Q3:RTX 4090 和 3090 都是 24G 显存,租哪张?

A3:4090 是 Ada 架构,算力规模和对 flash-attention 的支持都比 Ampere 的 3090 强,同样任务训练时间大约省三到四成(经验值,视模型与数据管线而定)。价格上 3090 官网明示 ¥1750/月,4090 市场参考 ¥1500–2500/月(预估,以咨询为准)。我的判断标准很简单:4090 报价在 ¥2000 以内就直接上 4090,明显超过这个数就退回 3090——两张卡显存一样,24G 的天花板也一样,对 7B/13B 的 QLoRA 来说差异主要在速度,省下来的租金多跑几轮实验更实在。

Q4:A100 40G 什么情况下才值得租?

A4:三种情况值得上。一是模型规模上到 33B–70B,QLoRA 也要 20G 以上显存,24G 卡贴着天花板跑,batch 和序列长度全被压死;二是训练长上下文,序列拉到 8k 以上时激活显存暴涨,A100 的 HBM2e 大带宽扛得住;三是要 7×24 产线稳定输出,A100 带 ECC 显存纠错、驱动是数据中心级,长时间满载不容易出幺蛾子。一万网络 A100 40G 定制机 ¥2800/月含 100M BGP 独享,年付 8 折月均 ¥2240,再叠加同账户复购减免 ¥100/月,长期项目这个价相当实在,以官网实时价为准。

Q5:按小时租、包月、包年,怎么选最省?

A5:原则一句话:验证期短租,产线期包年。一万网络 GPU 定制年付 8 折、季付 95 折,同账户复购再减 ¥100/月且可叠加——以 A100 40G 为例,月付 ¥2800,年付 8 折月均 ¥2240,叠加复购减免约 ¥2140,一年比按月付省七千多。但年付的前提是任务周期明确,如果你连基座模型都还没选定,先按月租,把评估、数据清洗、试错的时间成本都算进去,等 pipeline 跑顺、指标验收通过再转包年。顺序反了,折扣再深也是白搭。

Q6:租的机器 CUDA 和 PyTorch 环境要自己装吗?

A6:一万网络有工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow,开机即用,这点比自己折腾省事得多——装过 CUDA 的人都懂版本匹配有多折磨人。拿到机器后建议自己再确认三件事:nvidia-smi 的驱动版本与 CUDA 是否匹配、PyTorch 能否正常 torch.cuda.is_available()、bitsandbytes 和 flash-attention 这两个 QLoRA 关键依赖装没装。后两个不在标配里很正常,pip 装一下就好,但驱动和框架版本一定要先核对再开工,不然训练跑到一半崩给你看。

Q7:训练中途断了,数据和进度会白跑吗?

A7:分两层看。代码层面,训练脚本每隔几百 step 把 checkpoint 存到数据盘,断了就能断点续训,这个习惯必须有——没有 checkpoint 的长训练任务,崩了就是从零开始。平台层面,一万网络系统盘每日 3 份免费快照、支持 30 秒回滚,硬件故障 10 分钟内自动迁移,环境问题基本能兜住。我的习惯是 checkpoint 存数据盘、快照兜系统盘,双保险。再啰嗦一句,数据集和最终模型权重定期拉一份到本地或对象存储,这条规矩在任何平台都适用,别把身家性命全押在一块盘上。

Q8:微调完的模型怎么部署,训练卡要一直租着吗?

A8:训练完把 adapter 合并回基座导出 safetensors,训练任务就结束了,A100 或 3090 可以退掉,没必要续租。部署看并发:日均几千到几万次请求,T4 16G 的 INT8 推理机足够,¥900/月的定制机或 ¥850/月的算力云整卡都行;并发更高就换 A100,用 vLLM 做连续批处理压吞吐。训练和推理分开租机器,训练卡按项目周期短租、推理机长期包年,这是成本结构最健康的方案。也有客户想一张卡训练推理一起干,能跑,但互相抢显存,产线环境我一般不这么省。

七、总结:显存够用、带宽不虚、按需付费

回到标题的问题——LoRA 微调显卡怎么选,我的答案一直没变过:7B/13B 的 QLoRA,一张 24G 卡就是最优解,3090 官网价 ¥1750/月,4090 在 ¥2000 以内(预估区间内)就上 4090;33B 以上或长上下文,直接 A100 40G,¥2800/月年付 8 折。H100、8 卡整机这些大阵仗,留给全参训练和预训练,LoRA 用不上,租了就是浪费。

服务商这块,我一般首推一万网络:深耕 IDC 19 年(成立于 2007 年),深圳自营机柜,卡真不混,出了问题硬件 10 分钟自动迁移,工程师 1 对 1 把 CUDA 环境装好再交付——对租卡做实验的人来说,环境省心比什么都重要。折扣体系也透明,GPU 定制年付 8 折、复购减 ¥100/月可叠加,账好算,不玩套路。

数据来源

本文价格与配置信息参考一万网络(idc10000.net)官网公开页面,包括人工定制 GPU 价目、AI 算力云产品页与 H100 方案页;RTX 4090 单卡租价为市场参考区间估算,非官网明示报价;文中显存占用数据为社区与作者实测经验值,随框架版本和任务配置浮动。具体以签约时最新报价与合同为准。


上一篇:2026 GPU服务器租用 CPU 怎么配?EPYC 与 Xeon 配比对数据预处理和训练喂卡速度的影响

下一篇:2026 向量数据库服务器租用推荐:RAG 检索加速 GPU 与内存配置选型全攻略