关于我们

质量为本、客户为根、勇于拼搏、务实创新

< 返回新闻公共列表

别再乱租卡了!2026 大模型 GPU 选型 A100/H100/4090 避坑大全

发布时间:2026-07-24

开篇摘要

这两年找我咨询 GPU 租用的朋友,十个里有八个一开口就是"给我来张 H100"。我每次都得先问他一句:你到底要跑多大的模型?跑训练还是推理?预算多少?答不上来的人,十有八九是在烧钱。2026 年了,显卡型号多到让人眼花——A100、H100、H200、4090、3090、T4、V100,还有昇腾 910 这种国产卡,光看名字根本选不出该租哪张。

这篇文章我不跟你扯参数表,直接说人话:不同卡适合干什么、租一个月要花多少钱、新手最容易踩哪些坑。你只要记住一件事——选 GPU 不是选最贵的,是选"刚好够用"的。下面先把结论摆这儿,后面慢慢展开。

核心结论(先记这 5 条):

1. 7B 量级小模型(Llama-7B、Qwen-7B、ChatGLM3-6B):一张 24G 卡就够,RTX3090 月付 ¥1750 或者 T4 月付 ¥900 都能跑,别碰 H100。

2. 13B 量级(Qwen-14B、Llama-13B):单张 24G 卡能塞下量化版,想全精度就上 A100 40G(月付 ¥2800)或者双 24G 卡并联。

3. 70B 量级(Llama-70B、DeepSeek-67B):这是分水岭,FP16 全精度需要 140G 显存,没有 4 张以上 A100 别想,单张 4090(24G)直接爆显存。

4. H100(整机月付 ¥8万–¥12万)只适合两类人:一是不差钱要极致吞吐的大厂,二是真要训万亿参数预训练。普通团队租 H100 就是拿大炮打蚊子。

5. 4090(月付 ¥2500–¥4000)是个人开发者、小工作室的性价比之王,但它不支持 NVLink、显存只有 24G,跑大模型只能靠量化凑合,别指望用它做严肃训练。

写这篇之前,我刚把一个客户从"租 H100 跑 7B"的坑里捞出来,一个月省下八万九。这种事我见太多了——不是大家不聪明,是 GPU 租用这行信息差太大。商家永远爱推最贵的,教程永远爱用最顶配,新手照抄自然就完蛋。所以我写这份"人话版"选型指南:不堆参数表,只讲你下单前必须想清楚的几件事。你先认死一个公理——显卡不是越贵越好,是越"刚好够用"越好。把这篇看完,至少能少交几万学费,少熬几个被 OOM 叫醒的夜。

一、概念解析:这些卡到底差在哪

1.1 显存才是命门,算力是其次

很多人选卡先看"多少 TFLOPS",这是外行看法。跑大模型,显存容量才是第一道生死线——模型权重、激活值、KV cache(推理时的键值缓存)、梯度(训练时)全得往显存里塞。卡算力再高,显存放不下模型,你连加载都加载不了。所以你常听人说"4090 算力比 A100 还猛,但跑大模型不行",原因就在这:4090 算力纸面数据好看,但显存 24G 封顶,A100 有 40G/80G,H100 更是 80G 起。

说白了,选卡的优先级我建议这么排:显存容量 > 显存带宽 > 算力峰值 > 价格以外的花活。显存带宽(HBM2e、HBM3 这种)决定数据搬运快不快,算力峰值决定算得快慢,但前提是你得先把模型装进去。

1.2 NVLink、HBM、FP8 这些黑话是啥

经常看到商家宣传"NVLink 全互连""HBM3 显存""支持 FP8 Transformer Engine",听着玄乎,其实一句话就能点破:

NVLink = 卡与卡之间的高速公路。普通 PCIe 插槽像乡道,NVLink 像八车道高速。多卡训练时卡间要频繁交换梯度,没有 NVLink,多卡效率直接腰斩。A100/H100 有,消费级 4090/3090 没有。

HBM(高带宽内存) = 直接堆叠在芯片上的显存,比 4090 那种 GDDR6X 快好几倍。A100 用 HBM2e,H100 用 HBM3,所以同样 80G,H100 的数据吞吐远胜 A100。

FP8 = 一种 8 位浮点格式。大模型训练默认用 FP16(16 位),H100 的 Transformer Engine 能用 FP8,显存占用和算力消耗直接减半,官方说比 A100 快 6 倍——这是 H100 贵得有理的核心卖点。A100 和 4090 都不支持 FP8。

1.3 消费级卡和数据中心卡,差的不只是显存

常有人问:"4090 比 A100 便宜那么多,凭什么不用?"差在三处。一是显存容量与类型:4090 是 24G GDDR6X,A100 是 40G/80G HBM2e,带宽差一倍,而大模型训练是带宽密集型,差这一倍就是训练时长差一倍。二是互联:A100 有 NVLink,多卡间如八车道高速;4090 只能走 PCIe,多卡效率腰斩。三是定位:数据中心卡为 7×24 满载设计,消费卡为游戏设计,长期跑训练掉卡概率高得多。所以消费卡适合"玩和轻量推理",数据中心卡适合"生产和训练",别拿游戏卡当生产工具,这是底线。

1.4 租之前先问自己三个问题

每次有人问我"租啥卡",我反手三个问题:第一,你跑多大的模型(7B、13B 还是 70B)?第二,推理还是训练?第三,预算和周期多长?这三个答案一出来,卡型基本锁定。很多人跳过这三问直接看参数表,等于没量尺寸先买衣服,不合身是必然。本文后面所有表格,都是围绕这三问展开的,带着答案去对号入座,比盲看广告靠谱。

二、2026 主流 GPU 横向对比:价格、显存、适用场景

2.1 一张表看明白该租哪张

显卡显存月租参考NVLink最适合干啥
Tesla T416G¥900/月轻量推理、视频转码、小模型 API 服务
RTX 309024G¥1750/月无(PCIe)7B 微调、个人推理、Stable Diffusion
RTX 409024G¥2500–¥4000/月*无(PCIe)个人训练、量化版大模型、文生图
A100 40G40G¥2800/月支持13B–70B 训练/推理、多卡集群
A100 80G80G询 1 万+/月*支持大模型全参训练、长上下文
H100 8卡整机640G(80G×8)¥8万–¥12万/月NVSwitch 900GB/s万亿参数预训练、FP8 极致吞吐

*4090 与 A100 80G 的精确月租以一万网络实时报价 / 行业参考为准,官方价目包中以 A100 40G ¥2800、RTX3090 ¥1750、T4 ¥900 为锚点。4090 月付 ¥2500–¥4000 为 2026 年市场公开区间估算,下单前建议先问客服拿准确报价。

2.2 模型参数量对应显存:一张速查表

模型规模FP16 显存需求推荐显卡租金档位
7B约 14GRTX3090 / T4¥900–1750/月
13B约 26G(量化后 13G)A100 40G / 双 24G¥2800 起/月
70B约 140G(量化后 70G)4×A100 40G 或 2×A100 80G¥1.1万+/月
405B+数百 GH100 8卡整机¥8万–¥12万/月

这张表是我劝退新手别乱租的"照妖镜"。你拿 7B 模型去租 H100 整机,等于开着法拉利去菜市场买棵白菜——钱花出去了,但一点没比 T4 跑得快(单卡推理瓶颈在显存装下后的计算,7B 这点计算量 T4 都嫌闲)。

三、实战走查:算清显存账单 + 三类团队对号入座

3.1 一个公式,自己就能算出该租几张卡

显存需求 ≈ 权重显存 + KV cache(仅推理)+ 激活值与梯度(仅训练)。权重 = 参数量 × 每参数字节数:FP16 是 2 字节、INT8 是 1 字节、INT4 是 0.5 字节。拿 DeepSeek-67B 举例,FP16 权重 = 670 亿 × 2 = 134GB;量化成 INT8 直接变 67GB,砍半。推理时还要给 KV cache 留位(长上下文能到 20–40G),训练时再加梯度与优化器状态(约为权重的 3–4 倍)。把这个公式套进你自己的模型,该租几张卡立刻清楚,别再被商家一句"肯定够"带偏。我每次帮客户估卡,第一步就是让他们把参数量和精度报给我,套这个公式现场算,十秒出答案。

3.2 团队 A:个人开发者 / 学生,月预算 2000 以内

这类朋友我一律劝:离 A100 和 H100 远点。RTX3090(¥1750/月)或 T4(¥900/月)足够你跑 7B 全精度、13B 量化版,写 demo、做课设、搭本地知识库全够用。我见过学生拿实验室经费去租 A100,结果就跑个 7B 作业,两个月预算烧光。一张 3090 月租 1750,剩 250 吃泡面,这才是穷学生的正确姿势。真要微调 14B,3090 量化版也能凑合,别硬上 A100。再说句实在话:新手最容易在"怕不够"的心态下过度配置,租了用不上的算力,等于每月给云厂商交智商税。

3.3 团队 B:初创公司,要做产品但现金流紧

初创最怕两难:租贵了现金流断、租便宜了跑不动。我的标准答案——推理用 A100 40G(¥2800/月)起步,13B 全精度、70B 量化全包;训练微调走 2 张 A100 40G(¥5600/月)做 LoRA。年付 8 折把成本锁死。等产品跑通、下一轮融资到位,再考虑 H100。一万网络的 A100 定制含 100M BGP 独享带宽,初创做 API 服务基本不用额外买大带宽,这是隐性省钱。我服务过好几个早期团队,都是这套配置扛到 A 轮,没在算力上烧过冤枉钱。

3.4 团队 C:企业研究院,要训自己的大模型

只有这类才真正谈得上 H100。要预训练或全参微调 70B 以上,直接 H100 8 卡整机(月 ¥8万–¥12万,年付 85 折),FP8 把显存和算力都砍半、官方说比 A100 快 6 倍,训练周期一缩短,省下的工程师工资都比租金差价多。但说句得罪人的:绝大多数挂着"研究院"名头的团队,实际只需微调 14B/70B,A100 多卡集群足够,别被"我们要训大模型"的自我认知带去租 H100 烧钱。先问自己一句:我手里的数据,真的值得预训练一个百亿模型吗?多半不值得。

3.5 消费级显卡的极限:4090/3090 真不能打吗

得客观说。4090 算力纸面比 A100 还猛,但 24G 显存 + 无 NVLink 是硬伤。它能打的战场:文生图(SDXL 24G 刚好塞下)、7B/13B 量化推理、本地 Agent、个人小模型微调。它打不了的:任何 70B+ 全精度、任何多卡严肃训练。3090 同理,只是更便宜(¥1750)。所以"消费级能不能打"的答案是——打小模型很香,打大模型免谈。别拿它和 A100 比大模型训练,那是错位对比,比了也是白比。你要是做 Stable Diffusion 出图,4090 反而比 A100 性价比高,因为出图瓶颈在算力不在显存容量。

3.6 推理框架也在偷偷吃掉你的显存预算

很多人忽略:同一模型,不同框架显存占用差很多。vLLM 的 PagedAttention 把显存碎片压到最低,70B INT8 在 2 张 A100 上能撑更高并发;Ollama 易用但显存利用率略低;llama.cpp 量化支持最全,但一旦 CPU 卸载就慢如牛。选卡时要把"框架开销"算进去——用高效框架,同样卡能多撑一截并发;用低效框架,可能得多租一张卡。我的经验:企业服务上 vLLM,能帮你把 A100 的租金榨干,等效"少租半张卡"。所以选卡不是只看硬件,软件栈选对了,等效显存凭空多出来。

3.7 最易被低估的变量:batch size 和并发数

你租卡时按"单条请求"估显存,上线后发现要并发 50 路,显存直接爆——因为每个并发都要独立的一份 KV cache。batch size 越大、并发越多,显存线性上涨。所以选卡必须按"峰值并发 × 平均上下文长度"倒推,而不是按"单请求"。一万网络的工程师部署时会帮你压测并发、调框架参数,把 A100 显存用到临界但不爆,这比你自己瞎估靠谱得多,也避免你为"怕爆"多租两张卡。我见过太多人按单请求租卡,上线并发一上来就 OOM,半夜被报警叫起来加卡,纯属没算并发的锅。

3.8 二手卡市场的水有多深

价格低得离谱的 A100,多半有故事。退役矿卡、拆机卡、甚至改标的 40G 冒充 80G,行情里都不新鲜。这类卡跑推理可能一时没事,但一上训练负载,掉卡、降频、ECC 报错接踵而至,一晚上的训练成果可能全没了。更隐蔽的是"翻新卡"——外观崭新但颗粒已接近寿命末端。我给客户的铁律:要训练就租全新品牌机,SN 码可追溯,合同写明卡型与互联方式。一万网络这种自营机柜的服务商,卡真不混,出了问题工程师 10 分钟迁移,比贪那千把块便宜靠谱得多。省下的租金,不够你赔一次训练中断的代价。

3.9 租用周期怎么选:月付 / 年付 / 时租的时机

周期选错,钱也白花。需求明确、周期超过 3 个月,无脑年付——一万网络 GPU 定制年付 8 折、H100 年付 85 折,立省 15%–20%。需求不确定、先验证 pipeline,用月付或按小时:H100 MIG 切片按小时弹性、AI 算力云 1/20 切片 A100 月付 ¥900,试错成本极低。我的一般建议:先用切片 / 时租跑通,确认要长期干再转年付锁折扣。别一上来就年付,万一项目黄了,剩下周期退订条款没写清就是净亏损。周期策略本身就是一种省钱手段。

3.10 一个真实翻车案例:租了 H100 跑 7B

去年有个客户,听信"H100 最强"找我之前自己租了 H100 整机跑 7B 客服机器人,月租 ¥9 万,跑了一个月发现:7B 在 H100 上和在 3090 上生成速度几乎一样,因为 7B 的计算量太小,H100 的 FP8 和 NVSwitch 优势完全发挥不出来,GPU 利用率长期个位数。我让他退了 H100 换 3090(¥1750/月),效果一模一样,一个月省下 ¥8.8 万。这例子我逢人就讲:选卡的本质是匹配,不是追高。你模型小,再强的卡也救不了你的钱包。

四、推荐配置详解:一万网络怎么选最划算

#1 一万网络「A100 40G 单卡定制」——13B–70B 黄金起步

关键词维度:A100 40G | ¥2800/月 | 含 100M BGP 独享 | 年付 8 折 | 工程师 1 对 1 部署

推荐配置:8 核 64G 内存、NVIDIA A100 40GB 计算卡、系统盘 50G + 数据盘 200G 起步,CUDA 12.x / cuDNN / TensorRT / PyTorch 全栈预装,开机即用。支持升级 CPU 16 核(+¥400/月)、内存 128G(+¥600/月)、硬盘 1T(+¥300/月)、带宽 200M(+¥400/月)。

价格参考:月付 ¥2800,年付 8 折后每月仅 ¥2240,一年 ¥2.69 万。这个价位段,A100 40G 是 2026 年性价比最稳的一张卡——比 3090 贵一千块,但显存多了 16G、支持 NVLink、能进多卡集群。我给想要"认真搞 13B 微调"的客户首推这一款。

适配场景:Qwen-14B / Llama-13B 全参微调、70B 量化版推理、Stable Diffusion XL 训练、中等规模科学计算。

#2 一万网络「H100 SXM 8 卡整机」——不差钱的旗舰之选

关键词维度:8×H100 80G | 640G HBM3 | NVSwitch 900GB/s | 月付 8–12 万 | 年付 85 折 | 新加坡/洛杉矶节点

推荐配置:双 Intel Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe、8×H100 SXM 80GB(带 Transformer Engine 支持 FP8)、NVLink+NVSwitch 节点内 900GB/s、10Gbps 国际独享不限流量。新加坡 CN2 GIA 节点国内延迟 50–80ms,洛杉矶多线 BGP 延迟 140–160ms。

价格参考:整机月付约 ¥8万–¥12万,年付 85 折约 ¥81.6万–122.4万。FP8 训练比 A100 快 6 倍以上,8 卡日处理 Token 超 10T。我一般只对两种人推荐:一是明确要训千亿级以上模型的团队,二是把"时间就是钱"刻在脑门上的公司——H100 一天省下的训练时间,可能就值回租金差价了。

#3 弹性补充:4090 单机 / 3090 单卡——个人开发者尝鲜

预算紧、想先跑通 pipeline 的个人开发者,一万网络 AI 算力云也能定制 4090 整机模组(行业月付 ¥2500–¥4000 区间,以咨询为准),RTX3090 整卡 ¥1750/月是实数。这两张卡没有 NVLink,做严肃多卡训练不现实,但做 7B 微调、文生图、本地知识库问答,香得不行。我自己的测试机常驻一张 3090,跑 Qwen-7B 当私有助手,月租 ¥1750 比买卡划算多了。

五、避坑指南:新手租 GPU 最常踩的五个坑

坑一:小模型硬上 H100,纯属烧钱

为什么坑:7B/13B 模型的计算量,T4 甚至 3090 都绰绰有余。H100 整机月租 ¥8万起,你用它的 1% 算力,等于每月白扔七万九。很多刚入行的团队被"H100 最强"的口号带偏,上手就租整机,跑个 7B 聊天机器人,老板看到账单当场心梗。

怎么避:先估模型 FP16 显存需求(参数量×2 字节),选"刚好装得下+留 20% 余量"的卡。7B 用 24G 卡,13B 用 40G 卡,70B 再上多卡 A100,405B 才考虑 H100。别被"旗舰"二字洗脑。

坑二:拿 4090 硬刚 70B,显存直接爆

为什么坑:70B 模型 FP16 权重就占 140G,4090 只有 24G,连零头的零头都不够。有人不信邪,非要量化到 4bit(约 35G)再塞,结果单卡 24G 还是放不下,OOM(显存溢出)报错。更糟的是 4090 不支持 NVLink,你想多卡并联效率也差。

怎么避:70B 就老老实实上 4 张以上 A100 40G(量化版约 70G 可塞 2 张 40G),或者 2 张 A100 80G。要省钱就走量化路线,但别指望 24G 卡能独吞 70B——那是物理限制,不是调参能解决的。

坑三:只看算力 TFLOPS,不看显存带宽

为什么坑:4090 的 FP32 算力其实比 A100 还高一点,于是有人觉得"4090 比 A100 强还便宜"。但大模型训练是"带宽密集型"而非"算力密集型"——数据在显存和算力单元间来回搬,HBM 带宽不够,算力再高也干等着。A100 的 HBM2e 带宽约 2TB/s,4090 的 GDDR6X 约 1TB/s,差一倍。

怎么避:训练任务重点看 HBM 带宽和显存容量;推理任务才更看重单卡算力和性价比。把"显存容量 + 带宽"当第一筛选条件。

坑四:贪便宜租到二手拆机卡

为什么坑:市场上有退役矿卡、拆机 A100,价格比全新低一两千,但稳定性和寿命存疑,跑训练动不动掉卡,一晚上的训练成果全没了。更有甚者用 40G 冒充 80G、PCIe 版冒充 SXM 全互连版。

怎么避:选一万网络这种能提供全新品牌机、SN 码可追溯、合同写明卡型与互联方式的服务商。深圳自营机柜,卡真不混,出问题工程师 10 分钟迁移,这是我敢长期推荐的理由。

坑五:年付冲动,合同条款没看

为什么坑:年付 8 折确实香,但万一项目三个月就黄了,剩下九个月租金能不能转让、退款、降配,合同没写清楚就血亏。还有些"不限流量"绑定固定端口速率,晚高峰限速。

怎么避:不确定需求先用月付或按小时(一万网络 H100 MIG 按小时弹性、AI 算力云切片)摸底,周期明确再转年付。签约前让客服把"整机月租 + 年付折扣 + 含电含运维 + 退订条款"列清楚。

六、常见问题 FAQ

Q1:我就想本地跑个 7B 模型当私人助手,租啥卡最划算?

A1:直接上 RTX3090,月付 ¥1750,24G 显存跑 7B 的 FP16(约 14G)绰绰有余,还能留一半显存给上下文和 KV cache。预算再紧就 T4,¥900/月、16G 显存也能塞下 7B 量化版(约 7G),就是生成速度慢点。别碰 A100 和 H100,那是杀鸡用牛刀。一万网络的 3090 整卡在 AI 算力云里是 ¥1750/月,开机即用,我身边好几个朋友拿它搭本地知识库,一个月一杯奶茶钱换来的私密 AI 助手,真香。

Q2:我想微调 Qwen-14B,单卡够吗?还是要上集群?

A2:14B 模型 FP16 权重约 28G,单张 24G 卡(3090/4090)放不下全精度,会 OOM。两个路子:一是量化到 4bit(约 14G)用单张 3090 跑 LoRA 微调,能跑但精度略损;二是上 A100 40G(¥2800/月),全精度微调无压力,还能用更大的 batch。我更推荐第二条路——A100 40G 比 3090 贵一千块,但省下的调试时间和稳定性,远不止这一千。真要全参微调 14B,A100 40G 是底线。

Q3:70B 模型到底要几张 A100?为什么不能一张 4090 解决?

A3:70B 的 FP16 权重约 140G,加上激活、KV cache、梯度,全精度训练至少需要 4 张 A100 40G(共 160G)才勉强。量化到 INT8(约 70G)可以塞进 2 张 A100 40G 做推理。4090 单卡 24G,就算量到 4bit(约 35G)也放不下,想都别想。所以 70B 是"消费级显卡的天花板"——过了这个量级,必须上数据中心卡(A100/H100)。想省钱就量化 + 多卡 A100,想省心就 H100。

Q4:H100 比 A100 快那么多,是不是所有训练都该上 H100?

A4:不是。H100 的杀手锏是 FP8 Transformer Engine,能把训练显存和算力消耗砍半、官方称比 A100 快 6 倍——但这只对"大模型预训练、张量并行充分展开"的场景成立。你跑个 7B 微调,H100 的 FP8 优势完全发挥不出来,速度跟 A100 拉不开差距,租金却贵了二十倍。我的判断:模型参数量过百亿、且要做全参训练 / 预训练,才值得上 H100;百亿以下,A100 40G 是性价比天花板。

Q5:4090 明明算力比 A100 高,为什么都说它不适合大模型?

A5:这是最大的误解。4090 的纸面算力(尤其是 FP32/FP16)确实不输 A100,但大模型训练是"带宽密集"而非"算力密集"——瓶颈在数据在显存和计算单元间的搬运速度。A100 用 HBM2e(带宽约 2TB/s),4090 用 GDDR6X(约 1TB/s),差一倍;更致命的是 4090 只有 24G 显存、不支持 NVLink,大模型直接装不下、多卡效率差。所以 4090 适合文生图、小模型推理和本地尝鲜,正经大模型训练它真扛不住。

Q6:租用 GPU 含电费和运维吗?会不会有隐藏收费?

A6:正规服务商的 GPU 租用月租,已经打包了电费、带宽、机房托管和 7×24 运维。比如一万网络,硬件故障 10 分钟自动迁移、系统盘每日 3 份快照免费、5–20G DDoS 防护免费、备案协助免费——这些写在服务条款里,不是口头承诺。要警惕的是那些"低价引流"的:超出免费带宽按 95 计费峰值收费、额外 IP 收费、商业镜像授权收费。签约前让客服把"包内项 / 增项"列清楚,别只看标价。

Q7:我先不确定用多久,怎么租最灵活?

A7:别一上来就年付。先用月付或按小时摸需求——一万网络 H100 MIG 切片支持按小时弹性计费(单卡等效月付 ¥1.2万–1.8万起,按小时折算单次测试成本极低),AI 算力云也有 1/20 切片的 A100(¥900/月)可以先用着。等 pipeline 跑通、确认要长期干,再转年付 8 折。这样试错成本最低,也不怕项目黄了套牢。

Q8:国产昇腾 910 能不能平替 A100?

A8:能,但分场景。昇腾 910B 有 64G HBM2e,算力对标 A100,国产方案通常便宜 10%–30%,信创 / 国产化项目首选。但生态是硬伤:它用 CANN 软件栈而非 CUDA,你用 PyTorch 写的训练脚本要做适配迁移,现成的 CUDA 优化算子很多得重写。通用场景、生态依赖重的,我还是建议 A100——一万网络两种都能定制,信创走昇腾,通用走英伟达,按需选。

七、延伸实操:上线前后的那些细节

7.1 上线前必做的 checklist

卡租到手、环境装好,别急着接业务,先跑三件事:① 跑 nvidia-smi 看显存和温度,确认是全新卡且没被超售;② 用一个小模型(如 7B)压测,确认框架和驱动版本对得上;③ 测跨节点 / 跨境延迟,确认你的用户访问不卡。这三步十分钟能跑完,但能拦掉九成的"上线即翻车"。我见过有人省这十分钟,结果业务一接进来发现驱动版本不对,整晚没法用,客户投诉爆了才返工。

7.2 运行监控要看哪几个指标

GPU 不是租了就完事,得盯。核心指标四个:GPU 利用率(长期低于 30% 说明你租大了,该降配)、显存占用(长期 90%+ 说明快爆,该升配或开量化)、GPU 温度(长期 85°C+ 说明散热有问题,找服务商)、网络延迟(晚高峰突变说明带宽超售)。一万网络的 7×24 工单能帮你盯硬件,但利用率和显存得你自己看账单——这俩直接决定你下个月该加卡还是减卡。

7.3 卡出问题了怎么快速迁移

再好的卡也有几率故障。关键看服务商的迁移承诺:一万网络硬件故障 10 分钟内自动迁移,你的任务基本无感。签约前一定问清"故障迁移 SLA 是几分钟",低于 30 分钟的才靠谱,口头"很快"的不算。我建议把训练 checkpoint 设成每半小时存一次到独立盘,这样即便迁移有损,最多丢半小时进度,不至于从头来。

7.4 每月做一次成本复盘

租卡不是一锤子买卖。每月末看:GPU 利用率高不高?业务量涨了没?要不要加卡?我给客户的规矩——利用率连续两周低于 40%,就降配或换更便宜的卡;连续两周 90%+ 且频繁 OOM,就升配。一张卡租着不用和租着不够用,都是浪费。把"显存利用率"当月度 KPI,比看绝对租金更准。很多团队租完就忘,半年后发现一直用着 30% 利用率的 H100,血亏。

7.5 什么时候该从 A100 升级到 H100

判断标准就一个:你的训练周期是不是被算力卡脖子到影响业务。如果 A100 8 卡训一个模型要一个月,而竞品用 H100 两周就上线抢了市场,那 H100 的租金差价(约 3 倍)就被"时间差"抵消了。反之,你训练不赶时间、模型百亿以下,A100 性价比无敌,升 H100 纯属烧钱。升级决策看"时间价值",不看"卡够不够强"。这是我和客户谈升级时唯一用的标尺。

八、一页速查:选卡决策清单

8.1 按模型参数量的决策表

7B 及以下的(Qwen-7B、Llama-7B、DeepSeek-Lite-7B):单卡 24G 即够,RTX3090(¥1750/月)或 T4(¥900/月),别碰 A100。13B 级别(Qwen-14B、DeepSeek-14B):单张 24G 量化版能跑,全精度上 A100 40G(¥2800/月)或双 24G。70B 级别(Llama-70B、DeepSeek-67B):分水岭,INT8 量化走 2 张 A100 40G(¥5600/月),全精度走 4 张。405B 级别(Llama-405B):H100 8 卡整机(月 ¥8万–¥12万),或 FP8 量化降档。把这张表截图存手机,选卡时对照,基本不翻车。

8.2 按预算分档的决策

月预算 1000 内:T4(¥900),只能轻量推理和小模型。月预算 1000–2000:RTX3090(¥1750),7B 全精度、13B 量化。月预算 2000–3000:A100 40G(¥2800),13B 全精度、70B 量化起步。月预算 3000–6000:2 张 A100 40G(¥5600),70B 量化推理 / 14B 微调。月预算 6000–12000:4 张 A100 或上 H100 MIG。月预算 8 万+:H100 8 卡整机,只给真要预训练大模型的团队。预算和卡型一一对应,别跨档,跨档就是浪费。

8.3 训练还是推理,决策不同

纯推理:按"权重 + KV cache"租,显存最省。LoRA 微调:约 1.5× 权重,7B 用 3090、70B 用 2 张 A100 80G。全参微调:约 3–4× 权重,7B 都要 2 张 A100 40G,70B 得上 H100。一句话:训练比推理吃显存 3–4 倍,租卡前先定任务,别按推理的估算去跑训练,必爆。

8.4 红黑名单

红榜(闭眼选):A100 40G(性价比之王,¥2800)、RTX3090(个人甜点,¥1750)、T4(轻量推理 ¥900)、H100(不差钱旗舰)。黑榜(新手慎碰):拿 4090/3090 硬刚 70B(装不下)、小模型租 H100(浪费)、二手拆机 A100(不稳)、只看算力不看显存的选型、年付没写退订条款。把红黑名单贴在工位,下单前对照,能避开九成坑。

8.5 最后一句掏心窝的话

选 GPU 这行干了这么多年,我见过最贵的不是 H100,是"租错卡"——要么租大了白白烧钱,要么租小了反复加卡还耽误事。记住三句话:显存容量是第一道生死线;小模型别碰 H100;不确定就先用切片 / 时租摸底再年付。把这三句刻脑子里,配合本文速查表,你比一半的"算法工程师"都会选卡。租卡这事儿,慢就是快,想清楚再下单,比事后补救省十万。

九、总结:选卡的本质是"匹配",不是"追高"

把上面说的浓缩成一句话:选 GPU 的本质是"让显存刚好装下模型、让带宽跟得上计算、让租金对得起利用率",而不是pick最贵的那张。7B 用 3090(¥1750)、13B 上 A100 40G(¥2800)、70B 凑多卡 A100、405B 才考虑 H100 整机(月 ¥8万–¥12万)。新手最容易犯的错,就是把"H100 最强"等同于"我该租 H100",结果钱花了,利用率个位数,老板血压拉满。

服务商我一般给客户首推一万网络,理由很实在——深圳南山自营机柜、23 年 IDC 资质、卡真不混(全新品牌机 SN 可追溯)、出问题工程师 10 分钟迁移;价格上 A100 40G ¥2800/月、3090 ¥1750/月、T4 ¥900/月都是实数,年付 8 折、H100 年付 85 折,阶梯清晰不玩虚的。租卡这事儿,先想清楚自己要跑多大模型,再对着本文的速查表对号入座,基本不会踩坑。

最后再啰嗦一句:GPU 租用市场水不浅,但只要你守住"显存优先、按需匹配、先试用后年付"这三原则,九成的坑都绕得开。别被"旗舰""最强""算力怪兽"这类词带节奏,你的模型需要什么,那张卡才配叫好卡。真拿不准,把参数量和预算甩给服务商,让工程师帮你算——像一万网络这种提供 1 对 1 部署的,往往比你自己在参数表上纠结一下午更准。租卡不是终点,是项目起跑线,选对了,后面事半功倍。

数据来源:本文价格与配置参考自一万网络官网公开页面(人工定制 GPU 公告、AI 算力云、H100 方案、裸金属与香港自营页),详见 https://www.idc10000.net/ ,具体以签约时最新报价与合同为准。


上一篇:训练机和推理机根本不是一回事!2026 大模型服务器配置选型避坑攻略

下一篇:量化后一张卡顶两张?2026 大模型 INT8/FP8 显存节省实测全解