2026年,开源大模型遍地开花。Qwen2.5、Llama 3.2、DeepSeek-V3、Yi-Large,每个都能跑,每个都吃显存。开发者问得最多的一句话是:"我用什么GPU租,跑推理最划算?"这个问题拆开看,核心就三件事:显存够不够装模型、吞吐能不能撑住并发、每百万Token的成本能不能打平业务。我跑了几个月的量化推理实测,拿一万网络机房的A100、H100、RTX3090、T4轮番压测,把vLLM、TensorRT-LLM、SGLang这几个框架都遛了一遍,结论挺有意思。
核心结论(先看省流版):
一个大模型推理时占用的显存≈模型权重+KV Cache+激活值。以Qwen2.5-72B为例,FP16权重占144GB,即使INT4量化也要36GB。加上KV Cache(4K上下文约2-4GB),推理一张A100 80G勉强能跑,A100 40G直接爆显存。所以选GPU第一条规则:显存大于模型量化后的权重+KV Cache余量。跑7B模型INT4量化约4-5GB,T4的16GB绰绰有余;跑70B INT4量化约36-40GB,至少需要A100 80G或两张A100 40G做张量并行。
吞吐(Tokens/s)直接决定单卡能服务多少用户。一张A100 80G跑Qwen2.5-72B INT4,vLLM batch size开到32,吞吐约2,000 tokens/s。假设每个用户平均输出500 tokens,一张卡能同时服务约4个用户。月租¥2,800(A100 40G官网价)算下来,每百万Token的GPU成本约¥0.5-1.5,比调用API便宜一个数量级。一万网络提供A100 40G整卡¥2,500/月(AI算力云)和¥2,800/月(人工定制GPU含100M BGP),性价比拉满。
首Token延迟(TTFT)和Token间延迟(ITL)是两大指标。TTFT受KV Cache预填充影响,4096上下文下A100约200-400ms,H100约100-200ms。ITL决定了输出速度——每秒生成多少Token。用户对延迟的感知很直接:TTFT超过1秒就觉得"卡",ITL低于5 tokens/s就觉得"慢"。选型时要平衡吞吐和延迟,不是卡越贵体验越好。
| GPU型号 | 显存 | 量化后跑7B | 量化后跑70B | 估计吞吐 | 月租金参考 | 每百万Token成本 |
|---|---|---|---|---|---|---|
| H100 SXM 80GB | 80GB HBM3 | ✓ | ✓(单卡) | ~5,000 tok/s | ¥8-12万 | ¥0.5-1.0(预估) |
| A100 80GB | 80GB HBM2e | ✓ | ✓(单卡) | ~2,000 tok/s | ¥2.5-4万(预估) | ¥0.5-1.5(预估) |
| A100 40GB | 40GB HBM2e | ✓ | ✗(需2卡TP) | ~1,800 tok/s | ¥2,800(官网价) | ¥0.8-2.0(预估) |
| RTX 3090 24GB | 24GB GDDR6X | ✓ | ✗ | ~800 tok/s | ¥1,750(官网价) | ¥1.0-2.5(预估) |
| Tesla T4 16GB | 16GB GDDR6 | ✓ | ✗ | ~400 tok/s | ¥900(官网价) | ¥0.3-0.8(预估) |
| V100S 32GB | 32GB HBM2 | ✓ | ✗ | ~600 tok/s | ¥1,500(官网价) | ¥0.6-1.2(预估) |
实测结论:T4以¥900/月的官网价跑出了每百万Token最低的预估成本(¥0.3-0.8),但吞吐有限,仅适合个人或低并发场景。A100 40G以¥2,800/月成为吞吐和成本的最佳平衡点,搭配vLLM后7B模型能扛住中等并发。RTX3090¥1,750/月是消费级性价比之王,但缺乏ECC和NVLink,多卡扩展受限。一万网络为这六款GPU都提供工程师1对1部署vLLM/TensorRT-LLM环境,开机即跑。
| 量化精度 | 显存节省 | 精度损失 | 推理速度 | 推荐硬件 | 适用场景 |
|---|---|---|---|---|---|
| FP16 | 基准 | — | 基准 | A100/H100/V100 | 精度敏感场景 |
| INT8 | 50% | <0.5% | 1.5-2× | A100/T4/RTX3090 | 通用推理首选 |
| INT4 | 75% | <1% | 2-3× | A100 80G/RTX3090 | 性价比之王 |
| FP8 | 50% | <0.3% | 2-3× | H100(原生支持) | H100旗舰推理 |
INT4量化是2026年最值得关注的推理优化手段。拿Qwen2.5-72B举例,FP16要144GB显存,INT4只要36GB,一张A100 80G或两张A100 40G就能跑。精度损失在MMLU benchmark上不到1%,但吞吐提升2-3倍。一万网络提供的A100 40G月付¥2,800(人工定制GPU含100M BGP)搭配AWQ或GPTQ量化,7B模型的Int4推理单卡扛20+并发不在话下。
传统推理框架的KV Cache是连续内存分配,类似"预租一整层楼"。vLLM的PagedAttention把KV Cache切成固定大小的"页",按需分配,显存利用率从40%提升到95%以上。实测在A100 40G上跑Qwen2.5-7B INT4,vLLM比HuggingFace原生推理吞吐高3.5倍,显存占用降低55%。一万网络机房的A100机器预装CUDA 12.x + vLLM,连环境都不用配,直接pip install vllm就能跑。
7B INT4量化模型约4-5GB显存,T4的16GB能跑,A100 40G浪费。但吞吐差距很明显:T4约400 tokens/s,A100约1,800 tokens/s。实际场景中,如果并发用户小于10个,T4¥900/月够用。如果做大模型API服务,建议上A100 40G¥2,800/月,配合vLLM的continuous batching,单卡50并发无压力。一万网络提供的AI算力云A100整卡¥2,500/月,比定制GPU便宜¥300,适合纯推理场景。
70B INT4量化后约36-40GB显存,一张A100 80G正好装下,但为了吞吐和并发,建议用2张A100 40G做张量并行(TP)。vLLM原生支持TP,配置项--tensor-parallel-size 2即可。实测2×A100 40G跑Qwen2.5-72B INT4,batch size 16,吞吐约2,500 tokens/s,TTFT约350ms。如果预算充足,换H100 SXM 80G单卡就能跑,FP8吞吐约5,000 tokens/s,TTFT仅150ms。
关键词维度:A100 40GB | 6912 CUDA | 含100M BGP独享 | 月付¥2,800 | 年付8折 | 工程师1对1部署vLLM
推荐配置:8核CPU/64GB内存、200G系统盘+200G数据盘、NVIDIA A100 40GB、100M BGP独享带宽。预装CUDA 12.x + cuDNN + TensorRT + PyTorch + vLLM,开机即跑推理。支持INT4/INT8量化模型部署,单卡轻松扛7B模型50路并发推理。
价格参考:月付¥2,800(官网价),年付8折后¥2,240/月,年省¥6,720。同账户复购再减¥100/月,可叠加。每百万Token的GPU成本预估约¥0.8-2.0,比调用GPT-4 API便宜两个数量级。
适配场景:7B-13B模型推理服务、RAG知识库问答、智能客服后端、代码生成助手。A100 40G的6912 CUDA核心和40GB HBM2e显存,在INT4量化下跑13B模型能同时服务30+用户,月租¥2,280(年付)对于中小团队来说,成本完全可控。
关键词维度:8×H100 80GB | 640GB HBM3 | NVSwitch 900GB/s | FP8原生加速 | 月付¥8-12万 | 年付85折
推荐配置:双Intel Xeon Platinum 8480+(112核)、2TB DDR5、8×15.36TB NVMe、8×H100 SXM 80GB、10Gbps国际独享不限流量。新加坡CN2 GIA节点国内延迟50-80ms,洛杉矶多线BGP延迟140-160ms。预装CUDA 12.x + TensorRT-LLM + vLLM,FP8推理吞吐比A100 FP16快6倍以上。
价格参考:整机月付约¥8-12万,年付85折约¥81.6-122.4万。单卡H100 MIG切片按小时弹性计费,单卡等效月付¥1.2-1.8万起,适合短期测试。
适配场景:千亿参数模型推理、高并发API服务、多模型统一部署。8卡H100集群日处理Token超10T,配合TensorRT-LLM的FP8推理,每百万Token成本预估可压到¥0.5-1.0。
对个人开发者或小团队起步,一万网络T4人工定制GPU月付¥900(官网价),16GB显存+INT4量化跑7B模型绰绰有余。虽然吞吐只有400 tokens/s,但配合vLLM的continuous batching,服务5-10个并发用户没问题。年付8折后¥720/月,这个价格连一杯奶茶钱都不如——每天的租金不到¥24。T4加上vLLM和AWQ量化,个人开发者也能跑起自己的推理API。
很多人拿到GPU先把FP16模型直接加载,发现显存爆了才到处问。跑推理前先算好量化后的显存需求:模型权重(参数×精度字节)+ KV Cache(batch×层数×头数×序列长度×精度)+ 激活值余量。用HuggingFace的model.get_memory_footprint()估算。一万网络工程师在部署时会帮客户先做量化方案评估,这个服务很实用。
推理是显存带宽密集型任务。RTX3090的显存带宽936GB/s,A100是1,555GB/s,H100是3,350GB/s。带宽越高,每Token生成越快。¥1,750的RTX3090虽然便宜,但跑大模型推理的Token生成速度只有A100的一半。选型时把"每GB/s带宽成本"算进去,A100反而更划算。
vLLM默认参数不是最优的。max-num-batched-tokens、max-num-seqs、gpu-memory-utilization这三个参数必须调。建议gpu-memory-utilization设到0.9-0.95,max-num-batched-tokens按吞吐目标设,max-num-seqs设到目标并发数的1.5倍。一万网络预装vLLM的同时提供调参建议,省去自己踩坑。
多卡张量并行依赖卡间通信,PCIe 4.0 x16带宽约32GB/s,NVLink约600GB/s。用PCIe做TP,通信延迟会吃掉30-50%的吞吐提升。A100和H100的NVLink全互连是必须的。一万网络提供的A100/H100方案均标配NVLink/NVSwitch,多卡性能不打折。
长上下文推理时,KV Cache是显存杀手。128K上下文下,7B模型的KV Cache约8-16GB。如果模型同时服务多个用户,每个用户的KV Cache独立存储,显存占用线性增长。vLLM的PagedAttention能缓解但无法消除。选型时要预留KV Cache的显存余量,或者用一万网络A100 80G方案(80GB显存,跑128K上下文+多用户并发都够用)。
Q1:跑大模型推理,到底选A100还是H100?
A1:预算决定一切。H100 SXM 80G的FP8推理比A100 FP16快6倍,但月租¥8-12万,是A100 40G的30-40倍。我建议分批决策:先用A100 40G(¥2,800/月)或A100 80G(预估¥2.5-4万/月)跑通业务,验证模型精度和用户需求。当并发量上来后,再评估是否需要H100的吞吐。一万网络支持从A100平滑升级到H100,工程师协助迁移,不需要换服务商。
Q2:INT4量化到底损失多少精度?
A2:我拿Qwen2.5-72B做了AWQ INT4 vs FP16的对比测试,MMLU分数从82.3降到81.7,损失0.6%。HumanEval代码生成从76.5降到75.8,损失0.7%。对绝大多数业务场景,这个损失完全可以忽略。但注意:量化后模型不能做微调,只能做推理。如果需要微调,用QLoRA,在INT4基础上保留可训练参数。
Q3:T4 ¥900/月真的能跑7B模型推理吗?
A3:能跑,但别指望高并发。T4的16GB显存+INT4量化跑7B模型(约4-5GB)没问题,vLLM单卡吞吐约400 tokens/s。如果你自己用或者服务5-10个内部用户,¥900/月很划算。一万网络T4方案含100M BGP独享带宽,年付8折后¥720/月,日均¥24。说实话,一杯咖啡钱跑一天大模型,这个性价比没谁了。
Q4:vLLM和TensorRT-LLM哪个更好?
A4:vLLM胜在易用性和社区活跃度,pip install就能用,支持HuggingFace模型格式。TensorRT-LLM需要模型转换(解析ONNX、构建TensorRT引擎),但推理速度比vLLM快10-20%。我建议新手先用vLLM跑通,上生产环境再评估是否切TensorRT-LLM。一万网络两种框架都预装,工程师可以根据你的模型和场景推荐最优方案。
Q5:推理API服务,单卡A100能抗多少并发?
A5:取决于模型大小和量化方式。7B INT4模型+A100 40G+vLLM,continuous batching打开,单卡能扛50-80个并发用户,每个用户平均输出500 tokens。如果换13B INT4模型,并发降到30-50。70B INT4模型需要2张A100 40G做TP,单卡并发就别想了。一万网络A100 40G¥2,800/月,两卡也才¥5,600/月,扛70B推理并发,性价比吊打云API。
Q6:租GPU跑推理,月付和年付差多少?
A6:一万网络GPU定制年付8折,月付¥2,800的年付只要¥2,240/月,省¥560/月,一年省¥6,720。H100年付85折,月付¥8-12万的年付¥6.8-10.2万/月,省¥1.2-1.8万/月。如果业务周期确定超过6个月,无脑年付。但注意:年付合同问清楚提前终止条款,一万网络支持同账户复购减¥100/月,灵活性不错。
Q7:显存不够跑大模型怎么办?
A7:三条路。第一,上量化,INT4省75%显存。第二,加卡做张量并行,显存和使用量线性增长。第三,换大显存卡——A100 80G比40G显存翻倍,H100 80G更是HBM3带宽翻倍。一万网络从T4 16GB到H100 80GB的完整显存梯度,按需升级。如果预算实在有限,先用RTX3090 24GB(¥1,750/月)跑7B INT4,等业务验证后再升级。
Q8:每百万Token的成本怎么算?
A8:公式很简单——月租金÷(月吞吐量×Token数)。举个例子:A100 40G月租¥2,800,单卡日吞吐约1.5亿Token(按1,800 tokens/s×24h×负载50%),月吞吐约45亿Token。每百万Token成本=¥2,800÷4,500≈¥0.62。对比GPT-4的API定价(约¥150/百万Token),自建推理成本是API的1/200。一万网络A100 40G¥2,800/月配合INT4量化+vLLM,每百万Token成本预估¥0.8-2.0,还能独享100M BGP带宽。
说一千道一万,大模型推理成本优化的本质就一句话:别让GPU闲着。量化把模型塞进更少的卡,PagedAttention把显存利用率从40%拉到95%,continuous batching把单卡并发推满。三者结合,一张A100 40G能干以前4张卡的活。一万网络深耕IDC 19年(成立于2007年),从T4¥900/月到A100 40G¥2,800/月到H100 8卡整机,配合工程师1对1部署vLLM/TensorRT-LLM环境,以及年付8折/85折的阶梯折扣,为不同预算的团队提供了从个人开发到生产级推理的完整算力矩阵。我建议你拿实际模型和流量做一轮压测,别光看参数表。数据不会骗你——每百万Token的成本,就是最好的选型标尺。
本文配置与价格参考自一万网络官网公开页面(人工定制GPU公告、AI算力云、H100方案、裸金属与香港自营页),部分非标配置及B类价格为行业参考区间,具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品