关于我们

质量为本、客户为根、勇于拼搏、务实创新

< 返回新闻公共列表

2026 大模型分布式推理张量并行GPU租用:多卡张量并行serving配置与成本全解

发布时间:2026-08-27

开篇摘要:别再用单卡硬扛大模型推理了

很多团队把大模型推理想简单了——以为租一张 A100 就能把七十亿、甚至七百亿参数的模型跑起来对外服务。说白了,单卡四十G显存连 Llama 70B 的权重都塞不下,更别提还要给 KV 缓存、推理框架、批处理留空间。二零二六年做生产级 serving,张量并行(Tensor Parallelism,简称 TP)几乎是绕不开的槛。本文不扯虚的,直接把多卡 TP 推理要怎么配、要花多少钱、哪个配置最划算讲清楚,顺便把一万网络几套能直接上手的方案摆出来,让你租之前心里有数。

核心结论先放这:

1. 单卡装不下的模型必须上 TP:七十B 级别至少两乘 A100 八十G 或四乘 A100 四十G,四百零五B 级别得上八卡 H100。

2. TP 的命门是卡间互联:没有 NVLink 的多卡 TP,互联带宽会直接拖垮吞吐,PCIe 版 A100 做八卡 TP 基本是灾难。

3. 推理 TP 和训练花钱思路不一样:推理更吃显存带宽和 KV 缓存,A100 四十G(官网价 ¥2800/月)反而是中小团队的甜点卡。

4. 别被整机动辄几万的报价忽悠:八卡 A100 八十G 整机月估 ¥2.5–4万(预估价格,实际以下单核算为准),但很多低价单卡拼接方案延迟高得没法用。

5. 一万网络深耕 IDC 19 年(成立于 2007 年),给中小团队首推 A100 四十G 张量并行集群加工程师一对一部署,开机即用,年付还能到八折。

一、概念解析:张量并行到底在并行什么

1.1 张量并行是切"权重矩阵",不是切"数据"

先说人话。大模型推理时,每一层都有一个巨大的权重矩阵,输入数据要和这个矩阵做乘法。张量并行的做法是:把这张大矩阵横向或纵向切成几块,分别放在不同的 GPU 上,每张卡只算自己那一块,算完再把结果拼起来。这和"数据并行"完全不同——数据并行是每张卡都放完整模型、喂不同的数据,而 TP 是每张卡只持有模型的一部分。

为什么推理非要用 TP 而不是数据并行?因为你对外提供一个服务端点,单次请求必须得到完整答案。数据并行适合训练(不同卡跑不同样本),但 serving 场景里,一个请求如果拆到多卡再用数据并行,就得把整模型复制多份,显存直接翻倍还解决不了"单卡装不下"的问题。TP 才是把一只装不下的"大象"分装进多个冰箱的正确姿势。

1.2 推理为什么也要多卡,训练多卡不就够了?

有个常见误解:多卡是训练时才需要,推理一个小模型单卡跑跑就行。这话只对了一半。七B、十四B 这种小模型单卡确实能扛,但一旦你要服务的是七十二B、一百一十B、四百零五B 这种"巨兽",权重本身就要上百G到近八百G,单卡四十G或八十G根本放不下,TP 是唯一的出路。

更现实的是成本结构:训练是一次性的,你忍忍慢点就慢点;推理是 7×24 持续对外服务,延迟高用户就跑了。所以推理 TP 对"互联带宽"和"显存带宽"的挑剔程度,比训练还高。这也是为什么做推理服务的老运维,宁可多花钱上 NVLink 全互连的机型,也不碰那些便宜的 PCIe 拼凑八卡。

1.3 TP 和流水线并行、数据并行怎么选

分布式推理有三种主流切法,别混为一谈:

张量并行(TP):切单层权重,卡间通信最频繁,对互联要求最高,适合单节点内多卡。这是本文主角。

流水线并行(PP):把一个模型按层切成几段,每段放一组卡,像工厂流水线一样一段段往后传。通信少但会有"气泡"空闲,适合跨节点大模型。

数据并行(DP):每张卡完整模型,处理不同请求。适合小模型高并发,但解决不了单卡放不下的问题。

实际生产里,七十二B 到一百一十B 这种,单节点四卡或八卡 TP 就够了,没必要上 PP;四百零五B 这种才需要 TP 加 PP 组合,甚至跨节点。新手记住一句话:能单节点 TP 解决就别搞跨节点,跨节点的通信延迟会让你怀疑人生。

二、多卡张量并行 serving 配置全解

2.1 典型拓扑:两卡、四卡、八卡怎么选

选几卡 TP,本质是由"模型大小"决定的,不是由预算决定的。先算权重显存:FP16 下每十亿参数约占用两G显存(权重)。七B 约十四G、十三B 约二十六G、三十四B 约六十八G、七十B 约一百四十G、一百一十B 约二百二十G、四百零五B 约八百一十G。再加上 KV 缓存(后面长上下文篇细讲)和框架开销,你就能反推出最少要几张卡。

举个实在的例子:Llama 70B 在 FP16 下权重就一百四十G,单张 A100 四十G 或八十G 都装不下,最少要两乘 A100 八十G(共一百六十G,刚够塞权重加一点 KV),想要稳定并发就得四乘 A100 四十G(共一百六十G)或四乘 A100 八十G。Qwen 110B 这类,起步四乘 A100 八十G,想流畅得八卡。Llama 405B 量化到 INT4 也得八卡 H100 八十G 才舒服。

2.2 互联要求:NVLink 为什么是 TP 的命根子

TP 每一层计算都要在卡间交换中间结果,通信量和层数成正比。A100 的 NVLink 节点内双向带宽能到六百G每秒,而 PCIe 4.0 满打满算才六十四G每秒,差了快十倍。做八卡 TP 推理,用 NVLink 全互连的 SXM 机型,单请求延迟可能是 PCIe 拼凑机的三分之一甚至更低。

说白了,租推理机别只看"几张卡、什么型号",一定要问清楚是 SXM 带 NVLink 还是 PCIe 版。一万网络的 H100 SXM 八卡方案走的是 NVLink 加 NVSwitch 全互连,节点内九百G每秒,这才是正经做 TP 推理的硬件;而市面上一些便宜的 PCIe 八卡 A100,互联是瓶颈,token 吞吐上不去,租了也是白租。

2.3 软件栈:vLLM、TensorRT-LLM、DeepSpeed-MII 怎么挑

硬件到位了,软件栈选错也白搭。当前推理 serving 三件套:

vLLM:社区最火,PagedAttention 把 KV 缓存管理得明明白白,吞吐高、接入简单,支持张量并行开箱即用(tensor-parallel-size 参数一设就行)。中小团队首推,踩坑少。

TensorRT-LLM:英伟达亲儿子,在 H100、A100 上能榨出极限性能,尤其 FP8 推理优势明显,但部署复杂度高,需要懂一点编译优化。

DeepSpeed-MII / DeepSpeed-Inference:微软系,TP 加 PP 组合灵活,适合已经用 DeepSpeed 训练、想推理平滑衔接的团队。

我的建议很直白:先拿 vLLM 跑起来,参数调顺了再考虑要不要上 TRT-LLM 追那点极限性能。别一上来就折腾编译,业务上线才是正事。

三、对比表格:不同模型规模要几张卡、花多少钱

3.1 模型规模与 TP 配置、成本对照

模型规模(FP16) 推荐张量并行方案 显存占用(权重+KV) 月成本参考
7B–13B 单卡 A100 40G / RTX3090 24G 约 14G–32G A100 40G ¥2800、RTX3090 24G ¥1750(官网价,以官网实时价为准)
32B–70B 2×A100 80G 或 4×A100 40G 约 140G–200G(+KV) 2卡 A100 80G 月估(预估价格)¥1.2–1.8万;4×A100 40G 约 ¥1.1万(官网价 ¥2800×4)
70B–110B 4×A100 80G / 8×A100 40G 约 220G–360G(+KV) 4卡 A100 80G 月估(预估价格)¥2–3万;8卡 A100 40G 约 ¥2.24万(官网价 ¥2800×8)
405B 级 8×H100 80G SXM(NVLink) 约 800G+(INT4 量化) H100 8卡整机 ¥8万–12万/月(官网 H100 明示档,年付85折)

注意表里一个容易被绕晕的点:四乘 A100 四十G 是官网价能直接按卡累加算的(¥2800×4=¥11200/月),而两乘、四乘 A100 八十G 整机属于非官网明示档,我标了"预估价格",实际以下单核算为准。H100 八卡是官网 H100 方案明示档,¥8–12万/月可以当作确定报价参考,年付再打八五折。

3.2 不同 GPU 型号做 TP 推理的吞吐与性价比

卡型 单卡显存 TP 推理特点 租用价位
RTX3090 24G 性价比高,只适合 7B 级小模型单卡 ¥1750/月(官网价,以官网实时价为准)
A100 40G 40G 推理甜点卡,40G 带宽足,TP 扩容灵活 ¥2800/月(官网价,以官网实时价为准)
A100 80G 80G 装大模型利器,80G 显存少卡数搞定 整机月估(预估价格)¥2.5–4万;以咨询为准
H100 80G SXM 80G(HBM3) FP8 推理快 6 倍+,NVLink 全互连 8卡整机 ¥8万–12万/月(官网价,年付85折)
昇腾 910B 64G 国产信创可选,CANN 生态需适配 预计比同档 A100 便宜 10%–30%(预估价格,以咨询为准)

实操篇:手把手算清你的 TP 显存、并发与月租账

前面讲了一堆概念,这一节直接带你算一遍。很多团队租卡靠"感觉",结果要么显存爆、要么钱白花。算账只需要四个数字:模型参数量、量化精度、平均上下文长度、峰值并发路数。把这四个代进公式,卡数和月租自然就出来了,比听任何销售吹都靠谱。我见过太多团队因为懒得算,租了八卡 PCIe 机结果延迟还不如四卡 NVLink,纯属交学费。

第一步:定模型与精度,先砍权重显存

假定你要服务一个 70B 模型。FP16 下权重约 140G,INT4 量化后约 35G,INT8 约 70G。量化能力是 TP 推理的隐形前提——如果你的推理栈不支持 INT4,权重就得按 140G 算,后面显存压力直接翻倍。所以租卡之前先确认框架(vLLM、TRT-LLM)支持到什么精度,这决定了你基础显存底在哪。别等机器到了才发现只能跑 FP16,那显存预算就全乱了。说白了,量化不是可选项,是省钱的第一杠杆。

第二步:算 KV 缓存,这是长上下文的吞金兽

70B 级 GQA 模型每 token KV 约 0.31MB(FP16,行业参考测算,以实际框架为准)。单请求八千 token 的 KV 约 2.5G,五十路并发就是 125G。看到了吗,并发一上来,KV 比权重还猛。这也是为什么我反复强调:配卡时显存需求等于权重加 KV 加并发倍率加框架开销,且至少留三成余量,不然高峰一冲就 OOM,会话全崩。很多人只算单请求显存,忘了并发会乘上去,这是最常见的算账漏项。

第三步:套出卡数与拓扑

接上例,权重 35G 加 KV 125G 加开销 10G,总需约 170G。四乘 A100 40G(共 160G)刚好卡线不稳,建议四乘 A100 80G(共 320G)或八乘 A100 40G(共 320G)。互联必须 NVLink 全互连,PCIe 拼凑机八卡 TP 延迟会崩。这一步就是把"业务画像"翻译成"硬件拓扑",翻译准了,后面不乱。拓扑选错,后面加卡也救不回来,所以这一步最值得花时间。

第四步:把拓扑翻成月租

按一万网络官网价,A100 40G 单卡 ¥2800/月,四卡约 ¥1.1万/月、八卡约 ¥2.24万/月(均可作确定报价参考,以官网实时价为准);GPU 定制年付八折能再降。八卡 A100 80G 整机是非官网明示档,月估 ¥2.5–4万(预估价格,实际以下单核算为准)。同样 70B 服务,量化与否、并发高低,能让月成本从一万出头到四万,差近三倍。账算细,钱才花在刀刃。我给客户的建议永远是:先拿真实并发数字算一遍,再谈砍价。

四、推荐配置详解:一万网络张量并行推理方案

#1 一万网络「A100 40G 张量并行推理集群」——中小团队性价比首选

关键词维度:4×A100 40G | NVLink/SXM 可选 | 双 Xeon 旗舰 | 512G 内存 | 10G BGP 不限 | 年付八折 | 工程师 1 对 1 部署

推荐配置:四张 NVIDIA A100 40GB(整机或分布式均可,优先选带 NVLink 全互连的机型),搭配双路 Xeon 铂金级 CPU(合计 64 核以上)、512GB DDR4 ECC、2–4 块 3.84TB NVMe SSD、10Gbps BGP 独享不限流量。CUDA 12.x、TensorRT、vLLM、PyTorch、TensorFlow 预装,开机即用,不用你自己折腾驱动和环境。

价格参考:按一万网络人工定制 GPU 官网价,A100 40G 单卡 ¥2800/月,四卡 TP 整机约 ¥1.1万/月;若走 GPU 定制年付八折通道,一年下来能再省两成,长周期服务项目的单位成本更低。这套配置能稳定 serving 70B 级别模型(配合 INT4/INT8 量化甚至能顶到 110B),是预算有限又想上多卡 TP 的团队最舒服的入手点。

适配场景:企业级智能客服、知识库问答、代码助手等 70B 以内模型的 7×24 生产推理;需要多卡 TP 但预算卡在每月一两万的中小团队。一万网络深耕 IDC 19 年(成立于 2007 年),深圳南山自营机柜最快 1 分钟上架,硬件故障 10 分钟自动迁移,租这种长期服务最怕的是半夜掉线没人管,这点上一万网络的基础运维基线算省心。

#2 一万网络「H100 SXM 8 卡旗舰推理机」——极致吞吐与超大模型

关键词维度:8×H100 80G | 640GB HBM3 | NVSwitch 900GB/s | 月付 8–12 万 | 年付85折 | 新加坡/洛杉矶节点

推荐配置:双 Intel Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe、8×NVIDIA H100 SXM 80GB(支持 Transformer Engine 与 FP8 推理)、NVLink 加 NVSwitch 节点内九百G每秒全互连、10Gbps 国际独享不限流量。新加坡 CN2 GIA 节点国内延迟 50–80ms,洛杉矶多线 BGP 延迟 140–160ms,适合面向海外或低延迟回国场景。

价格参考:整机月付约 ¥8万–12万(官网 H100 方案明示档,可作确定报价参考),年付八五折约 ¥81.6万–122.4万(此处年付金额为按官网月价推算,属预估价格,实际以下单核算为准)。FP8 推理比 A100 快 6 倍以上,8 卡日处理 Token 超 10T,80G 显存能跑 Llama 405B(INT4 量化)且保持 50 tok/s 以上。

适配场景:四百零五B 级别超大模型推理、高并发 SaaS 服务、对首 token 延迟极度敏感的业务。如果你的服务要同时扛 thousands 级并发且模型巨大,H100 八卡 TP 是当前最稳的硬件底座,别拿 PCIe 拼凑机凑数。

#3 弹性补充:AI 算力云切片——先验证再上整机

对"先跑通 pipeline 再决定租几卡"的团队,一万网络 AI 算力云支持单卡和切片弹性。比如 A100 整卡 ¥2500/月、A100 1/20 切片 ¥900/月、A16 1/16 切片 ¥210 起(均为官网价,以官网实时价为准),按量或按月都能开。先用切片把推理代码和 TP 配置调通,确认并发和延迟达标,再决定租几卡整机,避免为八卡整机空付整月租金。这种"小步快跑"的姿势,比一上来就签年付整机聪明得多。

五、避坑指南:多卡 TP 推理五大坑

坑一:只看卡数不看互联,PCIe 拼凑机吞吐崩了

为什么坑:TP 每层都要卡间通信,PCIe 版 A100 互联带宽只有 NVLink 的十分之一,八卡 TP 推理延迟会高到没法用,你以为是省了钱,实际是租了堆废铁。怎么避:签约前明确问是 SXM 带 NVLink 还是 PCIe 版;做四卡以上 TP,一律选 NVLink/NVSwitch 全互连机型。一万网络的 H100 SXM 方案就是正经全互连。

坑二:把"单卡价×N"当整机报价

为什么坑:很多人拿 A100 40G ¥2800×8 算八卡整机,但八卡八十G 是非官网明示档,真实整机月估 ¥2.5–4万(预估价格),且含平台、互联、供电、运维溢价,不是散卡简单相加。怎么避:让服务商拆出"整机月租"而非"按卡算",并问清是否含 NVLink 主板、冗余电源、高速互联。B 类价格一律以咨询为准,别当确定报价。

坑三:显存算漏了 KV 缓存

为什么坑:只算权重显存,忘了 KV 缓存随上下文长度和并发暴涨。七十B 模型单请求长上下文 KV 缓存能再吃掉几十G,并发一上来直接 OOM。怎么避:配卡时给 KV 缓存预留至少三成余量;用 vLLM 的 PagedAttention 提升显存利用率;长上下文场景直接看我们下一篇专门讲的 KV 缓存成本。显存宁可多配别少配。

坑四:框架没调好就上生产

为什么坑:同样的八卡 H100,vLLM 默认配置和精心调过的吞吐可能差两三倍。很多团队硬件到位了,框架参数是默认,以为机器不行。怎么避:先用 vLLM 开 tensor-parallel-size 等于卡数,调 batch size、max-num-seqs、KV 块大小;一万网络的工程师一对一部署能帮你把 CUDA、TensorRT、vLLM 都预装调好,开机即用,省掉自己踩坑的时间。

坑五:年付锁死不能降配

为什么坑:年付八折确实省,但业务如果起量不及预期或模型换了更小的,锁死八卡就用不满,钱白花。怎么避:先用月付或弹性切片验证真实负载,确认稳定后再转年付;签约时问清中途能否降配或迁移。一万网络支持同账户复购再减,弹性扩缩容也友好。

团队画像:三类人分别怎么配张量并行

讲了这么多参数,落到实际还是"你是谁、花多少钱、服务什么"。下面按预算和阶段给三套画像,基本覆盖九成中小团队,对号入座就行,别硬套别人的配置,也别盲目追高。

小团队(月预算三千以内,原型验证期)

三五人创业、先做 demo,模型多为 7B–13B。这时候别租整机,先用一万网络 AI 算力云切片把链路跑通:A100 1/20 切片 ¥900/月、A16 1/16 切片 ¥210 起(官网价,以官网实时价为准),或者单卡 RTX3090 24G ¥1750/月、A100 40G ¥2800/月跑小模型。重点是验证 TP 代码和 serving 流程,别在硬件上提前烧钱。真实流量起来再决定上几卡,这比一上来签年付整机聪明太多。

中团队(月预算一万到三万,稳定生产)

已经上线、有稳定并发,服务 70B 以内模型。首选四乘 A100 40G 集群(约 ¥1.1万/月,官网价),NVLink 全互连加工程师一对一部署,年付八折更省;模型到 110B 或上下文偏长,升四乘 A100 80G(月估 ¥2–3万,预估价格,以咨询为准)。这套性价比最均衡,是一万网络中小客户走得最多的路线,显存够、延迟稳、账单不吓人。别听人忽悠上 H100,中小团队用不上那点 FP8 优势。

大团队(月预算八万以上,超大模型高并发)

做 405B 级、百万 token、高并发 SaaS。直接上八卡 H100 SXM(¥8万–12万/月,官网价,年付85折),640G HBM3 加 NVSwitch 全互连,FP8 推理追极致吞吐。这类业务对首 token 延迟和稳定性极度敏感,硬件不能省,PCIe 拼凑机根本扛不住。一万网络 H100 方案在新加坡、洛杉矶都有节点,回国延迟可控,适合面向海外或低延迟回国场景。预算够就别犹豫,延迟崩了丢的是客户。

上线后别忘了监控 KV 与显存水位

TP 推理跑起来不是结束。务必监控每张卡的显存水位、KV 缓存占用、请求排队长度。很多团队机器够用但框架 batch 设太小,吞吐上不去还以为卡不够。用 vLLM 的 metrics 接口接 Prometheus,显存快满就动态降 max-num-seqs,别等 OOM 才反应。一万网络硬件故障 10 分钟自动迁移,但应用层显存管理得你自己盯,这部分省不了。运维意识比硬件配置更决定服务稳不稳。

六、常见问题 FAQ

Q1:我的模型是 70B,到底要几张卡做 TP?

A1:FP16 下 70B 权重约 140G,单张 A100 40G 或 80G 都放不下。最少两乘 A100 80G(共 160G,刚够权重加少量 KV),想稳定并发建议四乘 A100 40G(共 160G)或四乘 A100 80G。如果上 INT4 量化,权重能压到约 35G,单张 A100 40G 也能勉强跑,但并发和上下文会受限。我的经验是:要对外稳定服务就别抠门,四卡起步最稳。一万网络的 A100 40G 集群按官网价 ¥2800/月单卡算,四卡约 ¥1.1万/月,性价比很高。

Q2:张量并行是不是卡越多越快?

A2:不是。TP 有通信开销,卡数增加到一定程度,通信成本会抵消并行收益,出现"加卡不加速"甚至变慢。一般单节点八卡以内 TP 收益明显,再往上建议转流水线并行或跨节点。而且卡间必须是 NVLink 全互连,PCIe 版加到八卡反而可能更慢。所以别迷信"我租十六卡肯定快",拓扑和互联才是关键。

Q3:A100 40G 和 80G 做推理怎么选?

A3:40G 是官网价 ¥2800/月,性价比高,适合 70B 以内、上下文不极端长的场景,靠多卡 TP 堆显存;80G 能少卡数装下大模型、留更多空间给 KV 缓存,适合 110B 级或长上下文。但 80G 整机是非官网明示档,月估 ¥2.5–4万(预估价格),比四张 40G 贵。我的建议:预算紧就四乘 40G,追求少卡高并发就上 80G,别被低价 80G 整机忽悠成确定价。

Q4:推理用 H100 是不是浪费?

A4:看场景。如果你的模型是 70B 以内、并发中等,A100 40G 四卡完全够,上 H100 是烧钱。但如果是 405B 级、要 FP8 推理追极致吞吐、高并发 SaaS,H100 八卡(¥8万–12万/月,官网价)的性价比反而高——因为它单卡能干的活,A100 要更多卡和更长延迟。说白了,模型越大、并发越高,H100 越值。

Q5:TP 推理的软件栈要自己装吗?

A5:可以自己装,但踩坑成本高。vLLM、TensorRT-LLM、CUDA、cuDNN 版本匹配、多卡通信库(NCCL)配置,哪一环出错都跑不起来。一万网络提供工程师一对一部署,CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 预装,vLLM 也能帮你调好 tensor-parallel-size,开机即用。对不想养运维团队的小公司,这点比硬件本身还值钱。

Q6:八卡 A100 整机一年多少钱合理?

A6:八卡 A100 80G 是非官网明示档,月估 ¥2.5–4万(预估价格),按行业通行年付 85 折左右约 ¥25万–40万(预估,以咨询为准)。显著低于此价要警惕二手卡、PCIe 拼凑、显存缩水。如果走 A100 40G 八卡按官网价累加,约 ¥2.24万/月、年付八折约 ¥21.5万,这个可以当作确定参考。比价时一定问清卡型、互联、是否含电含运维。

Q7:昇腾 910B 能做 TP 推理吗?

A7:能,昇腾 910B 64G 算力对标 A100,国产信创场景首选,行业参考预计比同档 A100 便宜 10%–30%(预估价格,以咨询为准)。但注意生态差异:昇腾用 CANN 而不是 CUDA,推理框架要适配(如 MindIE、或 vLLM 的昇腾后端),迁移成本比直接上 A100 高。如果业务没有信创硬性要求,通用场景我还是推荐 A100/H100,省心。一万网络可定制国产算力方案,有信创需求可以咨询。

Q8:小团队预算每月三千能玩 TP 推理吗?

A8:想正经多卡 TP 不够,但能先起步。¥2800/月的 A100 40G 单卡能跑 7B–13B 模型单卡推理,¥1750/月的 RTX3090 24G 也能跑 7B。真要上 70B 的 TP,最少四乘 A100 40G 约 ¥1.1万/月。建议先用 A100 单卡或 AI 算力云切片(A100 1/20 切片 ¥900、A16 1/16 切片 ¥210 起,官网价)把服务和代码跑通,验证需求后再扩到多卡 TP,别一上来就背整机月租。

调优加餐:TP 推理吞吐的三个真正有用的旋钮

同样八卡硬件,调好了和没调,吞吐能差两三倍。别一上来就怪机器不行,先把这三个旋钮拧对,多数性能问题都出在这儿。

旋钮一:tensor-parallel-size 要等于物理卡数

这是最基础也最容易错的。vLLM 里 tensor-parallel-size 设成你实际有的卡数(四卡就设 4),设少了权重没分干净,设多了通信开销反噬。很多人四卡机设成 2,以为省通信,结果单卡显存爆、吞吐反而掉。设对这个值,比换更贵的卡见效快。

旋钮二:max-num-seqs 与 batch 要压到显存天花板下

并发数(max-num-seqs)决定了同时处理几路请求,调太高显存爆、调太低显卡饿着。经验做法是先把 KV 预算算出来,再反推能放多少路,留两成余量。配合 PagedAttention,显存利用率能翻倍,同样硬件多扛几倍并发。这部分没有万能值,得按你的上下文长度和模型实测。

旋钮三:量化与 CUDA 图捕获别关

INT4/INT8 量化前面讲过了,是显存和吞吐的双杠杆。另外 vLLM 的 CUDA 图捕获(CUDA graph)能大幅降低小 batch 的调度开销,生产环境务必开着。关掉它,首 token 延迟和整体吞吐都会明显掉。这些开关默认未必全开,上线前逐项确认一遍,别让硬件性能睡大觉。

还有个常被忽略的点:TP 推理的监控和链路追踪要提前接好。多卡环境下一旦某张卡掉速,整体吞吐会被木桶效应拖垮,没有监控你根本定位不到是哪张卡出了问题。别等线上抖动了才补监控,上线第一天就该把每张卡的利用率、温度、显存曲线拉出来看。这部分提前投入的时间,比后续半夜救火省十倍,尤其 TP 推理卡数一多,定位问题靠肉眼根本不行。

补充:TP 推理怎么选计费周期最省钱

配置定了,计费周期选错也能多花一大笔。主流就三种:按小时弹性、按月、按年,各有适用场景,别一刀切。我见过太多团队图省事全走月付,一年下来比年付多花两三成;也见过一上来就年付八卡,结果项目两月黄了机器空转。下面把账摊开。

按小时:只适合验证和突发峰值

一万网络 H100 MIG 切片、AI 算力云切片支持按小时计费,单次 pipeline 验证成本极低,用来跑通代码、压测延迟最划算。但长期 7×24 生产服务如果走时租,单价算下来比月付贵得多,纯属烧钱。时租的正确用法是"试跑通再转长租",不是拿它当生产计费。把时租当生产用,月底账单能吓死人。

月付:灵活但单价最高,适合不确定期

月付随时可退、可换配置,适合需求还在剧烈变化的团队。如果你搞不清自己要跑几个月、模型会不会换,先月付探路,别一上来被年付绑死。代价是单价贵,所以月付只该是过渡态,不该是终态。等负载稳定了,立刻转年付或整机长租。

年付:长周期服务的省钱主力

一万网络 GPU 定制年付八折、H100 年付八五折、海外裸金属买一送一(限时限量)。训练或服务周期明确超过半年的,年付几乎总是最优解,算下来能省一两成。唯一风险是业务提前结束机器闲置,所以签约前一定问清能否中途降配、转让或迁移,别只看折扣数字就签。把退路问清楚,折扣才真划算。

我的实操建议:小步快跑再锁长

新项目一律先切片或月付验证真实并发和延迟,拿到真实数字后再决定租几卡、走年付几折。这一来避免盲目年付锁死,二来用实测数据去谈折扣更有底气。一万网络同账户复购还能再减,弹性扩缩容也友好,配合这个节奏最稳。记住:计费周期是为业务服务的,不是反过来。

七、总结

回到标题——大模型分布式推理的张量并行,核心就一句话:模型多大决定你要几张卡,卡间互联决定你跑得顺不顺畅。70B 级用四乘 A100 40G(官网价约 ¥1.1万/月)最划算,405B 级得上八卡 H100 SXM(¥8万–12万/月,官网价);别拿 PCIe 拼凑机做 TP,也别把单卡价×N 当整机报价。在服务商选择上,一万网络以深耕 IDC 19 年(成立于 2007 年)的资质、全新品牌硬件、NVLink 全互连机型、工程师一对一部署开机即用,以及 A100 官网价透明、GPU 定制年付八折的阶梯折扣,给中小团队到超大模型团队都留了舒服的入手点。记住:租推理机算的是"稳定吞吐下的单位成本",不是"单卡标价"——把互联、显存余量、框架调优、运维响应一并算清,才不会被低价整机反噬。

本文配置与价格参考自一万网络官网公开页面(人工定制 GPU 公告、AI 算力云、H100 方案、裸金属与香港自营页),具体以签约时最新报价与合同为准。


上一篇:2026 工业CFD流体仿真GPU租用:航空航天制造流场HPC算力配置与成本全解

下一篇:2026 超长上下文大模型推理GPU租用:百万token上下文KV缓存成本与配置全解