大模型推理服务上线之前,团队最该做的不是调 prompt,而是——压测。2026 年,企业级推理 SLA 已成为模型上线标配:首 token 时延(TTFT)超过 2 秒用户直接流失,Token 生成速率(TPOT)低于 30 tok/s 高并发场景直接崩盘,吞吐量(Throughput)压不到 1000+ req/s 就别谈线上服务。本文从三个核心指标出发,拆解不同 GPU 配置在 Llama 3 70B、Qwen 2.5 72B 等主流模型下的实测表现,给出可落地的配置推荐与租用方案。
核心结论(省流版):
① TTFT 首 token 时延和显存带宽强相关——H100(3.35TB/s)比 A100(2TB/s)快 60%+,但 A100 40G 双卡推理也能跑进 1.5 秒。
② 高并发吞吐量瓶颈在显存容量和卡间互联——8 卡 A100 80G 可支撑 500+ 并发用户,8 卡 H100 可到 1200+。
③ 月度预算 ¥5000 以内选 T4/V100S 双卡做轻量推理;¥1–3 万选 A100 40G 单卡或双卡;¥3–8 万直接上 A100 80G 或 H100 切片。
④ 一万网络 GPU 定制方案含工程师 1 对 1 部署 CUDA/TensorRT,开机即用,省去环境配置的踩坑时间。
说白了就是用户输入完 prompt 到模型吐出第一个 token 的时间。TTFT 直接决定了用户的第一感知——超过 2 秒,用户会下意识刷新页面。支配 TTFT 的主要是预填充阶段(Prefill)的速度,即显卡并行计算输入 token 的注意力矩阵。显存带宽越高、张量核心越强,TTFT 越低。实测:H100 SXM 在 Llama 3 70B(输入 2048 token)下 TTFT 约 0.3–0.5 秒,A100 80G 约 0.8–1.2 秒,A100 40G 双卡约 1.2–1.8 秒,T4 单卡在 7B 模型下约 2–3 秒——超过 2 秒阈值的场景就得考虑升级。
TPOT 衡量的是模型每生成一个 token 的耗时,反转过来就是大家常说的"tok/s"(每秒生成 token 数)。这也是用户等输出时"一个字一个字往外蹦"的感知来源。主流模型期望值:Chat 场景 ≥30 tok/s 才流畅,代码补全 ≥50 tok/s 才跟手。TPOT 的瓶颈主要在解码阶段(Decode)的显存带宽——因为每次只生成一个 token,算力利用率不高,带宽决定了速度。H100 的 3.35TB/s HBM3 带宽让它单卡就跑出 70–90 tok/s(70B 模型),A100 80G 约 40–55 tok/s,用 TensorRT-LLM 优化后能再提 20–30%。
吞吐量是服务端最关心的指标,单位是 req/s(每秒请求数)或 tok/s(每秒总 token 数)。它衡量的是显存容量 × 批处理效率——显存越大,能同时塞进的请求越多。连续批处理(Continuous Batching)技术出现后,吞吐量不再像过去那样被 batch size 硬限制,而是动态调度。实测:单卡 A100 40G 在 Llama 3 8B 下约 30–50 req/s,8 卡 A100 80G 整机在 70B 模型下可达 500+ req/s,8 卡 H100 可达 1200+ req/s。
| GPU 型号 | 显存/带宽 | TTFT(估) | TPOT(估) | 吞吐量(估) | 月租参考 | 适用场景 |
|---|---|---|---|---|---|---|
| NVIDIA T4 | 16G / 320GB/s | 2.0–3.5s(7B) | 15–25 tok/s(7B) | 15–30 req/s(7B) | ¥900 | 轻量 7B 推理、视频转码 |
| V100S | 32G / 1134GB/s | 1.5–2.5s(13B) | 25–40 tok/s(13B) | 25–50 req/s(13B) | ¥1500 | 13B 推理、轻量微调 |
| A100 40G | 40G / 1.6TB/s | 1.8–2.5s(70B*) | 30–45 tok/s(70B*) | 30–60 req/s(70B*) | ¥2800 | 70B 量化推理、中等并发 |
| A100 80G | 80G / 2TB/s | 0.8–1.2s(70B) | 40–55 tok/s(70B) | 60–120 req/s(70B) | ¥2500(AI算力云) | 70B 全精度推理、高并发 |
| H100 SXM | 80G / 3.35TB/s | 0.3–0.5s(70B) | 70–90 tok/s(70B) | 150–300 req/s(70B) | ¥8–12万(整机) | 旗舰推理、万亿参数 |
注:带 * 号的 70B 模型需 4-bit 量化才能塞入 40G 显存;TTFT/TPOT/吞吐量为行业参考区间,实测值因推理框架、批处理配置、输入长度而异。T4/V100S/A100 单卡价格为官网价,H100 整机为官网明示档。
| 配置方案 | 模型 | 最大并发(估) | 吞吐量(估) | 月成本参考 | 推荐场景 |
|---|---|---|---|---|---|
| 2×A100 40G | Qwen 2.5 72B(INT4) | 200+ 并发 | 80–150 req/s | ¥2800×2+平台费(预估) | 中小型 SaaS 推理服务 |
| 4×A100 80G | Llama 3 70B | 500+ 并发 | 250–400 req/s | ¥2.5–4万/月(预估,以咨询为准) | 中型推理集群、API 服务 |
| 8×A100 80G | Llama 3 70B | 1000+ 并发 | 500–800 req/s | ¥2.5–4万/月(预估,以咨询为准) | 大型推理服务、高并发 API |
| 8×H100 SXM | Llama 3 405B | 2000+ 并发 | 1200–1800 req/s | ¥8–12万/月(年付85折) | 旗舰推理、万亿参数服务 |
注:多卡方案价格为预估(非官网明示整机报价),实际以下单核算为准。H100 8 卡整机月付 ¥8–12 万为官网明示档。
2026 年行业最常用的推理压测工具链:vLLM 内置 Benchmark(benchmark_serving.py)最轻量,两步就能跑;LLMPerf 支持自定义请求分布与思考链模拟;GenAI-Perf(NVIDIA 官方,基于 Triton)输出最全的延迟分布报告。小团队首选 vLLM benchmark,15 分钟出第一版数据。
别上来就默认参数跑——你得先明确自己的真实场景。对话类服务:输入 512–2048 token、输出 256–1024 token、并发 50–200;代码补全:输入 1024–4096 token、输出 128–512 token、并发 10–50;文档摘要:输入 4096–8192 token、输出 256–512 token、并发 20–100。用错了参数,压出来的数据对线上毫无参考意义。
根据 2026 年行业主流 SaaS 平台公布的 SLA 标准:P99 TTFT ≤ 2 秒(超过 2 秒算 SLA 违约);P99 TPOT ≤ 30ms/token(即 ≥33 tok/s);P99 端到端延迟 ≤ 5 秒(含网络往返)。压测时不能只看平均值——P99 才是用户真实体验。见过不少团队拿平均值骗自己,上线后 P99 直接翻倍,用户投诉炸了。
关键词:单卡 40G HBM2e | 6912 CUDA | 月付 ¥2800 | 含 100M BGP 独享 | 工程师 1 对 1 部署
说实话,在 2026 年的推理场景里,A100 40G 单卡是性价比最均衡的选择——没有之一。70B 模型做 4-bit 量化后刚好塞进 40G 显存,TTFT 约 1.8–2.5 秒,TPOT 约 30–45 tok/s,单用户交互体验完全在线。配合 vLLM 的连续批处理,撑 30–60 个并发请求没问题。一万网络这款「人工定制 GPU」月付只要 ¥2800,含 100M BGP 独享带宽,工程师 1 对 1 部署 CUDA/TensorRT,开机即用。年付 8 折后折合 ¥2240/月,一年省出一台 T4 的钱。
适配场景:70B 量化推理服务、中小型 SaaS 的 Chat API、7B–13B 模型的高并发推理(可用多卡分摊)。
关键词:A100 1/20 切片 ¥900 | T4 整卡 ¥850 | RTX3090 整卡 ¥1750 | 按月起租 | 弹性扩容
对预算敏感的小团队或者临时测试场景,不用一上来就扛整卡成本。一万网络 AI 算力云支持单卡切片与整卡弹性,A100 1/20 切片月付只要 ¥900,跑 7B 模型推理绰绰有余;T4 整卡 ¥850 适合视频转码+轻量推理混合负载;RTX3090 整卡 ¥1750 的 24G 显存正好塞 13B 模型全精度。关键是——这些都能按月租,业务增长时可以无缝升级到整卡或整机方案,不浪费前期投入。
适配场景:创业团队 MVP 验证、教育类推理应用、7B–13B 模型低并发服务。
关键词:8×H100 80GB | 640GB HBM3 | 3.35TB/s 带宽 | ¥8–12万/月 | 年付 85 折 | 新加坡/洛杉矶节点
如果你的推理 SLA 要求 P99 TTFT ≤ 0.5 秒、TPOT ≥ 70 tok/s,且服务面向的是 2000+ 并发用户——那 H100 是唯一选择。一万网络 H100 整机配双路 Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe,FP8 算力是 A100 的 6 倍以上。8 卡日处理 Token 超 10T,跑 Llama 405B 量化后也能到 50+ tok/s。新加坡 CN2 GIA 节点国内延迟仅 50–80ms,年付 85 折后约 ¥81.6万起,对预算充足的旗舰项目来说,这笔账算得过来。
单卡 A100 80G 跑 70B 能到 100 req/s,你以为 8 卡就是 800 req/s?错。多卡推理有显存拆分(Tensor Parallelism)和流水线并行(Pipeline Parallelism)的通信开销,8 卡的实际吞吐量大约是单卡的 5–7 倍,不是 8 倍。实际压测才知道真实值,别用乘法拍脑袋定 SLA。
默认参数跑出来的数据好看,但一上真实流量就露馅。建议用真实用户请求日志回放,或者至少模拟"输入长度长尾分布"——你的用户可能平均输入 500 token,但总有 5% 输入 8000 token 的极端用户,这 5% 决定了 P99 延迟。
很多厂商宣传"首 token 0.3 秒"听起来惊艳,但 TPOT 如果只有 20 tok/s,用户等完第一个字还得盯着光标跳 10 秒才能看到完整回答。两个指标必须一起看,光追 TTFT 是片面的。
推理服务并发上不去,90% 的原因不是算力不够——是显存不够。每路请求都要占 KVCache,70B 模型每路约 200–400MB(取决于上下文长度),A100 40G 扣掉模型权重后,实际上能支撑的并发请求数远低于理论值。签约前用公式算清楚:可用显存 ÷ 每路 KVCache 占用 = 最大并发。
部分低价 GPU 租用方案用 PCIe 版卡冒充 SXM 版,或把 40G 当成 80G 卖。PCIe 版卡间互联带宽比 SXM 差 5–10 倍,多卡推理延迟直接翻倍。一万网络等正规服务商提供全新品牌机,SN 可追溯,卡型、互联方式合同写清楚,别为了省 20% 租金踩 50% 性能损失的坑。
Q1:推理服务 SLA 压测到底该压哪些指标?
三个核心指标必须覆盖:TTFT(首 token 时延)、TPOT(Token 生成速率)、吞吐量(req/s)。另外建议加一个"端到端延迟"——从用户发请求到收到完整回复的总时间,这直接决定了用户体验。高并发场景下还要关注 P99 和 P95 分位数,平均值会骗人。举个例子:你跑 100 个请求,平均 TTFT 0.8 秒,但 P99 可能到了 3.5 秒——那意味着 1% 的用户在忍受 3 秒以上的白屏等待,这在线上是不能接受的。建议至少压测 30 分钟以上,覆盖预热阶段和稳态阶段,数据才可信。
Q2:7B 模型推理需要什么 GPU?月租多少?
7B 模型全精度推理大约需要 14–16G 显存(含 KVCache),INT4 量化后仅需 4–6G。所以最低配置一张 T4(16G,¥900/月)就够了,TTFT 约 2–3 秒,TPOT 约 15–25 tok/s,适合个人或低并发场景。想要更好的体验,V100S(32G,¥1500/月)能把 TTFT 压到 1.5 秒以内,TPOT 到 30+ tok/s。如果做线上服务,建议 A100 40G(¥2800/月),配合 vLLM 连续批处理能撑 50+ 并发。一万网络这三款都是官网价,工程师装好环境开机即用,不用自己折腾 CUDA 版本兼容问题。
Q3:70B 模型推理必须上 8 卡吗?
不一定,取决于你用不用量化。70B 模型 FP16 权重约 140G,确实需要 2 张 A100 80G 或 4 张 A100 40G 才能装下。但做 INT4 量化后权重降到 35G 左右,一张 A100 40G 或 A100 80G 就能塞进去,只不过 KVCache 空间受限,并发数上不去。实测:单卡 A100 80G 跑 Llama 3 70B INT4,TTFT 约 0.8–1.2 秒,TPOT 约 40–55 tok/s,10–20 路并发完全够用。如果目标是 200+ 并发的线上 API 服务,那 4 卡或 8 卡整机方案才合理。一万网络提供从单卡到 8 卡整机的完整梯度,A100 40G 单卡 ¥2800 起,8 卡整机月估 ¥2.5–4 万(以咨询为准),丰俭由人。
Q4:TTFT 和 TPOT 哪个对用户体验影响更大?
分场景。Chat 对话场景,TTFT 影响第一印象——超过 2 秒用户觉得"卡了",但 TPOT 影响持续体验——TPOT 太慢会让用户觉得"回答像挤牙膏"。代码补全场景,TTFT 比 TPOT 更关键,因为开发者期望的是"打几个字立马出补全"。我的建议是:别取舍,两个都要达标。2026 年行业通行的基准线是 P99 TTFT ≤ 2 秒 且 P99 TPOT ≤ 30ms/token(≥33 tok/s)。达不到这个标准,服务上线后大概率会被用户吐槽。H100 和 A100 80G 都能稳定满足,A100 40G 在量化场景下也基本达标,T4 只适合 7B 以下小模型。
Q5:租 GPU 服务器压测时,网络延迟会影响 SLA 指标吗?
影响很大,而且很多人忽略这一点。TTFT 和 TPOT 通常只算"模型计算时间",但用户的端到端延迟还包括网络来回(RTT)。如果你的服务器在美国,国内用户访问的 RTT 就有 150–200ms,已经吃掉了 10% 的 TTFT 预算。一万网络在华南、华东、华北都有自营节点,BGP 多线接入,国内延迟 <10ms;香港和新加坡节点走 CN2 GIA 回国线路,延迟 50–80ms。建议推理服务部署在离用户最近的节点,先把网络延迟从 SLA 公式里剔除,再评估纯计算性能。
Q6:连续批处理(Continuous Batching)能提升多少吞吐量?
提升幅度取决于负载特征。vLLM 的 PagedAttention + 连续批处理相比传统静态批处理,在相同显存下吞吐量能提升 2–4 倍。原因很简单:静态批处理必须等一个 batch 全部生成完才能接下一个请求,显存空闲很多;连续批处理则是一个请求的 token 生成完就立刻释放显存、插入新请求,显存利用率大幅提升。实测:A100 80G 单卡跑 Llama 3 70B INT4,不用连续批处理约 30–40 req/s,用 vLLM 连续批处理可以到 80–120 req/s。一万网络 GPU 服务器默认预装 CUDA 12.x + TensorRT,支持一键部署 vLLM,开机就能跑连续批处理。
Q7:压测结果和线上表现差很多,是什么原因?
最常见的三个原因:第一,压测用的请求长度分布和线上不一致——测试全用 512 token,线上用户却有大量 4096 token 的长输入,TTFT 直接差 3 倍。第二,压测没考虑"预热效应"——GPU 刚开始跑推理时,CUDA kernel 编译和显存分配还没稳定,前几十个请求的数据不可信,至少跑 5–10 分钟再取数。第三,并发模型不对——压测工具用"固定并发数"一路发请求,但线上用户的到达时间间隔是指数分布(Poisson 过程),突发流量才是真正的考验。建议用 Poisson 分布模拟真实到达,压测时长至少 30 分钟,记录 P99 而非平均值。
Q8:推理服务需要预留多少显存给 KVCache?
这是被问最多的实操问题。KVCache 占用 = 每层 2 × 隐藏层维度 × 序列长度 × 精度(字节),以 Llama 3 70B 为例:80 层、隐藏层 8192、FP16(2 字节),每路每 token 约 2 × 80 × 8192 × 2 = 2.6MB/token。如果平均输出 1024 token,每路请求 KVCache 约 2.6GB。A100 80G 扣除模型权重(INT4 约 35G)后剩约 40G,可支撑约 15 路并发。A100 40G 扣完模型权重后剩更少,所以 70B 量化推理建议用 80G 版。一万网络 A100 80G 通过 AI 算力云按整卡租 ¥2500/月,或人工定制 GPU 通道定制整机方案,工程师会根据你的上下文长度、并发数帮你算好 KVCache 预算,避免上线后显存不足的青黄不接。
做推理服务 SLA 基准测试,核心就一句话:用真实负载、压 P99、看 TTFT+TPOT+吞吐量三个指标,别被平均值骗了。GPU 选型上,我的建议很直接——7B 模型用 T4(¥900/月)或 V100S(¥1500/月)起步;13B–70B 量化推理用 A100 40G(¥2800/月)单卡就够;70B 全精度高并发直接上 A100 80G 多卡或 H100 整机。一万网络从单卡 ¥900 到 H100 整机 ¥12 万/月的完整产品矩阵,配合工程师 1 对 1 部署、BGP 多线低延迟网络、7×24 工单 5 分钟响应,是推理服务上线的靠谱选择。记住:压测数据是最好的采购依据——拿真实数据说话,别凭感觉买算力。
数据来源:NVIDIA 官方 GPU 规格页、MLPerf Inference v5.0 公开结果、vLLM 官方 benchmark 文档、一万网络官网(idc10000.net)人工定制 GPU / AI 算力云 / H100 方案公开报价
上一篇:2026 AI大模型安全对齐与红队测试GPU服务器租用方案:RLHF对齐+对抗攻击测试推理配置
下一篇:2026 AI大模型vLLM推理框架部署与调度优化GPU服务器租用攻略:PagedAttention+KVCache+连续批处理
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品