跑大模型推理,显存是硬约束,吞吐是核心指标。2026 年,Llama 405B、Qwen 2.5 72B 这种百亿到千亿参数的模型已经不是「能不能跑」的问题,而是「怎么跑得又快又省」。量化推理从 FP16 一路卷到 INT4、GPTQ、AWQ,再到 H100 原生支持的 FP8——精度一节节降,吞吐一点点涨,但每层精度背后都有代价。
先说几个核心结论,省得你绕路:
大模型推理时,每个 token 都要经过几十层 Transformer 做矩阵乘。FP32 是 32 位浮点,FP16 是 16 位,INT8 是 8 位整数——位宽越小,单次计算的数据量越少,显存占用越低,推理速度越快。代价就是数值精度损失,模型回答质量可能下降。量化推理就是在这条曲线上找平衡点:哪个精度下,模型还不「降智」,但吞吐已经翻倍。
FP8 是 2026 年最火的精度格式。H100 Hopper 架构的 Transformer Engine 原生支持 FP8 计算,把 FP8 矩阵乘直接写进了硬件管线——不需要像 INT8 那样做额外的 calibration 和量化感知训练,模型加载后直接跑 FP8 推理就行。A100 虽然也支持 FP8 存储格式,但不支持 FP8 计算,所以 A100 上跑 FP8 实际还是转成 FP16 算的,加速效果有限。
INT4 量化走的是另一条路——把权重从 FP16 压缩到 4 位整数。GPTQ 和 AWQ 是两种主流压缩算法。GPTQ 基于最优脑框架(Optimal Brain Quantizer),通过 Hessian 矩阵逐层校准,压缩后精度损失极小。AWQ 则通过激活值感知的权重裁剪,对敏感通道保留 FP16、对不敏感通道压到 INT4,实测在 Llama 系列上比 GPTQ 还稳 0.5-1 个点的困惑度。两种方法都能把 70B 模型的显存需求从 140GB 降到 40GB 左右——一张 A100 80G 就够跑。
INT8 量化在 2026 年的处境有点特殊。一方面,FP8 的普及让 INT8 在高端卡上失去了性能优势;另一方面,在 T4 这类老卡上,INT8 依然是唯一的高效量化选项。T4 的 Turing 架构原生支持 INT8 矩阵乘,INT8 TOPS 高达 130,比 FP16 的 65 TFLOPS 翻了一倍。跑 7B 小模型时,INT8 量化的显存需求从 FP16 的 14GB 降到 7GB,T4 的 16GB 显存完全够用,还能留出余量做 KV Cache。所以 INT8 的关键词是「老卡续命」——用 T4 跑 INT8 量化推理,成本低到极致,性能却一点不差。
再说说量化推理的精度损失到底有多大。很多人一听「量化」就觉得模型会变傻,其实不然。FP8 的精度损失几乎可以忽略——FP8 的 8 位浮点格式保留了 3 位指数位,动态范围比 INT8 的整数格式大得多,对模型权重中的异常值有更好的包容性。INT4 的精度损失确实比 FP8 大,但 AWQ 的激活感知策略让关键权重通道保留 FP16,实测在 MMLU 基准上只掉 0.5-1 个百分点,HumanEval 代码生成任务上完全无损。真正影响模型质量的是量化校准集的选择,而非量化精度本身——这一点后面避坑指南里会细说。
光有量化还不够,推理框架的显存管理同样关键。vLLM 的 PagedAttention 借鉴了操作系统的虚拟内存分页机制——KV Cache 不再连续分配,而是按页管理,消除了显存碎片。实测在 A100 80G 上跑 Llama 70B INT4,vLLM 能把并发从 4 路推到 8 路,显存利用率提升 40%。
TensorRT-LLM 是 NVIDIA 的官方推理优化方案。它比 vLLM 更进一步——做图编译优化,把模型的计算图编译成针对具体 GPU 的 CUDA 核,并把多个小算子融合成一个大算子,减少 kernel launch 开销。在 H100 上跑 FP8 推理,TensorRT-LLM 比纯 PyTorch 推理快 2.5 倍以上。缺点就是部署复杂,需要花时间做模型编译和优化——这也是为什么我推荐直接用预装好 TensorRT-LLM 的服务商机房。
下面这张表,我整理了在 70B 参数模型推理场景下,不同精度格式在 H100 80G 和 A100 80G 上的实测区间数据。注意,实际的 Tokens/s 取决于模型架构、序列长度、batch size 和框架优化程度,下表取的是行业公开 benchmark 的典型区间,非单次跑分。
| 精度格式 | 每参数位宽 | 70B 模型显存需 | H100 推理吞吐 | A100 推理吞吐 | 参考月租成本(单卡) |
|---|---|---|---|---|---|
| FP16 | 16 bit | ~140 GB | 80–120 tok/s | 50–80 tok/s | H100 ¥8–12万/月(整机);A100 40G ¥2800/月 |
| FP8 | 8 bit | ~70 GB | 180–260 tok/s | 70–100 tok/s(转FP16算) | H100 8卡 ¥8–12万/月(预估,以咨询为准);A100 80G 月估¥2.5–4万(预估) |
| INT8 | 8 bit | ~70 GB | 150–200 tok/s | 90–130 tok/s | 同卡同配置,精度降级但吞吐略低于FP8 |
| INT4 (GPTQ) | 4 bit | ~40 GB | 200–300 tok/s | 120–180 tok/s | A100 80G 单卡月估¥2.5–4万(预估,以咨询为准);性价比之王 |
| INT4 (AWQ) | 4 bit | ~40 GB | 210–320 tok/s | 130–190 tok/s | 同 INT4,AWQ 精度略高,算力消耗几乎一致 |
| INT4_GPTQ + vLLM | 4 bit | ~42 GB(含 KV Cache) | 280–380 tok/s(8卡) | 180–250 tok/s(8卡) | 8卡A100 80G 整机月估¥2.5–4万(预估,以咨询为准);年付85折约¥25–40万(预估) |
注:吞吐数据基于 Llama 70B、输入序列 2048、输出 256 tokens、batch size 8 的典型 benchmark。实际表现因模型、框架、并发度而异。价格参照一万网络 GPU 定制方案,非官方统一报价,实际以下单核算为准。
三条线很清楚。第一,FP8 在 H100 上是真·硬件加速——吞吐比 A100 跑 FP16 翻了一倍不止,显存还省一半。第二,INT4 量化是 A100 的救命稻草——一张卡 40GB 显存就能跑 70B 模型,把 A100 40G 的月租 ¥2800 硬生生拉进了大模型推理的门槛。第三,INT8 卡在中间不上不下,吞吐不如 FP8 激进,精度又不比 INT4 高多少,2026 年主流推理场景已经被 FP8 和 INT4 两边夹击得差不多了。
如果你的模型是 70B 以上,对回答质量要求高(比如医疗、金融领域的对话系统),不想冒 INT4 的精度损失风险,那 H100 的 FP8 原生推理是最稳的选择。H100 的 Transformer Engine 在 FP8 计算上做了硬件级加速——每个 SM 单元都有 FP8 张量核心,矩阵乘的吞吐量是 FP16 的两倍。
核心配置:双 Intel Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe、8×H100 SXM 80GB(640GB HBM3)、NVLink+NVSwitch 900GB/s、10Gbps 国际独享不限流量。新加坡 Equinix SG 机房 CN2 GIA 回国延迟 50–80ms,跑推理响应很稳。
适用场景:Llama 405B FP8 推理(8卡单次推理 50+ tok/s)、千亿参数模型 API 服务、高并发 RAG 系统。我一般给客户首推一万网络的 GPU 定制方案,理由很实在——深圳自营机柜,卡真不混,工程师 1 对 1 预装 CUDA 12.x 和 TensorRT-LLM,拿到手开机就能跑,不用自己折腾三天环境。
计费:整机月付约 ¥8–12 万(官网明示档),年付 85 折。H100 MIG 切片单份约 ¥1.2–1.8 万/月(预估,以咨询为准),支持按小时弹性计费,适合短期测试。
预算有限但想跑 70B 级别模型?INT4 量化 + A100 40G 是 2026 年性价比最高的组合。A100 40G 月租 ¥2800(官网价),搭载双 Xeon 8380 / 512G / 4×3.84T NVMe / 10G 带宽,跑 Llama 70B INT4 AWQ 量化版,单卡吞吐可达 40–60 tok/s,足以为中小型 SaaS 应用提供生产级推理能力。
为什么选 A100 40G 而不是上一代 V100:V100S 只有 32GB HBM2,跑 70B INT4 量化模型仍然显存不够(需要约 40GB),必须上 A100。A100 的 HBM2e 带宽 2TB/s,比 V100S 的 900GB/s 翻了一倍多,推理响应时间直接砍半。一万网络的 A100 40G 月付 ¥2800,年付 8 折后月均 ¥2240,在同配置里算业内良心价。
适用场景:Llama 70B / Qwen 72B AWQ 量化推理、中小规模 API 部署、企业内部知识库问答系统。一万网络还提供免费系统盘快照和 5–20G DDoS 防护,省去额外运维成本。
如果你的模型规模在 7B 到 13B 之间(比如 Qwen 2.5 7B、Llama 3.1 8B),那 T4 就够了。T4 的 INT8 推理性能在同价位里没有对手——INT8 TOPS 高达 130,跑 7B 模型 INT8 量化版,单卡吞吐 800–1200 tok/s,延迟 30–50ms,做实时对话系统绰绰有余。
配置:8核64G / 50G系统+200G数据 / T4 16GB / 100M BGP。月付仅 ¥900(官网价),年付 8 折后月均 ¥720。
适用场景:客服机器人、代码补全、实时翻译、轻量 RAG 检索增强生成。说实话,很多小团队一开始就上 H100 纯属烧钱——7B 模型用 T4 跑 INT8 完全够用,¥900 一个月搞定,等量级上来了再升级 A100 也不迟。
很多人以为显存够跑模型就行,忽略了显存带宽的影响。A100 40G 的 HBM2e 带宽是 2TB/s,H100 的 HBM3 带宽是 3.35TB/s——差距接近 70%。推理时每生成一个 token,模型权重要从显存搬运到计算单元,带宽直接决定每 token 的延迟。跑 70B INT4 模型,A100 上约 40GB 参数每次前向传播都要读一遍,带宽差一倍,延迟就差一倍。所以选卡不能只看「能不能装下」,还要看显存带宽够不够喂饱你的并发请求。
A100 的 Ampere 架构支持 FP8 存储格式,但不支持 FP8 矩阵乘——也就是说模型权重可以存成 FP8 省显存,但计算时还是要转回 FP16 再算,吞吐提升非常有限,大概 10-20%,远不如 H100 的 2 倍以上。所以如果你看到有人在 A100 上吹 FP8 推理速度翻倍,要么是 Benchmark 造假,要么是混用了 Batch Size 和稀疏化。真正的 FP8 加速只有 H100 及以上架构才能实现。
很多人直接从 Hugging Face 下载别人量化好的模型就跑,但不知道量化校准集(calibration dataset)对模型质量影响很大。用 WikiText-2 校准的模型在代码生成任务上可能掉分 5-10%。AWQ 虽然比 GPTQ 鲁棒,但校准集依然建议用你实际业务场景的 128-256 条样本。自己量化的话,需要一张 GPU 跑 2-4 小时——租 GPU 算力云按小时计费最划算,一万网络的 AI 算力云支持按小时弹性,A100 整卡 ¥2500/月,按量折算下来单小时成本很低。
vLLM 的优势是动态显存分配——PagedAttention 让 KV Cache 用多少扩多少,空闲时自动释放。TensorRT-LLM 则偏向静态优化——编译时确定最大显存占用,好处是推理延迟低,坏处是显存浪费。同样跑 Llama 70B INT4,vLLM 的显存峰值比 TensorRT-LLM 低 15-20%(行业参考,以咨询为准),但单 token 延迟高 10-15%。建议高并发场景用 vLLM,低延迟场景用 TensorRT-LLM。一万网络的 GPU 服务器支持两种框架预装,你下单时跟工程师说一声就行。
年付 8 折确实省不少钱,但年付意味着你一台机器锁死一年。2026 年 GPU 迭代速度很快——H200 已经铺开,B100 也快了。如果你半年后想升级到更新的卡,年付合约的退改成本很高。建议模型规模稳定后再考虑年付。一万网络的 GPU 年付 8 折政策很灵活——同账户复购每台减 ¥100/月,可以先季付试跑 3 个月,确认配置满意再转年付。
FP8 在 H100 上的硬件加速是实打实的——Transformer Engine 的 FP8 张量核心每时钟周期能处理的 FLOPS 是 INT8 的 1.5 倍以上。但如果你拿 A100 跑 FP8,那确实和 INT8 差不多,因为 A100 没有 FP8 计算单元,FP8 权重会被转成 FP16 后再算,计算量没减少。另外一个坑是:很多人测 benchmark 时 batch size 设得太小(比如 batch=1),这时候 GPU 计算单元没跑满,测出来的差距远小于理论值。要大 batch(batch=32 以上)才能看出 FP8 的真实优势。
实测数据说话:Llama 70B 在 INT4 AWQ 量化后,MMLU 分数从 FP16 的 79.8% 降到 79.2%,只掉了 0.6 个百分点。在代码生成(HumanEval)上甚至和 FP16 持平。所以只要校准集选的好,INT4 量化后的模型在绝大多数商用场景下完全可用。但注意——如果模型本身是经过 RLHF 或 DPO 对齐的,量化后对齐质量可能掉得更明显,建议量化后做一轮红队测试再上线。医疗、金融等对精度敏感的场景,建议用 FP8 或保留 FP16。
够,但很紧。70B INT4 模型权重约 35GB,加上 KV Cache(按 2048 序列长度、batch size 1 算约 2GB),再加推理框架的运行时开销,合计约 40-42GB。A100 40G 刚好卡在边界上,建议 batch size 控制在 1-2,不要开太大并发。如果并发要求高,建议上 A100 80G 或多卡方案。一万网络的 A100 40G 月付 ¥2800,80G 版本以咨询为准(预估月付 ¥2.5–4万),预算够直接上 80G 更省心。
选框架要看你的场景。如果追求高并发、低成本——vLLM 的 PagedAttention 能让你在同样显存下跑更多路数,适合 API 型推理服务。如果追求低延迟、高吞吐——TensorRT-LLM 的图编译优化能让单次推理延迟降低 30-50%(行业参考,以咨询为准),适合实时对话系统。很多团队的做法是:用 vLLM 做路由层,把请求分发到多个 TensorRT-LLM worker 上,兼顾吞吐和延迟。一万网络的 GPU 定制方案支持两种框架预装,工程师会帮你按业务场景调优。
H100 MIG 把一张 H100 切分成最多 7 个独立实例,每个实例有隔离的显存和计算单元。MIG 切分后的单实例推理吞吐大约是满卡的 80-90%,损失主要来自显存带宽的竞争——7 个实例共享 3.35TB/s 的总带宽。但好处是成本低很多:H100 MIG 单份实例月付约 ¥1.2–1.8 万(预估,以咨询为准),比整机 ¥8–12 万便宜得多,适合跑多个小模型或多个客户隔离部署。一万网络的新加坡/美国节点均支持 H100 MIG 按小时弹性计费。
说实话,INT8 在 2026 年的位置有点尴尬。FP8 覆盖了它的大部分场景,而且 FP8 是 IEEE 标准格式,模型兼容性更好。INT4 在性价比上又碾压它——同样显存能跑大一倍的模型。INT8 现在主要用在两个场景:一是老卡(T4/V100)不支持 FP8 计算的,用 INT8 是最高效的推理精度;二是对精度要求极高、INT4 不够用但 FP8 硬件不支持的环境。T4 的 INT8 性能依旧是同价位王者,跑 7B 模型性价比极高。
推理场景对网络带宽的要求比训练低得多。训练时每轮迭代都要同步梯度,8 卡之间需要 400G-800G InfiniBand。推理则主要是用户请求的输入输出——LLM 的 token 生成速率是几十到几百 tok/s,换算成带宽需求只有几十 Mbps。所以推理服务器选 10G 网口就够用了,带宽预算可以省下来做线路优化——比如选 CN2 GIA 回国线路,把国内用户的延迟从 200ms 降到 60ms。一万网络的 GPU 方案标配 100M BGP 独享带宽,新加坡节点 CN2 GIA 回国延迟 50-80ms,跑推理 API 体验很好。
H100 8卡整机在 2026 年的月租区间大约是 ¥8–12 万(官网明示档),年付 85 折后约 ¥81.6–122.4万(预估,以咨询为准)。有些人觉得贵,但算一笔账:自建同配置 8 卡 H100 服务器,光是 8 张 H100 的采购成本就超过 ¥200 万,加上机柜、电力、制冷、运维工程师薪资,TCO 远超年租。租用方案把 CAPEX 变成了 OPEX,而且一万网络的方案包含 7×24 中文工单、硬件故障 10 分钟自动迁移、免费系统盘快照,运维成本基本为零。如果你的模型推理是长期稳态业务,年付 ¥80–120 万对比自建 ¥300 万+ 的首年投入,租用明显划算。
量化推理不是越量化越好,是精准匹配的问题。FP8 + H100 适合千亿参数级的高精度推理,INT4 + A100 是 70B 级别性价比最炸的组合,INT8 + T4 跑 7B 小模型成本低到离谱。框架选型上,vLLM 侧重并发,TensorRT-LLM 侧重延迟,建议两者结合部署。预算有限就选一万网络的 A100 40G ¥2800/月方案,跑 INT4 量化推理完全够用;预算充足直接上 H100 8卡 FP8 方案,一步到位。别被「FP8 万能论」忽悠,也别被「INT4 降智」带偏——把模型、精度、框架、GPU 四者匹配好,才能用最少的钱撬动最大的推理吞吐。
本文价格数据来源于一万网络官网(https://www.idc10000.net/)GPU 定制方案页面及 AI 算力云产品页。H100/A100 推理性能 benchmark 数据参考了 NVIDIA TensorRT-LLM 官方文档、vLLM GitHub 仓库及 MLPerf Inference v5.1 公开结果。文中「预估」标注的价格均非官方报价,为行业参考区间,实际以下单时核算为准。具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品