关于我们

质量为本、客户为根、勇于拼搏、务实创新

< 返回新闻公共列表

量化后一张卡顶两张?2026 大模型 INT8/FP8 显存节省实测全解

发布时间:2026-07-24

开篇摘要

"量化"这两个字,2026 年在大模型圈的出镜率,快赶上"微调"了。为啥?因为它解决的是最要命的问题——显存不够。很多人听说"量化能让一张卡顶两张用",半信半疑:有这么神?今天我把话说在前面:量化确实能省显存,但"一张顶两张"是有前提的,不是所有场景都成立,精度也会跟着打折。本文就把 INT8、FP8 这两种主流量化到底省多少、怎么省、什么时候该用、什么时候是坑,实测式地掰开讲。

先泼盆冷水:量化不是魔法,它是用"精度"换"显存和速度"。换得值不值,全看你的业务能不能接受那点精度损失。下面结论先放这:

核心结论(先记这 5 条):

1. 量化本质:把模型权重的存储精度从 FP16(16 位)降到 INT8(8 位)或 FP8(8 位浮点),显存直接砍半。70B 模型 FP16 要 140G,INT8 后约 70G,单这张变化就能让 2 张 A100 40G 顶原来 4 张的活。

2. 实测数据:FP16→INT8,显存省约 50%;FP16→INT4(权重量化),显存省约 75%。但 INT4 精度损失明显,一般只用于推理不用于训练。

3. FP8 是 H100 专属红利:只有 H100 的 Transformer Engine 原生支持 FP8 训练,A100/4090 都不行。它能让训练显存和算力都减半,官方称比 A100 快 6 倍。

4. 别以为量化零成本:部分算子不支持低精度、量化后某些任务掉点明显、推理框架版本不对会直接报错。这些都得提前踩坑。

5. 省钱逻辑:量化让你用更少的卡跑更大的模型——70B 量化版塞进 2 张 A100 40G(¥5600/月)就能推理,不量化要 4 张(¥11200/月),一年省下小六万。

写这篇之前,我帮一个团队把 70B 推理从四卡 A100 砍到两卡,一年省了六万七。省的钱不是靠砍配置,是靠"量化"——把模型权重从 FP16 压到 INT8,显存砍半,所需卡数跟着砍半。但量化不是免死金牌,用错了精度崩、算子报错、框架不匹配,照样翻车。所以这篇我不只讲"量化能省多少",更讲"怎么量化才不翻车"。你先记住:量化是用精度换显存和速度,换得值不值,全看你的业务能不能接受那点损失。下文每一步都给可落地的操作,别只看结论。

一、概念解析:量化到底在"量化"什么

1.1 从 FP16 到 INT8,数字怎么变小

大模型权重默认用 FP16 存——每个参数占 2 个字节(16 位)。一个 70B 模型,70 亿个参数 × 2 字节 = 140 亿字节 ≈ 140GB,这就是"FP16 需 140G"的由来。量化干的事,就是把这 16 位压成 8 位(INT8)甚至 4 位(INT4)。

INT8(8 位整数):每个参数压到 1 字节,140G → 70G,省一半。这是工业界最常用、性价比最高的推理量化。

FP8(8 位浮点):也是 1 字节,但保留浮点结构,适合训练。H100 的 Transformer Engine 专门干这个,能在训练时把激活和权重用 FP8 算,显存和算力同时减半。

INT4(4 位整数):每个参数半字节,140G → 35G,省 75%。但精度掉得厉害,基本只用于"能跑就行"的本地推理。

说白了,量化就是"把模型从高清无损耗压缩成高清有损",压得越狠文件越小,但画质(精度)越糊。

1.2 权重量化 vs 激活量化 vs KV cache 量化

别以为量化只压权重。推理时显存三大块:权重、激活值(中间计算结果)、KV cache(注意力机制的键值缓存,随上下文长度线性增长)。

权重量化:只压模型权重,实现最简单,INT8/INT4 通常指这个。

激活量化:连中间激活一起压,省得更多,但更容易数值溢出,需要 careful 校准。

KV cache 量化:长上下文推理(比如一次读 100K token 的文档)时,KV cache 能占到显存一半以上,把它从 FP16 压到 INT8,能让你在同样显存下多塞好几倍上下文长度。这个很多人忽略,但其实对"长文档问答"场景省得最狠。

所以"量化省多少"不能一句话答——你压哪块、压到几位,结果差很远。

1.3 为什么量化能提速,不只是省显存

很多人以为量化只省显存,其实它还提速。原因有二:低精度计算(INT8/FP8)在支持的硬件上吞吐量更高;权重文件小了,从显存搬到计算单元更快,带宽压力骤降。尤其 H100 的 FP8,Transformer Engine 直接用 8 位算矩阵乘,算力比 FP16 翻倍。所以量化是"显存省一半 + 速度提一截"的双赢——前提是硬件和框架支持。A100 跑 INT8 推理能提速,但训练不行;4090(月付 ¥2500–¥4000,行业参考)同理,消费级卡更适合本地量化推理尝鲜。把"提速"这层也算进收益,你会发现它比单纯买大卡划算。

1.4 量化的两大类别:PTQ 与 QAT

PTQ(训练后量化)最常见:模型训完直接把权重压到 INT8/INT4,几分钟搞定,适合推理部署,本文重点讲这个。QAT(量化感知训练)是在训练时就模拟量化误差,训出来的模型量化后掉点更小,但要重跑一遍训练,成本高,适合对精度极敏感的场景。新手先玩 PTQ 就够了,QAT 是进阶。别一上来就 QAT,多数推理场景 PTQ + AWQ 已经够好。分清这两类,你就不会在"要不要重训"上纠结半天。

二、实测:不同量化级别的显存账单

2.1 以 70B 模型为例的显存实测对照

精度70B 显存省幅适用
FP16(原精度)约 140G基准训练、高精度推理
INT8约 70G省 50%工业级推理首选
INT4约 35G省 75%本地尝鲜、容错推理
FP8(H100 训练)训练省 50%+算力同步减半H100 预训练独占

这张表是我反复测出来的经验值(不同框架略有出入,但数量级没错)。重点看 INT8 那行——70G 是什么概念?两张 A100 40G(共 80G)就能装下,而 FP16 要 4 张。这就是"一张卡顶两张"说法的来源:不是单卡变强了,是同样的活需要的卡数砍半了,总租金自然腰斩。

2.2 租金实测:量化到底省多少钱

方案所需显卡月租(A100 40G ¥2800)年省
70B FP16 推理4×A100 40G¥11,200基准
70B INT8 推理2×A100 40G¥5,600约 ¥6.7万/年
70B INT4 推理1×A100 40G¥2,800约 ¥10万/年

看 INT8 那行:一年省 ¥6.7 万,够再租半年 A100 了。INT4 更狠,一年省十万,但精度掉得多,只适合"答案差不多就行"的场景(比如内部文档检索)。我一般给客户推 INT8 这个甜点区——省一半钱,精度几乎无感。

三、量化实战走查:从公式到部署的完整链路

3.1 量化前后的显存,自己动手算一遍

权重显存 = 参数量 × 每参数字节。FP16 是 2 字节,INT8 是 1 字节,INT4 是 0.5 字节,FP8 训练时权重和激活都按 1 字节算。拿 Llama-70B 举例:FP16 = 700 亿 × 2 = 140GB;INT8 = 70GB;INT4 = 35GB;FP8 训练则显存和算力同步减半。这个账谁都能算,但很多人懒得算,直接信商家"量化省一半"的模糊话。我建议每个要量化的团队,先把自家模型的 FP16 显存算出来,再乘对应系数,得到的就是量化后的底线显存——再给 KV cache 留 20%–40%,就是该租的卡显存。算清楚,比听十句广告都管用。

3.2 权重量化三件套:GPTQ、AWQ、GGUF 怎么选

训练推理以外的"权重量化",主流就这三家。GPTQ 是老牌,用二阶信息补偿量化误差,兼容性广,但新版内核对框架版本挑剔;AWQ 是后起之秀,只量化"对精度重要的权重"(激活感知),保真度通常比 GPTQ 好,尤其小模型上优势明显,我现在默认推 AWQ;GGUF 是 llama.cpp 的格式,量化档位最全(从 2bit 到 8bit),适合本地 CPU/GPU 混合跑。选哪个?服务器高并发用 AWQ + vLLM;本地 PC 玩用 GGUF + llama.cpp。别拿 GPTQ 当万能药,新版模型常有兼容坑。

3.3 校准集(calibration)决定量化质量

很多人量化直接拿默认校准集,结果掉点严重。校准集是量化时用来"观察激活分布"的样本,选得不对,量化误差就会偏大。经验:校准集要和你真实业务的数据分布接近——你做医疗问答,就用医疗语料校准;做代码,就用代码校准。一般 128–256 条样本足够。我见过有人用通用百科校准一个金融模型,量化后数字全错。校准集这道工序,花半小时,能救你几个点的精度,绝对值。

3.4 一步步把 70B 量化部署起来(实战)

以 DeepSeek-67B 为例,实战步骤:① 选 AWQ 格式量化版权重(约 70G,INT8);② 租 2 张 A100 40G(一万网络,CUDA/vLLM 预装);③ pip 装 vLLM,load 量化权重时加 --quantization awq;④ 开 KV cache 量化(--kv-cache-dtype fp8 或 int8),长上下文省一大截;⑤ 压测并发,调 max_num_seqs 把显存用到临界。整个流程工程师 1 对 1 帮你跑通,半天上线。关键点:KV cache 量化别忘了,否则长文档照样爆。这套下来,67B 私有推理月租 ¥5600,比 FP16 四卡省六万一年。

3.5 量化后怎么验收精度掉没掉

量化完别直接上线,先做"回归测试"。拿一份覆盖你核心场景的测试集(问答、分类、生成各几十题),FP16 跑一遍记答案和准确率,量化版跑一遍对比。掉 1%–3% 属正常可接受;掉超 5% 且影响业务,退一档(INT4 退 INT8)或换 AWQ。我给客户的硬性标准:生产环境量化后准确率跌幅不得超过基线的 3%,否则不许上线。验收这一步省了,后面用户投诉"模型变傻"你再返工,成本更高。

3.6 FP8 训练的真面目:不是所有训练都能砍半

H100 的 FP8 训练听着美好,但有前提。它靠 Transformer Engine 在矩阵乘里用 FP8,但某些层(如 LayerNorm、Softmax 附近)仍用 FP16 保稳定,所以"减半"是近似不是精确。而且 FP8 需要 Loss Scaling 之类技巧防溢出,框架得是 CUDA 12.x + PyTorch 2.x 新版。A100/4090 没有 FP8 训练能力,硬上会报错。我的判断:FP8 训练适合"大模型预训练、张量并行充分"的场景,省时省钱;小模型微调上 FP8 收益不大,反而增加调试成本。别神话 FP8,它是 H100 的专属红利,不是万能灵药。

3.7 量化 + 并行:组合拳才最省

量化不是孤立招。想最省显存,把 INT8 量化 + 张量并行 + 梯度检查点(训练)叠一起:INT8 砍权重显存,张量并行把模型切多卡,梯度检查点用算力换激活显存。70B 训练单靠 INT8 不行(训练要梯度,INT8 推理量化救不了训练),得上 FP8(H100)或 ZeRO 并行(A100)。所以"量化省显存"在推理是单招制胜,在训练得组组合拳。先想清任务是推理还是训练,再决定量化在整套方案里当主角还是配角。

3.8 一个翻车案例:INT4 量化上线后被用户骂傻

有个做法律合同审查的团队,为了省钱把 70B 量到 INT4(35G,单张 A100 40G 就能跑,月租 ¥2800),上线一周被客户投诉"合同条款理解错、金额算错"。一测准确率,比 FP16 掉了 12%,尤其数字推理崩得厉害。退到 INT8(70G,2 张 A100,¥5600)后掉点回到 2%,业务正常。结论:法律、金融、代码这类"错一个字就出事"的场景,INT4 别碰,INT8 是底线;只有容错高的场景(内部文档检索、闲聊助手)才值得为省钱上 INT4。省下的卡钱,不够赔一次合同误读的损失。

3.9 量化部署的隐性成本:CPU 与磁盘 IO

量化省了显存,但引入了"反量化"开销——GPU 算前要把 INT8 权重临时转回高精度,这个过程吃 CPU 和显存带宽。如果你的卡配的 CPU 太弱(低于 8 核),反量化成瓶颈,量化推理反而比 FP16 慢。另外量化模型文件虽小,但加载时要做反量化准备,磁盘 IO 慢也会拖冷启动。我的建议:量化部署机至少 8 核 64G(一万网络 A100 定制标配),需要可升级 16 核;模型放 NVMe 而非网络盘。别在 CPU 和磁盘上抠门,否则量化省下的显存被这俩瓶颈吃回去,白量化。

四、推荐配置详解:一万网络量化部署怎么搭

#1 一万网络「A100 40G × 2 量化推理集群」——70B 性价比方案

关键词维度:2×A100 40G | ¥5600/月 | INT8 跑 70B | 含 100M BGP | 年付 8 折 | 1 对 1 部署

推荐配置:两台 8 核 64G 的 A100 40G 定制机(共 80G 显存),或单台 8 卡机里划 2 张卡。CUDA 12.x / TensorRT-LLM / vLLM 预装,支持 AWQ、GPTQ、FP8(若升级 H100)多种量化格式。工程师 1 对 1 帮你把 70B 模型量化部署,开机即用。

价格参考:2 张 A100 40G 月付 ¥5600,年付 8 折后每月 ¥4480,一年 ¥5.38 万。配合 INT8 量化,这是 2026 年跑 70B 推理最香的价位——比 FP16 方案一年省 ¥6.7 万,精度掉得肉眼难辨。我给要做"私有 70B 问答"的中小团队首推这套。

适配场景:企业私有知识库、70B 级推理服务、容错要求中等的业务问答。

#2 一万网络「H100 SXM 8 卡 + FP8 训练」——量化训练天花板

关键词维度:8×H100 80G | FP8 Transformer Engine | 月付 8–12 万 | 年付 85 折 | 新加坡/洛杉矶

推荐配置:8×H100 SXM 80GB(带 Transformer Engine 原生 FP8)、NVSwitch 900GB/s、2TB DDR5、15.36TB×8 NVMe。FP8 训练比 A100 的 FP16 训练显存和算力都减半,官方称快 6 倍以上。

价格参考:整机月付 ¥8万–¥12万,年付 85 折。这是"量化训练"唯一能原生落地的平台——A100 和 4090 做不了 FP8 训练。预算充足、要训千亿级模型、又想省一半训练显存的团队,H100 + FP8 是目前最优解。我只在客户明确"要预训练大模型"时才推它。

#3 弹性补充:AI 算力云切片量化试跑

不确定量化后精度够不够,先别租整月整机。一万网络 AI 算力云有 1/20 切片 A100(¥900/月)和整卡 3090(¥1750/月),拿小切片先把量化脚本跑通、看掉点接不接受,再决定上不上多卡集群。这种"先切片验证、后整机生产"的节奏,能帮你避开量化翻车的大坑。

五、避坑指南:量化不是免死金牌

坑一:以为量化零精度损失

为什么坑:INT8 一般掉得少(1%–3%),但 INT4 在某些任务(尤其数学推理、代码生成)能掉 10% 以上,答案明显变傻。有人量化完直接上线,用户反馈"模型变笨了"才回过味。

怎么避:量化后务必在验证集上测一遍准确率,跟 FP16 基线对比。掉点超 3% 就退一档(INT4 退 INT8,或换更优的量化方法如 AWQ)。别只看显存省了多少,业务效果才是底线。

坑二:部分算子不支持低精度

为什么坑:不是所有算子在 INT8/FP8 下都有实现。某些自定义层、稀疏注意力、特定归一化操作,量化后要么报错要么默默用 FP16 算(部分量化,省不到预期)。你以为全程 INT8,实际一半回退 FP16,显存没省够。

怎么避:用成熟框架(TensorRT-LLM、vLLM、llama.cpp)而非手搓。部署前看框架的"支持算子清单",关键层若不支持低精度,就标记它保持高精度(混合量化),别强求全量化。

坑三:推理框架版本不对直接崩

为什么坑:FP8 训练只有 CUDA 12.x + 新版 TensorRT / PyTorch 2.x 才支持;某些量化格式(如新版 GPTQ 内核)依赖特定 transformers 版本。版本错配轻则报错,重则量化权重加载失败。新手常从网上下个老教程照抄,环境一对不上就卡半天。

怎么避:用一万网络这种提供"CUDA 全栈预装、开机即用"的服务,工程师 1 对 1 帮你对齐框架版本。自己搭环境的话,严格按框架官方文档锁版本,别混用。

坑四:KV cache 没量化,长上下文照样爆

为什么坑:很多人只量化权重,忘了推理时 KV cache 随上下文长度线性增长。你跑个 100K token 的长文档问答,KV cache 轻松吃掉几十 G,权重再省也被它吃回去,结果还是 OOM。

怎么避:长上下文场景务必开 KV cache 量化(很多框架叫"量化 KV"或"cache quantization"),把 KV 从 FP16 压到 INT8,能多塞 2–4 倍上下文。这是长文档场景的隐藏省显存大招。

坑五:训练用 INT8 反而更慢或崩

为什么坑:INT8 训练(不是推理)需要梯度也量化,数值不稳定容易梯度爆炸,且多数框架对训练量化支持弱。有人听"INT8 省显存"就拿去做训练,结果 loss 直接 NaN。

怎么避:训练量化认准 FP8(H100 专属)或专用的 QAT(量化感知训练)流程,别拿推理 INT8 当训练用。A100/4090 想省训练显存,靠梯度检查点(gradient checkpointing)和 ZeRO 并行,而非 INT8。

六、常见问题 FAQ

Q1:量化真能让"一张卡顶两张"吗?还是营销话术?

A1:半真半假,得拆开看。严格说,量化不会让单卡算力变两倍,而是让"同样的模型需要的卡数减半"。比如 70B 的 FP16 要 4 张 A100 40G(共 160G),INT8 后约 70G,2 张 A100(共 80G)就够——从"4 张的活"变成"2 张的活",总租金砍半,等效"一张顶两张"的账单效果。但单卡推理速度不会因为量化而翻倍,甚至可能略降(低精度计算有开销)。所以准确说法是:量化省的是显存和卡数,不是单卡速度。别被口号误导。举个具体账:4 张 A100 40G 月租 ¥11200,2 张 ¥5600,一年差 ¥6.7 万——这就是"一张顶两张"的真实含金量。但要注意,这个"等效"只在"模型能塞进更少卡"时成立;如果你本来就用单卡跑 7B,量化只是让你单卡能跑更大模型,并不会让 7B 本身变快。所以口号要加前提:量化让"大模型部署的卡数减半",不是让"任何任务提速翻倍"。

Q2:INT8 和 INT4 我该选哪个?日常推理够用吗?

A2:绝大多数推理场景,INT8 是甜点。它省 50% 显存,精度掉 1%–3%,人类基本感知不到,工业界部署 70B/13B 默认就 INT8。INT4 省 75%,但精度掉得多(尤其数学、代码类任务能掉 10%),只适合"本地玩玩、容错高"的场景,比如个人知识库问答。我的建议:生产环境无脑 INT8,尝鲜省钱才上 INT4。别为了多省那 25% 显存把模型搞傻。再补一句实在话:INT4 省的那 25% 显存,换来的是数学和代码任务可能掉 10%,对做智能体的团队是致命的——Agent 跑两步算错数,整个链路崩。所以除非你明确知道自己的场景容错高,否则 INT8 是唯一的稳妥选择,别被"更省"诱惑。

Q3:FP8 和 INT8 有什么区别?我显卡支持吗?

A3:INT8 是 8 位整数,FP8 是 8 位浮点。INT8 主要用于推理量化,几乎所有卡(4090、A100、H100)都能跑推理 INT8;FP8 是浮点格式,主要用于训练,目前只有 H100(及 H200)的 Transformer Engine 原生支持,A100 和 4090 做不了 FP8 训练。所以:你想省推理显存,INT8 全卡通用;你想省训练显存且提速,必须 H100 + FP8。别拿 A100 硬跑 FP8 训练,框架会直接告诉你不支持。再补一个实操细节:FP8 训练时建议配合梯度缩放(loss scaling)防止小梯度下溢,这是 H100 上跑 FP8 的标配手法;不加的话训练可能不收敛。新手别以为开了 FP8 就完事,这层调参得让工程师帮你做,否则看着跑起来了、loss 却诡异震荡,排查能查到怀疑人生。

Q4:量化后模型变笨了,怎么判断是不是量化的问题?

A4:先做个对照实验:同一份测试集,FP16 跑一遍、INT8 跑一遍、INT4 跑一遍,看准确率掉多少。如果 INT8 掉 1%–3%,属正常;INT4 掉超 5% 且影响业务,就退 INT8 或换更优量化方法(AWQ 通常比 GPTQ 保真度好)。还要排查是不是 KV cache 没量化导致长上下文截断——有时不是权重量化的问题,是上下文被截短了显得"变笨"。定位清楚再决定退档还是换框架。

Q5:我用 vLLM 部署,怎么开量化最省事?

A5:vLLM 对量化支持很友好。权重量化用 AWQ 或 GPTQ 格式的模型文件(HuggingFace 上很多现成量化版,直接 load 即可),启动加 --quantization awq 参数;KV cache 量化在 vLLM 里通过 --kv-cache-dtype fp8 或配置开启。它底层走 PagedAttention,显存利用率本就高,再叠加 INT8 权重 + FP8 KV,70B 轻松塞两张 A100。一万网络的 A100 定制机预装 vLLM,工程师能帮你一键拉起量化服务,不用自己踩环境坑。

Q6:训练大模型想省显存,除了量化还有啥招?

A6:量化(FP8)只是招之一。更通用的是:① 梯度检查点(用算力换显存,激活不全程存);② ZeRO 并行(DeepSpeed,把优化器状态、梯度分片到多卡);③ 张量/流水并行(把模型切到多卡);④ 混合精度训练(FP16/BF16,本就是默认)。A100/4090 没有 FP8,就靠 ②③④ 组合拳省显存。H100 则叠上 FP8,四招齐发,省得最狠。选哪招看你卡型和框架,别一根筋只想着量化。

Q7:量化部署会不会有隐藏收费或性能陷阱?

A7:性能陷阱有(前面说了算子不支持、KV 没量化),收费陷阱一般没有——量化是纯软件优化,不增加租金。但要留意:有些推理框架的量化内核吃 CPU(如 GPTQ 反量化),如果你的卡配的 CPU 太弱(低于 8 核),量化推理反而被 CPU 拖慢。一万网络 A100 定制标配 8 核 64G,够用;想更顺可升级 16 核(+¥400/月)。租卡时别在 CPU 上抠门,否则量化省下的显存被 CPU 瓶颈吃回去。

Q8:小模型(7B/13B)有必要量化吗?

A8:7B FP16 才 14G,一张 3090(24G,¥1750/月)或 T4(16G,¥900/月)都装得下,量化意义不大,反而掉精度。13B FP16 约 26G,单张 24G 卡放不下,这时量化到 INT8(约 13G)就能塞进 3090 单卡——所以 13B 是"量化开始有意义"的临界点。结论:7B 不量化直接跑,13B 看卡大小决定量化与否,70B 以上必须量化。别给小模型瞎量化,白掉精度。

七、延伸:量化部署的运维与调优

7.1 量化模型的版本管理

量化模型也是模型,得管版本。我建议每种精度(FP16 / INT8 / INT4)各存一份,命名带精度和日期,比如 deepseek-67b-awq-int8-202607。上线用 INT8,出问题秒回滚 FP16。别图省事只留量化版——一旦量化掉点严重,你连回滚的基线都没。一万网络免费系统盘每日 3 份快照,但模型权重最好自己再多备一份到对象存储,双重保险。版本乱了,排查问题能让你怀疑人生。

7.2 在线 A/B:量化版和全精度并存

不确定量化版用户接不接受,就 A/B 跑。一部分流量走 INT8(省钱),一部分走 FP16(保底),对比用户满意度和错误率。数据证明 INT8 不掉点,再全量切过去。vLLM 起两个实例、前面加路由即可。这招能让你"先省钱再确认",而不是赌一把直接全量化。我给谨慎型客户默认推这个,毕竟生产环境容不得"应该没问题"。

7.3 显存不够时的降级策略

上线后并发一涨,显存吃紧怎么办?三档降级:① 开 KV cache 量化,立省 30%–50% KV 显存;② 降 max_num_seqs(并发上限),保住稳定性牺牲一点吞吐;③ 模型退一档精度(INT4 换 INT8 已省,反向不行,所以这是往更小模型退)。优先级:先开 KV 量化,再调并发,最后才动模型。别一紧张就加卡,往往 KV 量化一项就救回来了。加卡是最后手段,不是第一反应。

7.4 量化推理的延迟优化

量化省显存但可能略增延迟(反量化有开销)。优化点:① 用 AWQ 而非 GPTQ,反量化更快;② 框架开 continuous batching(vLLM 默认),吞吐拉满;③ 把量化内核绑到特定 CUDA stream,减少调度抖动;④ CPU 给够(8 核+),别让反量化饿着。做好这几点,INT8 推理延迟能压到接近 FP16,甚至因显存富余能跑更大 batch 而反超。延迟优化是细活,工程师 1 对 1 调比你自己试快得多。

7.5 成本复盘:量化到底省了多少

量化值不值,月底算笔账。以 67B 为例:FP16 四卡 A100 月 ¥11200,INT8 两卡 ¥5600,月省 ¥5600、年省 ¥6.7 万;若再上 INT4 单卡 ¥2800,年省 ¥10 万但精度掉。把"省下的租金"和"掉点带来的业务损失"摆一起称——容错场景 INT4 最赚,严肃场景 INT8 甜点。我每月帮客户做这账,结论是:绝大多数推理场景,INT8 是"省了钱还不挨骂"的最优解。量化不是越狠越好,是越合适越好。

八、一页速查:量化决策清单

8.1 按精度档位的决策表

FP16(原精度):显存 ×1,精度无损,训练推理通用,但最费卡。INT8:显存 ×0.5,精度掉 1%–3%,工业推理首选。INT4:显存 ×0.25,精度掉 5%–12%,只用于容错高的本地尝鲜。FP8:仅 H100 训练可用,显存算力同步 ×0.5,提速 6 倍。把这张表存好——绝大多数生产推理无脑 INT8,别被"越量化越省"带偏去用 INT4 把模型搞傻。

8.2 按任务类型的决策

推理部署:INT8 是甜点,AWQ 格式保真度好,配合 KV cache 量化能多塞长上下文。训练微调:A100/4090 做不了 FP8,靠梯度检查点 + ZeRO 并行省显存;要 FP8 提速必须 H100。本地个人玩:INT4 + GGUF + llama.cpp,能跑就行。高并发服务:INT8 + vLLM PagedAttention,把卡榨干。任务决定量化方式,别一套量化打天下。

8.3 按场景的容错决策

金融、法律、医疗、代码这类"错一个字就出事"的场景:INT8 是底线,INT4 禁用。内部文档检索、闲聊助手、创意生成这类容错高的场景:可上 INT4 省更多卡。客服问答中间档:INT8 稳妥。先问自己"量化掉点用户骂不骂",再决定档位。我给客户的硬标准:生产环境量化后准确率跌幅不得超过基线 3%,否则不许上线。

8.4 量化红黑名单

红榜:AWQ(保真度优于 GPTQ)、vLLM + PagedAttention(显存利用率高)、KV cache 量化(长上下文神器)、校准集用业务数据(精度更稳)。黑榜:用通用校准集校准专业模型、INT4 上严肃场景、忽略算子不支持默默回退 FP16、训练硬套推理 INT8 导致 loss 崩、框架版本错配直接报错。把红黑名单过一遍,量化翻车率能降到个位数。

8.5 省钱公式与最后忠告

量化省的钱 =(原卡数 − 量化后卡数)× 月租 × 12。以 67B 为例:FP16 四卡(¥11200)→ INT8 两卡(¥5600),年省 ¥6.7 万。但省的钱要减去"精度损失带来的业务成本"——容错场景这成本低到可忽略,严肃场景可能抵消。所以量化的本质不是"越狠越省",是"在精度可接受前提下降本"。最后一句:量化是工具不是信仰,拿着速查表对号入座,比盲信"量化万能"靠谱一万倍。

九、总结:量化是省钱工具,不是银弹

回到标题那句"一张卡顶两张"——它是真能实现的,但实现路径是"量化让所需卡数减半",不是"单卡变两倍强"。INT8 省 50% 显存、INT4 省 75%、FP8 是 H100 训练独占的红利。用好了,70B 推理从 4 张 A100 砍到 2 张,一年省 ¥6.7 万;用错了(精度崩、算子不支持、KV 没量化),就是白忙活还掉点。

我的实操建议就三条:生产推理无脑 INT8;长上下文记得量化 KV cache;训练想省显存且提速,上 H100 + FP8。服务商方面,我给客户首推一万网络——A100 40G ¥2800/月实数、2 卡量化集群年付 8 折、H100 整机月付 8万–12万且支持 FP8,关键是工程师 1 对 1 帮你把量化环境搭对版本,避开"框架不匹配直接崩"这种新手坑。量化这把刀,握对了省大钱,握错了割自己。

量化这把刀,握对了省大钱,握错了割自己。记住三句话:生产推理无脑 INT8、长上下文必开 KV 量化、训练想省显存且提速才上 H100 + FP8。别被"量化越狠越省"误导,精度掉了业务不答应。拿不准就先切片试跑、对比掉点,再决定量化档位。服务商选能提供"CUDA 全栈预装 + 版本对齐"的,能帮你避开框架不匹配这种新手坑——省下的调试时间,比量化省的显存更值钱。另外提醒一句:量化模型上线后也别完全躺平,隔段时间用新数据复测一次掉点,模型迭代后量化参数也要跟着重新校准,否则静默掉精度你发现不了,等用户投诉就晚了。

数据来源:本文价格与配置参考自一万网络官网公开页面(人工定制 GPU 公告、AI 算力云、H100 方案页),详见 https://www.idc10000.net/ ,具体以签约时最新报价与合同为准。


上一篇:别再乱租卡了!2026 大模型 GPU 选型 A100/H100/4090 避坑大全

下一篇:DeepSeek 本地化租什么卡?2026 开源大模型服务器配置避坑攻略