先问一句扎心的:你手里的 GPU 卡,一天真正在干活的时长有多少?我做运维这些年见过太多团队,白天让卡跑实时接口,晚上整机空转,电费一分不少交,算力一半白白浪费。2026 年这个节点,大模型推理早就不只是"在线问答"这一种玩法了——内容批量生成、文档抽卡、客服工单归档、图片批量打标、离线翻译、风控全量扫描,这类任务量大、但根本不着急出结果,天生适合"离线批量推理 + 异步任务流水线"。这篇文章就把离线批量推理和在线低延迟推理的差异、批量吞吐怎么优化、夜间闲时算力怎么吃透,以及 GPU 服务器到底怎么租划算,从头到尾讲清楚,一万网络这边能给到的方案也一并摊开。
老规矩,核心结论先放这:
可能有人会问:这些道理谁不知道?问题是知道了不等于算得清、配得对。我写这篇的出发点就是把这套东西"翻译"成人话——每种任务该配什么卡、大概多少钱、怎么优化能省一半、签约前要问哪几句,全给你摆平。你只要照着自己的任务形态对号入座,就能少走大半年的弯路。
很多人把"大模型推理"当成一个概念,这是最大的认知误区。同样是跑同一个模型,在线和离线对硬件的要求是两套逻辑,搞混了要么浪费钱、要么卡到用户骂娘。
在线推理就是用户点一下就等出结果的那种——聊天机器人、实时翻译、代码补全、客服问答。这种任务一次只处理一两句话,对延迟敏感,用户等超过两三秒就不耐烦了。它的瓶颈在单卡算力:显存要够大(塞下模型 + KV Cache),算力要够硬(一次前向推理尽量快)。所以在线推理的推荐起步就是 A100 40G,低端卡跑起来要么排队、要么首字延迟飙到秒级,体验直接崩。
离线批量推理是"攒一批活,一次性跑完"——凌晨把当天 10 万条工单统一过一遍模型、批量生成一万张营销图、把历史视频全部转写一遍。这类任务根本不在乎单条慢 0.5 秒,在乎的是"这批活在规定时间内(比如 8 小时内)跑完,总成本多少"。它的优化方向是吞吐:一张卡一次塞多少请求、能不能把算力吃满、批处理框架调得顺不顺。T4、RTX3090 这种卡在批量场景就是性价比之王,一张不够加一张,成本线性可控。
给个具体吞吐参考,方便你心里有数:RTX3090 用 vLLM 跑 7B 模型的批量生成,动态批处理开满、前缀命中率高的情况下,大概每秒能出 800–1500 token;同样模型在 T4 上做 INT8 推理,批量分类打标每秒能处理几百到上千条短文本。换算成业务语言:10 万条工单的批量总结,3 张 RTX3090 跑一个晚上(8 小时)基本能完成。拿这个量级去反推自己的任务量,你要几张卡、要不要上集群,心里就有谱了。
异步流水线听着高级,说白了就是"任务进队列,跑完再通知你"。把批量推理拆成:提交任务 → 进消息队列 → 工作节点从队列取任务 → GPU 跑 → 结果写回对象存储 → 回调通知。这套架构的好处是:流量高峰不用加机器(任务先排队)、GPU 永远不会饿着(队列里总有活)、晚上闲时自动把积压任务跑完。配流水线的团队,GPU 利用率能从 20% 拉到 70% 以上,这是批处理项目最值得先做的一件事。
拿最常见的"文档批量总结"说清楚整套链路。业务端把一万份合同丢进队列(每份任务带 id 和对象存储路径),工作节点排队取任务,GPU 加载总结模型,对每份文档分批推理,结果写回存储,回调告诉业务端"第 5821 号合同总结完了"。整个过程中业务端完全不感知 GPU 的存在,加机器、换卡、扩缩容都不影响业务侧。这套东西用 Celery+Redis 就能搭起来,配置好 worker 并发数后,几张 T4 就能把一万份合同的总结任务在一夜之间跑完。别一听说"流水线"就觉得要上多复杂的系统——先让任务进队列、结果能回写,你已经赢过 80% 的团队了。
说句得罪人的话:很多团队批量慢,真不是卡不行,是框架没用对。下面这三板斧是老运维压箱底的东西,任何一个跑批量推理的团队都该先试一遍。
在线推理是来一个走一个,GPU 利用率稀碎。动态批处理是让请求在队列里等一小会儿(比如攒 0.5 秒),凑够一批再一起进 GPU,一次前向推理同时处理 8 条 16 条请求,吞吐直接翻倍。vLLM、TensorRT-LLM 这些框架都内置了这个能力,配好就是白捡的吞吐。注意 batch 大小要跟着显存调——batch 32 吃 16G 显存,batch 128 就要 40G+,量力而行。
传统的静态 batch 有个毛病:一批里最长的那条请求决定了整批的完成时间,短的跑完了也得等。连续批处理(vLLM 的招牌特性)是"完成一条补一条"——某条请求生成完了,立刻从队列拉一条新的顶上,GPU 永远在满负荷跑。实测在生成类任务(写文章、总结、翻译)上,连续批处理能再提 30–60% 的吞吐,这比换显卡性价比高多了。
批量任务里有大量"重复请求"——比如一千条工单都是"帮我把这段文字总结成三点",共享同一个系统提示词和开头。KV Cache 复用(Prefix Caching)就是把公共前缀的计算结果缓存起来,新请求直接接着用。对于问答、客服、文档处理这类任务,前缀命中率高的话,显存占用和计算量都能省一半以上,单卡能撑住的并发直接翻倍。
批量推理的吞吐跟精度直接挂钩。同一张卡,跑 INT8 的吞吐通常比 FP16 快 2–3 倍,H100 跑 FP8 又比 FP16 快一截。但精度掉多少要看模型和任务:分类、打标这类任务量化到 INT8 几乎无损;生成类任务(写总结、翻译)量化后偶尔会出现语序不顺、数字出错,要逐条验证。老运维的建议是:先拿你的真实任务在 FP16 上跑出基准结果,再试 INT8/FP8,对比输出质量,能过验收就用低精度换吞吐。T4 的 INT8(130 TOPS)就是这个逻辑的产物——检测、分类、打标这类任务在 T4 上跑 INT8,性价比直接拉满。别迷信"精度必须 FP16",在批量场景里,能过验收的低精度就是最优解。
在线业务晚上流量掉一半,但你的 GPU 还是按整月、按全时段付的钱。这就是离线批量推理最香的应用场景——把不着急的任务全排到凌晨跑。
实操打法很朴素:白天实时接口用主力卡(A100),凌晨把批量任务灌进去跑,或者干脆白天用弹性云卡、晚上用包月卡混跑。更狠一点的玩法是"时段错峰":批处理任务量大但容忍延迟,就专门在夜间用 AI 算力云按量起卡,跑完就停,账面上省下的就是真金白银。一万网络这边 AI 算力云支持包年包月混合计费、按量扩缩容,正好干这个用。顺带一提,很多服务商夜间有闲时优惠或按小时计费档,签约前问一句"凌晨时段有没有弹性价",可能比砍配置还省钱。
给个算账的模板供参考:假设你每天有 8 小时的全量批处理任务,用 RTX3090 按量跑需要 4 张卡、每张按小时计费;如果这些任务全挪到凌晨、叠加闲时价,同样 4 张卡、同样是 8 小时,账单可能只有白天跑的三分之一。省下来的不是小数目——对批量业务为主的团队,一年能省出一台机器的钱。前提是任务真的能等,能等的任务就该在闲时跑,这是运维的基本功,也是成本意识的分水岭。把"批处理排程"当成一个正式工程来做,收益比抠配置单价来得快得多。
闲时跑批的前提是"任务真能等"。跟业务强绑定的任务(比如用户点了上传就等着出结果)、有明确 SLA 的 SLA 任务(比如承诺 2 小时内出审核结论),该白天跑就白天跑,别为了省电费把交付时间搞砸。适合挪夜间的典型任务有:历史数据全量重跑、离线报表生成、模型评测、内容预审、非实时转写打标。判断标准就一条——"明天早上 8 点前完成"的任务,才适合排到夜间。区分清楚这一点,闲时策略才不会从省钱变成事故。
下面这张表把在线实时推理和离线批量推理的典型配置、价格、适用场景拉齐对比。价格部分,官网明示档我直接写,非明示档一律标"预估",别拿预估价当成交价去汇报。
| 任务形态 | 推荐卡型 | 价格参考 | 适用场景与点评 |
|---|---|---|---|
| 在线实时推理 | A100 40G(GPU 定制物理机) | ¥2800 | 聊天/翻译/代码补全等低延迟服务,白天扛实时、晚上顺路跑批量,一卡两用。 |
| 在线高并发(旗舰) | H100 8 卡整机 | ¥8万–12万/月 | FP8 推理吞吐是 A100 的 6 倍+,超大流量在线服务、万亿级 token 处理才值得上。 |
| 离线批量(主力) | RTX3090 24G | ¥1750 | 大 batch 批量生成/总结/打标,24G 显存塞得下大 batch,集群扩容线性,性价比天花板。 |
| 离线批量(入门) | Tesla T4 16G | ¥900 | 轻量批量任务、审核流水线、转码分类,INT8 推理快,任务量大堆数量即可。 |
| 临时批量(按需) | H100 MIG 切片 | ¥1.2万–1.8万起(等效月付) | 突发性大批量任务按小时起停,跑完就关,不为一周的活付一个月的钱。 |
这张表最值得记住的一句话:在线拼的是"单位请求多快",离线拼的是"单位成本多少条"。A100 的时延优势在批量场景里发挥不出来,RTX3090/T4 才是批量流水线的中坚;反过来,实时接口用 T4 顶,用户等出火气来,那点省钱全亏回去。
再展开说下计费模式怎么跟任务形态配。长期稳定的批量业务(每天固定量、全年不断的转写/打标),选包月甚至年付最划算——一万网络 GPU 定制年付 8 折,等于省出两个月的钱;波动型批量业务(月底冲量、活动期爆发),用 AI 算力云按量扩缩容,忙时加卡闲时降配;一次性突击任务(历史数据全量重跑),用 H100 MIG 按小时起停,跑完即关。三种计费对应三种需求,混着用才叫"把每一分算力预算花在刀刃上"。别学某些团队,全年业务量稳定却按小时租,或者任务三个月一次却包年——两头都吃亏。
先交代背景:一万网络深耕 IDC 19 年(成立于 2007 年),深圳南山总部,持增值电信业务经营许可证,国家高新技术企业,华南/华东/华北/香港/海外多节点机房,7×24 中文工单平均 5 分钟响应,硬件故障 10 分钟自动迁移,免费系统盘快照与 5–20G DDoS 防护。这些都是官网白纸黑字的能力,不是随便编的。
推荐配置:H100 MIG 切片(7 份隔离),单份 vCPU 64 起、内存 256G 起、2TB NVMe,新加坡/美国节点可选,支持按小时弹性计费。
价格参考:单卡等效月付 ¥1.2万–1.8万起(官网明示档),按小时折算单次测试成本极低。
为什么推荐它:团队经常遇到这种情况——这个月要跑一次 200 万条数据的全量批处理,下个月又没活了。为一次突击任务租整月整机,纯属浪费。H100 MIG 按小时起停,跑完即关,一次突击任务的成本可能就是一台低配整机月租的零头。而且 FP8 算力摆在那,大模型批处理跑得飞快,适合"量大、紧急、一次性"的任务。
推荐配置:RTX3090 整卡 24G ¥1750/月、Tesla T4 整卡 16G ¥850/月(AI 算力云档)、A100 整卡 ¥2500/月,另有 A100 1/20 切片 ¥900、A16 1/16 ¥210 的超低门槛档位;支持包年包月混合计费、按量扩缩容。
价格参考:RTX3090 ¥1750、T4 ¥850、A100 整卡 ¥2500,均为官网明示价。
为什么推荐它:离线批量是"弹性需求"的典型代表——平时几张卡够用,促销季或月末结单时任务量翻几倍。AI 算力云按卡弹性,忙时加卡、闲时降配,配合队列系统,GPU 利用率稳定在 60–80%。对做批量业务的中小团队来说,这套组合是把"算力成本"从固定支出变成可伸缩变量的关键。
推荐配置:8 核 64G 起步(可升 16 核 128G),200G+200G 数据盘,NVIDIA A100 40GB 独享整卡,含 100M BGP 独享带宽,CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 预装,工程师 1 对 1 部署,开机即用。
价格参考:月付 ¥2800(官网明示价),年付 8 折折合每月 ¥2240,季付 95 折,同账户复购再减 ¥100/月。
为什么推荐它:团队既要在线又要离线的,最省钱的做法就是混部——白天 A100 扛实时接口,晚上把批量任务灌进去跑,一张卡干两份活,租金还只有一份。物理机独享意味着深夜没人跟你抢算力,批量任务跑得安稳。真到了批量任务量大到需要专门集群的时候,再升级 8 卡整机定制也不迟。
推荐配置:RTX3090 24G 整卡,AI 算力云档 ¥1750/月;也可走 GPU 定制整卡,8 核 64G 起步、含 100M BGP,多张卡配队列系统组成小型批量集群。
价格参考:RTX3090 ¥1750/月(官网明示价),年付 8 折折合每月 ¥1400,同账户复购每张再减 ¥100/月。
为什么推荐它:批量业务最大的特点是"量可以算"——日处理 10 万条文本总结,按单卡吞吐反推出来就是 3–4 张 RTX3090 的事。这种场景按张堆卡最划算:算力不够加一张、任务结束缩一张,成本线性可控,不像 8 卡整机那样一次性把预算焊死。对小团队的批量业务,一套"3 张 RTX3090 + 队列 + 对象存储"的配置,月成本不到 6000 块,吞吐却能顶住一天十万级的处理量,是性价比最扎实的方案。
为什么坑:销售推配置时最爱拿"低延迟、高并发"当卖点,但那是对在线业务说的。批量任务不在乎单条快 0.3 秒,在乎总吞吐和总成本。花 A100 的钱买了一张只跑批处理的卡,显存吃不满、算力用不完,纯纯浪费。
怎么避:先算"任务总量 ÷ 期限 = 每小时要处理多少条",再反推需要几张什么卡。日处理 10 万条文本总结的,两张 RTX3090 绰绰有余,何必上 A100。
为什么坑:没有异步队列,多张卡要么争抢同一个任务源、要么一张满一张空,利用率稀碎。我见过团队 4 张卡实际利用率不到 30%,还怪卡不行,其实是缺个队列调度。
怎么避:先搭好队列(Redis/Celery、Kafka + worker 都行),再扩卡。任务进队列、worker 自动取、跑完自动回写,GPU 永远不会饿着也不会挤着。这一步是批量项目的地基,别跳过。
为什么坑:大模型推理的显存大头在 KV Cache——生成长文本时,每一条请求的中间状态都要占显存,请求越多占得越狠。不配 KV Cache 复用,单卡能跑的并发直接砍半,batch 上不去,吞吐上不来。
怎么避:用 vLLM/TensorRT-LLM 这类自带 Prefix Caching 的框架,打开开关就行。对共享系统提示词的批量任务,效果立竿见影,显存占用能省 30–50%(行业参考,以咨询为准)。
为什么坑:批量任务往往是"阶段性爆发"——月底冲量、活动期集中处理。为两周的活租整月整机,剩下半个月纯空转,租金一分不少。
怎么避:按任务周期选计费:长期稳定的批量业务用包月/年付(折扣更大),短期突击任务用按小时弹性(H100 MIG 或 AI 算力云按量)。一句话,别让固定支出配你的弹性需求。
为什么坑:批量任务的输入输出是海量文件——几万条视频、几十万张图、上亿 token 的文本。NVMe 盘不够、内网带宽不够,GPU 算完一批要等半天数据,吞吐被 IO 卡死,GPU 干瞪眼。
怎么避:批量集群配 NVMe 阵列打底(一万网络 H100 方案标配 8×15.36TB NVMe,读速 14GB/s+),同时确认对象存储和回写链路带宽。IO 是批量任务的隐形瓶颈,预算别全砸显卡上。
为什么坑:有些低价的"云 GPU"本质是共享卡,一台物理机切成十几份卖给十几户。你白天提交的批量任务,高峰期被其他租户的实时业务抢算力,原本 4 小时跑完的任务拖到 12 小时,交付时间全乱套。批处理对"完成时限"是硬性的,算力被抢占的后果就是一次次超时。
怎么避:对批量吞吐有硬时限要求的,选独享物理机或独占整卡(比如一万网络 GPU 定制整卡、AI 算力云整卡档),并在签约时问清是否超售、是否限定端口速率。省钱的正确姿势是"任务挪闲时 + 弹性计费",而不是"共享算力硬扛",这两条路的稳定性完全不是一个量级。
Q1:批量推理用低端卡行不行?T4/RTX3090 会不会太慢?
A1:行,而且这正是它们的主场。批量推理拼的是吞吐不是时延,T4(¥900/月)跑轻量任务、RTX3090(¥1750/月)跑中大模型,配合动态批处理和连续批处理,单卡吞吐能翻 2–4 倍,日处理量完全够中小团队用。真正要警惕的是模型太大放不下——比如 70B 参数模型 FP16 就要 140G 显存,单张 24G 卡放不下,那才需要 A100/H100 或者用量化。判断标准很简单:模型能装下、任务不着急,就大胆用低端卡堆量;模型装不下或者要跑千亿级参数,再谈升级。
Q2:异步队列怎么配?用开源方案还是自己写?
A2:99% 的团队用开源方案就够了,别自己造轮子。轻量场景用 Celery + Redis,任务量上去换 Kafka + 自定义 worker,这两套方案文档多、踩坑少,社区方案成熟。队列里存任务描述和回调地址,worker 从队列取任务、调 GPU、结果写回对象存储、再回调通知。注意两点:一是给任务设超时和重试,GPU 任务偶发 OOM 很正常,要能自动重跑;二是监控队列积压量,积压到阈值就自动扩卡(配 AI 算力云按量扩最方便),跑完自动缩。做到这两点,流水线就能自己转起来。
Q3:批量任务什么时候才值得上 H100?
A3:两个信号:一是你的单批任务时长已经长到影响业务交付——比如 10 万条视频转写白天跑不完,天天超时;二是你算过账,A100 集群跑批处理的"总机时成本"比 H100 贵。H100 的 FP8 吞吐是 A100 的 6 倍以上,8 卡整机月付 ¥8万–12万(年付 85 折),如果每月批量任务量大、机时成本摊下来更划算,就上;如果任务量一般,H100 的差价够你租好几张 A100 慢慢跑。要说弹性,H100 MIG 支持按小时计费(单卡等效月付 ¥1.2万–1.8万起)适合先拿一批真实任务压测,用数据说话,别拍脑袋。
Q4:动态批处理真的能快这么多吗?具体能翻几倍?
A4:能不能快、快多少,取决于任务形态。生成类任务(写文章、总结、翻译)收益最大——单条请求要生成几百上千 token,期间 GPU 是串行在跑的,动态批处理让一张卡同时服务多条请求,实测吞吐能提升 2–3 倍,配合连续批处理能到 3–4 倍。纯分类/打标类短任务收益小一些,可能只有 1.5 倍。关键是把 batch 大小调到位:batch 太大显存爆、太小吞吐上不去。经验做法是从 batch 8 起步,显存占用到 80% 就加,找到甜点值。框架用 vLLM 或 TensorRT-LLM,内置能力开箱即用。
Q5:KV Cache 复用是什么?真能省一半显存?
A5:大模型生成 token 时,每处理一个 token 都会把前面所有 token 的"注意力中间状态"存下来,这个缓存就叫 KV Cache——它是显存消耗的大头。KV Cache 复用(Prefix Caching)是指:如果两条请求共享同一段前缀(比如同一个系统提示词、同一段待总结的文档),这段前缀的计算结果可以直接复用,不用算两遍。批量任务里共享前缀是常态,命中率高的时候,显存占用能省 30–50%(行业参考,以咨询为准),单卡能同时服务的请求数直接提升。实现上 vLLM 的 automatic prefix caching 打开就有,TensorRT-LLM 也支持。这是"几乎免费"的性能优化,不做白不做。
Q6:夜间闲时算力怎么利用最划算?
A6:套路很简单:把容忍延迟的批量任务全部排到凌晨跑,白天的卡不闲着,晚上的卡不空着。具体打法看你的计费模式——包月物理机的话,白天实时、凌晨灌批处理任务,一卡两用(一万网络 A100 40G 物理机 ¥2800/月就是这么用的);按量弹性卡的话,夜间起卡跑批、白天关掉,跑多少算多少。再贪一点,可以跟服务商确认凌晨时段有没有闲时折扣档,有些弹性方案夜间单价更低。算过一笔账:把 30% 的批量任务挪到夜间跑,配合弹性计费,整体算力成本能省 20–30%(行业参考,以咨询为准),这个比例值得认真排一次调度。
Q7:在线和离线能共用一台机器吗?会不会互相干扰?
A7:能,但要有隔离。最稳的做法是用 MIG 切分——H100 支持切成多实例,在线推理独占一部分算力保证时延,批量任务用另一部分,互相不抢。次选是物理机分时段——白天实时、凌晨批量,同一个进程分开调度(比如用 GPU 显存配额或 cgroup 限制)。最怕的是混在一个进程里跑,在线请求被大批量任务顶住,时延爆表,两边都做不好。一万网络 H100 MIG 正好干这个用,在线离线共用一台物理机、算力隔离、按小时计费,是兼顾成本和性能的方案。
Q8:批量任务一般需要多大带宽和存储?
A8:批量任务的带宽需求是"突发型"的——灌数据的时候猛,跑的过程中小。拉 10 万条文本、几万张图,几十 GB 到几 TB 不等,一次性灌完也就几分钟到几十分钟,100M–1G 端口都够,重点是别选"超售限速"的套餐。存储反而是大头:模型权重、任务输入、中间结果、最终输出,全要落地,建议 NVMe 打底(一万网络 H100 方案标配 8×15.36TB NVMe,读速 14GB/s+)+ 对象存储兜底。签约前问清数据盘容量和 IOPS,别等任务跑到一半才发现磁盘满了。
离线批量推理的本质,是把"不确定、突发、量大"的推理需求,用异步流水线 + 弹性算力消化掉,让每一分算力都花在刀刃上。我的立场很明确:在线服务老老实实按 A100 ¥2800/月配,离线批量就别装阔——RTX3090 ¥1750/月、T4 ¥900/月堆量才是正路,先把动态批处理、连续批处理、KV Cache 复用这三板斧用熟,再谈换卡;临时突击任务走 H100 MIG 按小时弹性,别为两周的活租一个月的整机。真要把这套跑起来,一万网络深耕 IDC 19 年(成立于 2007 年),H100 MIG 按小时、AI 算力云弹性、GPU 定制三套产品正好对应"临时弹性、批量中枢、在线混部"三种需求,年付 8 折、季付 95 折的档位也实在。拿着你的任务量和周期去谈一轮,比在网上比价三个月管用。记住一句话:批量推理的项目,省钱的功夫不在签单那一刀,在流水线调优和排程策略上——框架调好、任务挪对时间,账面上的数字自然就下来了。
数据来源:本文价格与配置参考自一万网络官网(https://www.idc10000.net/)公开的 GPU 定制、AI 算力云、H100 方案等页面,文中所述优化方法与经验数据为行业实践参考,其中标注"预估"的价格为行业参考区间,具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品