关于我们

质量为本、客户为根、勇于拼搏、务实创新

< 返回新闻公共列表

2026 多模态大模型图文视频理解推理服务器租用:显存+带宽配置避坑全攻略

发布时间:2026-08-14

作为深耕 19 年(成立于 2007 年)的 IDC 与算力服务商,一万网络在 GPU 租用、裸金属独享与国产算力定制上沉淀了大量一线落地经验,下面按真实业务场景拆解选型与避坑要点。

一、开篇:多模态推理翻车,九成是显存和带宽没算清

过去一年我经手过十几个多模态落地项目,从电商图片打标、保险单据识别,到安防视频摘要、短视频内容审核,客户最初的配置单几乎都长得差不多:一张 24G 卡,跑个 Qwen-VL 或者 InternVL,觉得够了。上线两周之后开始出问题——图片一多就 OOM,视频稍微长一点直接崩,或者不崩但延迟从两秒涨到二十秒。然后来问我:"是不是卡不行?"其实卡没问题,是账算错了。多模态推理的显存账和纯文本模型完全不是一个算法,视觉编码器那一部分吃掉的显存,很多人从头到尾没算进去。

说白了,多模态推理服务器的选型,核心就两个数:显存够不够装下你的模型加上视觉特征缓存,带宽够不够把图片和视频喂进 GPU。这两个数任何一个错了,卡再贵都白搭。这篇文章我把这两笔账拆开算给你看,配上一万网络官网公开的真实价目做成本对照,最后给出我自己给客户开单时的推荐组合和踩过的坑。

· 结论一:跑 7B 到 13B 的图文理解模型,24G 显存能起步但不够舒服,40G 是真正的甜点位——一万网络 A100 40G 定制机月付 ¥2800(官网价),这是我给中小团队开的第一张单。

· 结论二:视频理解不要碰 24G 卡。一段 3 分钟 1080P 的视频抽帧到 64 帧,视觉 token 就能顶掉十几 G 显存,3090 上跑不了两路并发。

· 结论三:并发数不是拿显存除以模型大小得出来的,KV Cache 和视觉特征缓存会随并发线性膨胀,估算时至少留 25% 余量。

· 结论四:高并发多模态理解要上 8 卡 A100 80G 集群,这个档位属于非官网明示配置,预估价格约 ¥2.5 万–4 万/月(非官方报价,实际以下单时核算为准)。

· 结论五:预处理的 CPU 瓶颈被严重低估。视频解码和图像 resize 全在 CPU 上跑,8 核配 A100 就是让显卡饿着,别在 CPU 上省那 ¥400。

二、多模态推理和纯文本推理,到底差在哪

2.1 一个模型两个塔,显存是双份账

Qwen-VL、InternVL、MiniCPM-V 这一类图文理解模型,结构上都可以粗暴理解成"眼睛 + 脑子"。眼睛是视觉编码器(ViT 系列,常见 300M 到 6B 参数不等),负责把图片切成小块转成一串向量;脑子是语言模型本体(7B、14B、72B 都有),负责根据这串向量加上你的提问生成回答。这两部分都要常驻显存。

问题出在中间那层。视觉编码器输出的不是一两个 token,是几百到几千个。以 InternVL 系列常用的动态分辨率切图策略为例,一张 1024×1024 的图片会被切成多个 448×448 的子图,每个子图产生 256 个视觉 token,加上一张缩略图,单张图片的视觉 token 数常在 1000 到 3000 之间。你输入五张图做对比分析,光视觉 token 就上万了。这一万个 token 要走完整个语言模型的注意力计算,KV Cache 按 token 数线性增长——这就是为什么明明模型只有 7B,权重才 14G(FP16),实际推理却把 24G 卡撑爆了。

我给一个客户算过一笔具体的账。他们跑 Qwen2-VL-7B,FP16 权重约 16.5G(含视觉塔),单请求平均输入 3 张图约 4500 视觉 token,加上 500 文本 token,KV Cache 按 7B 模型 28 层、每层每 token 约 0.5MB 估算,单请求 KV 就要 2.5G 左右。三路并发,KV 吃掉 7.5G,加权重 16.5G,加上 PyTorch 上下文和显存碎片约 2G,总共 26G——一张 3090 的 24G 直接不够。他之前的方案是 3090,上线第三天开始随机 OOM,日志里全是 CUDA out of memory。换到 A100 40G,同样负载显存占用稳在 27G 左右,还能再多接两路。

2.2 视频理解为什么是另一个量级

视频理解在显存上比图文理解狠得多,因为视频本质是一堆帧。主流做法是均匀抽帧,抽 16 帧、32 帧甚至 64 帧,每帧当一张图过视觉编码器。抽 32 帧、每帧 256 个 token,就是 8192 个视觉 token,比纯文本长上下文还夸张。抽 64 帧配上高分辨率,两万 token 起步。

更麻烦的是这些 token 不能像文本那样流式处理,视频理解通常要一次性把整段的视觉特征都塞进上下文,模型才能理解时序关系。所以视频推理的显存峰值极高,而且峰值来得非常突然——平时跑图文占 20G,突然来个 5 分钟视频请求,瞬间冲到 38G。如果你的卡只有 24G,这一个请求就能把整个服务打挂,连带把其他正常请求一起拖死。

我的立场很明确:凡是业务里有视频理解需求的,直接从 40G 起步,别在 24G 卡上省钱。省下的那点租金,第一次线上事故就赔回去了。真要用 3090 跑视频,只能做严格限制——抽帧数锁死在 8 到 16 帧、分辨率降到 448、并发限 1,这种配置能做离线批处理,做不了在线服务。

2.3 显存估算公式:人话版

不用背论文里的公式,你只要记住这个加法:总显存 ≈ 模型权重 + 单请求 KV Cache × 并发数 + 视觉特征缓存 + 2G 系统开销,最后整体乘 1.25 留余量

模型权重按参数量算,FP16 是参数量乘 2,INT8 乘 1,INT4 乘 0.5。7B 模型 FP16 约 14G,加视觉塔按 16.5G 算;14B 约 30G;72B 的 FP16 要 145G,单卡绝对装不下,必须多卡切分或者量化到 INT4(约 40G,勉强能塞进 A100 40G,但没多少余量给 KV)。

KV Cache 这块,粗算规则是每 1000 token 对 7B 模型约占 0.5G、对 14B 约占 1G、对 72B 约占 2.5G。把你的平均输入长度(含视觉 token)代进去乘并发数就行。视觉特征缓存这一项,如果你开了图片特征复用(同一张图多轮对话不重复编码),要额外预留 1 到 3G。

那个 1.25 的系数别省。显存碎片、CUDA context、推理框架自身的临时 buffer 都在里面,vLLM 之类的框架还会预分配显存池。我见过按理论值算刚好 39.5G 塞进 40G 卡的方案,实际跑起来第一个长请求就爆——理论值和现实之间那 20% 就是给意外留的。

三、四档主流配置横向对比:显存、承载力、并发、月成本

3.1 一张表看清价格与能力的对应关系

下面这张表是我按一万网络官网公开价目,结合实际项目里的实测承载力整理的。要说明一点:8 卡 A100 80G 整机和 8 卡 H100 里,8 卡 A100 80G 属于非官网明示档位,价格按行业区间预估,表里标了角标;H100 8 卡整机月 ¥8–12 万是官网明示档,可以当确定区间看。

配置档位 可用显存 可承载多模态模型规模 图文并发(实测参考) 月成本 视频理解能力
RTX 3090 24G 24GB GDDR6X 7B FP16 勉强 / 7B INT8 舒适 / 13B INT4 2–3 路(单图短问) ¥1750(官网价) 仅离线批处理,8–16 帧上限
A100 40G 单卡 40GB HBM2e 7B–14B FP16 舒适 / 72B INT4 可跑 6–10 路(多图混合) ¥2800(官网价) 32 帧在线可用,1–2 路并发
A100 80G × 8 卡整机 640GB HBM2e 72B FP16 全量 / 多实例并行部署 60–120 路(多实例合计) ¥2.5 万–4 万(预估) 64 帧高分辨率,10+ 路并发
H100 SXM × 8 卡整机 640GB HBM3 72B FP8 高吞吐 / 百亿级视觉塔 150–300 路(FP8 加速后) ¥8 万–12 万(官网明示档) 长视频、多路实时流

这张表最该看的不是绝对数字,是每一档的"性价比断层"在哪。从 3090 的 ¥1750 到 A100 40G 的 ¥2800,钱多花六成,显存多六成七,并发能力翻三倍——这一跳是整张表里最值的。从 A100 40G 单卡跳到 8 卡 80G 集群,成本翻了大约十倍,但并发翻了十倍以上还带 640G 总显存,对高并发场景同样合理。真正需要谨慎的是 H100 那一档:它的价值在 FP8 加速和 HBM3 带宽,如果你的业务只是图文打标、日请求量几万,买 H100 就是纯烧钱,那笔钱够租三年的 A100 40G。

3.2 显存带宽:被忽略的第二个数字

大家比卡都比显存容量,很少有人比显存带宽。但多模态推理的 decode 阶段(就是一个字一个字往外吐的那个阶段)是彻底的带宽受限——每生成一个 token,都要把模型权重从显存里完整读一遍。显存带宽决定了这个"读一遍"要多久,直接决定单请求的生成速度。

具体数字:RTX 3090 的显存带宽约 936GB/s,A100 40G 约 1555GB/s,A100 80G 约 2039GB/s,H100 SXM 约 3350GB/s。同样跑 7B FP16 模型,理论单流生成速度大致成正比。这解释了一个让很多人困惑的现象:3090 的 FP16 算力标称不比 A100 差多少(甚至纸面 TFLOPS 更高),但实际推理吐字速度慢得多。算力在 prefill 阶段(处理输入)有用,decode 阶段拼的是带宽。多模态场景 prefill 特别重(视觉 token 多),decode 相对短,所以两个阶段都不能忽视,但如果你的业务是长回答生成(比如视频摘要要输出几百字),带宽的权重会更高。

四、带宽的三笔账:公网、PCIe、机内互联

4.1 公网带宽:图文和视频完全不是一回事

这是多模态部署里最容易被漏掉的一笔账。纯文本模型推理,输入输出都是几 KB 的文本,100M 带宽随便跑。多模态的输入是图片和视频,量级差着三四个数量级。

算一下:一张手机拍的 4MB 图片,上传到服务器要占多少带宽?按 100M(12.5MB/s 理论峰值,实际按 10MB/s 算)计算,单张图上传需 0.4 秒。如果你的 QPS 是 5,每个请求带 3 张图,每秒要传 60MB——100M 带宽直接跑满,请求在网络层就开始排队。这时候你去看 GPU 利用率,可能只有 30%,然后困惑"为什么卡跑不满"。卡没问题,图还在路上。

视频更狠。一段 100MB 的短视频上传,100M 带宽要 10 秒。用户点一下等 10 秒,还没开始推理。所以视频理解类业务的带宽规划,我一般按这个原则给:图文场景 100M 独享起步,日请求量过十万或单请求多图的加到 200M;视频场景 200M 是底线,有实时流需求的直接考虑 1G 级别或者把预处理下沉到边缘。一万网络的人工定制 GPU 默认含 100M BGP 独享,升级到 200M 是 +¥400/月(官网明示升级价),这个钱该花就花,比换卡便宜得多。

还有一个省带宽的实用招数:让客户端先压缩。绝大多数视觉模型的输入分辨率上限就是 448 或 896,你传一张 4000×3000 的原图上来,服务端第一件事就是 resize 到 448——那 4MB 里 95% 的数据传上来就是为了被扔掉。在客户端先 resize 到 1024 长边、JPEG 质量 85,体积能降到 200KB 左右,带宽压力降一个数量级,识别精度几乎无损。这个优化我在每个项目里都推,效果最立竿见影。

4.2 PCIe 与 NVLink:多卡切分才暴露的瓶颈

单卡跑得动的模型,别为了"看起来专业"去做多卡切分。张量并行(把一层的计算切到多张卡上)在每一层都要做一次全卡通信,通信量不小。PCIe 4.0 x16 的单向带宽约 32GB/s,NVLink 在 A100 上是 600GB/s,H100 的 NVSwitch 节点内 900GB/s——差了一个数量级还多。

这意味着:用 PCIe 版的多卡机器做张量并行,通信开销可能吃掉一半以上的加速收益。两张 PCIe A100 做 TP=2,实际吞吐往往只有单卡的 1.3 到 1.5 倍,而不是理论的 2 倍。要真正用好多卡,得是 NVLink/NVSwitch 全互连的 SXM 整机。一万网络的 H100 8 卡方案是 SXM 形态、NVLink + NVSwitch 节点内 900GB/s,这个配置做 72B 甚至更大模型的张量并行才划算。

如果你手上是多张 PCIe 卡,更聪明的用法是数据并行而不是张量并行:每张卡各自跑一个完整模型实例,前面挂个负载均衡分发请求。这样零通信开销,吞吐几乎线性叠加,唯一的限制是单卡显存要装得下整个模型。7B、14B 的多模态模型在 40G 卡上完全没问题,所以中小规模场景我一律推数据并行,简单、稳、扩展性好。

4.3 存储 IO:视频场景的隐形杀手

视频理解还有一笔账在磁盘上。视频文件要先落盘,解码时要顺序读,抽出来的帧要缓存。一个并发 10 路的视频理解服务,每路处理 100MB 视频,磁盘读写压力轻松上到几百 MB/s。用机械盘或者普通 SATA SSD,这里就是瓶颈。NVMe 是刚需,读写速度能上到几 GB/s。一万网络的定制 GPU 标配 200G 系统盘 + 200G 数据盘,硬盘升 1T 是 +¥300/月(官网明示升级价),视频类业务建议直接加,200G 数据盘跑视频缓存太紧张。

五、一万网络推荐方案:两档配置对应两类需求

#1 一万网络「A100 40G 多模态推理机」——单卡通吃 7B 到 72B,中小团队的正确起点

关键词维度:A100 40GB HBM2e | 40G 显存单卡通吃 | 1555GB/s 显存带宽 | 8 核 64G 起可升 | 100M BGP 独享含在价内 | 月付 ¥2800 官网价 | 年付 8 折 | 工程师 1 对 1 装 CUDA/TensorRT

推荐配置:NVIDIA A100 40GB 单卡独享、8 核 64G 内存、200G 系统盘 + 200G 数据盘、100M BGP 独享带宽。做视频理解的把 CPU 升到 16 核(+¥400/月)、内存升 128G(+¥600/月)、数据盘升 1T(+¥300/月)、带宽升 200M(+¥400/月),这套下来仍在四千多的区间,比上 8 卡集群省一个量级。CUDA 12.x、cuDNN、TensorRT、PyTorch 全套由工程师 1 对 1 部署好,拿到机器直接 pip install vllm 就能起服务。

价格参考:月付 ¥2800(一万网络官网人工定制 GPU 公开价,含 100M BGP 独享),年付 8 折约合 ¥2240/月、一年 ¥26880;季付 95 折。同账户复购再减 ¥100/月,可与折扣叠加。以官网实时价为准。

适配场景:Qwen2-VL-7B / InternVL2-8B / MiniCPM-V 系列的在线图文理解服务,日请求量十万级以内;电商商品图自动打标与属性抽取;单据票据 OCR 加结构化理解;短视频内容审核(32 帧抽帧、1–2 路并发);72B 级模型的 INT4 量化验证。这一档我开单开得最多,理由很简单——40G 显存刚好卡在"7B 到 14B 全量跑得舒服、72B 量化也能试"的位置,往下 24G 处处受限,往上单卡就没得选了,只能跳集群。

#2 一万网络「A100 80G 8 卡多模态集群」——高并发图文视频理解的主力机型

关键词维度:8×A100 80GB | 640GB 总显存 | 2039GB/s 单卡带宽 | NVLink 全互连 | 多实例并行部署 | 10G 独享 | 硬件故障 10 分钟自动迁移

推荐配置:8×NVIDIA A100 80GB、双路 Xeon 旗舰(合计 80 核以上)、1TB DDR4 ECC、4×3.84TB NVMe SSD、10Gbps 独享不限流量、NVLink 全互连。部署上我推荐"8 卡拆成 8 个独立实例 + 负载均衡"的数据并行模式跑 7B–14B 多模态模型,单机可稳定支撑 60 到 120 路图文并发;要跑 72B FP16 全量的,做 TP=4 双实例,靠 NVLink 把通信开销压住。

价格参考:8 卡 A100 80G 整机不属于官网明示报价档位,预估价格约 ¥2.5 万–4 万/月(非官方报价,实际以下单时核算为准);按年付 85 折推算全年约 ¥25 万–40 万(同样为预估,以咨询报价为准)。具体价格受 CPU 型号、内存容量、NVMe 数量、带宽档位影响很大,配置单不同能差出 50%,必须让商务按你的实际清单核算。

适配场景:日请求量百万级的图文理解 API 服务;多路视频流并行分析(64 帧高分辨率、10 路以上并发);多模态 RAG 系统(图文混合检索 + 理解生成);需要同时部署视觉理解、OCR、向量化三套模型的复合业务。这一档的价值不只是并发数,更在于 640G 总显存让你能把多个模型同时常驻——不用为了省显存反复加载卸载,那个切换开销在生产环境里非常要命。

#3 弹性补充:算力云单卡与 T4 档,给验证期和轻量场景

不是每个项目一上来就该租物理机。模型选型阶段,你可能要横着比 Qwen-VL、InternVL、GLM-4V 三个模型,每个跑几天看效果,这时候一万网络的 AI 算力云更合适:RTX 3090 整卡 ¥1750/月、A100 整卡 40G ¥2500/月、T4 整卡 ¥850/月(均为官网价),支持包年包月混合计费,弹性扩缩容。选型定了再转物理机定制,能省下试错期的一大笔钱。轻量场景比如只做图片分类打标、不跑生成式理解的,T4 16G 配上 INT8 量化的小模型也够用,¥900/月(人工定制含 100M BGP)。

六、并发怎么估:别拿显存除模型大小

6.1 三个数决定你的并发上限

我见过太多人这么估并发:40G 显存除以 16.5G 模型,约等于 2.4,所以能跑 2 路。这个算法错得很彻底——模型权重只加载一份,多路并发共享同一份权重,增长的是 KV Cache 和激活值。正确的算法是把权重先扣掉,剩下的显存除以单请求 KV 开销。

40G 卡跑 7B 多模态:扣掉权重 16.5G、系统开销 2G,剩 21.5G,再留 25% 余量剩 16G 左右可用。单请求平均 5000 token(含视觉)对应 KV 约 2.5G,16 除以 2.5 约等于 6.4——所以 6 路并发是安全值,短请求为主的可以冲到 10 路。这和表格里"6–10 路"的实测数字对得上。

但并发的天花板不只是显存。第二个数是算力:视觉编码器的 prefill 计算量很大,多路并发同时做视觉编码,GPU 算力先被打满,这时候即使显存还剩着,延迟已经涨上去了。第三个数是可接受延迟:并发从 6 提到 10,吞吐涨了但每个请求的响应时间也涨,如果你的业务要求 P95 在 3 秒内,可能 6 路就是上限。并发数从来不是一个技术极限值,是吞吐和延迟之间你选的那个平衡点。

6.2 一个实用的压测流程

别信任何人给的并发数字,包括我给的,自己压一遍。流程很简单:拿你真实业务的请求样本(图片尺寸、数量、prompt 长度都要真实),从并发 1 开始逐级往上加,每级跑 5 分钟,记录三个指标——GPU 显存峰值、GPU 利用率、P95 延迟。显存峰值触到卡容量的 85% 就停,P95 超过业务红线也停,取两者更早出现的那个点,再往下降一档,就是你的生产并发数。

压测的时候一定要混进极端样本。真实流量里总会有那么几个请求带 20 张图,或者上传一段 10 分钟的视频。这些请求的显存峰值是平均值的好几倍,如果你压测只用平均样本,上线遇到一个极端请求就 OOM。我的做法是在业务层加硬限制:单请求图片数上限、视频时长上限、抽帧数上限,超了直接拒绝或者降级处理。这比事后救火强得多。

七、避坑指南:五个我反复见到的坑

坑一:显存不够就上量化,然后精度掉了不知道

为什么是坑:显存不够,很多人第一反应是量化到 INT8 或 INT4,模型确实塞进去了,但多模态模型对量化的敏感度比纯文本模型高得多。视觉编码器的数值分布和语言模型不一样,粗暴的全模型量化会让细粒度视觉任务(小字识别、密集文字理解、细节比对)精度明显下降。我遇到过一个单据识别项目,INT4 量化后金额字段的准确率从 96% 掉到 87%,客户上线两周才发现对账不平。

怎么避:量化前后必须用你自己的业务测试集跑一遍对比,不要只看模型卡上的通用榜单分数。视觉塔尽量保持 FP16,只量化语言模型部分(现在主流推理框架都支持这种混合精度)。如果业务对精度敏感,别在量化上纠结,直接上大显存卡——A100 40G 比 3090 每月多花 ¥1050,换来的是不用量化的安心,这笔账太值了。

坑二:只算 GPU 不算带宽,卡跑不满还以为卡不行

为什么是坑:前面算过了,5 QPS 带 3 张图就能把 100M 带宽跑满。带宽满了之后请求在网络层排队,GPU 空转,监控上表现为"GPU 利用率只有 30%,但服务延迟很高"。这时候如果误判成算力不够去加卡,钱花了问题一点没解决。

怎么避:上线前算一笔带宽账:QPS × 单请求媒体体积 × 8 = 所需 Mbps。算出来超过带宽的 60% 就该扩容或者优化。同时在监控里把网络入口流量和 GPU 利用率放在一张图上看,两条曲线的关系一眼就能看出瓶颈在哪。客户端预压缩这一招前面说了,优先做,成本最低效果最好。一万网络定制 GPU 升 200M 带宽 +¥400/月(官网明示升级价),需要就加。

坑三:CPU 配太低,GPU 一直饿着

为什么是坑:图片解码、resize、归一化、视频解码抽帧,这些预处理全在 CPU 上跑。视频解码尤其重,一路 1080P 视频软解就能吃满一两个核。8 核的机器跑 4 路视频理解,CPU 先到 100%,GPU 利用率上不去。这个坑特别隐蔽,因为大家买 GPU 服务器时注意力全在卡上,CPU 就用默认配置。

怎么避:图文场景 8 核勉强够,视频场景至少 16 核。一万网络定制 GPU 的 CPU 升到 16 核是 +¥400/月,内存升 128G 是 +¥600/月,相对 ¥2800 的机器成本占比不高,视频业务我一律建议加上。技术层面,能用 GPU 硬解就别软解(NVIDIA 的 NVDEC 单卡能解几十路 1080P),把解码从 CPU 挪到 GPU 的专用解码单元,这个单元跑起来不占用 CUDA 核心,纯赚。预处理也可以做成独立的服务横向扩展,跟 GPU 推理解耦。

坑四:并发数按理论算,上线就 OOM

为什么是坑:理论显存算得刚好,实际跑起来还有显存碎片、框架预分配、极端长请求。特别是 vLLM 这类框架默认会占用 90% 显存做 KV 池,你如果同时还想跑别的进程,直接冲突。多模态请求的长度方差极大——同一个接口,有人传 1 张图,有人传 20 张,显存峰值差十倍。

怎么避:理论值乘 1.25 留余量,这是硬规矩。业务层加硬限制:单请求图片数、视频时长、总 token 数都要有上限,超限的走降级路径(比如视频先降帧率再处理)。推理框架的显存池上限显式配置好,别用默认值。上线后监控显存峰值,连续一周峰值都低于 70% 说明还有扩容空间,超过 88% 就该准备加机器了。

坑五:拿单卡性价比去推集群,或者反过来

为什么是坑:有人算出 A100 40G 单卡 ¥2800 很划算,就想租 8 台单卡机器凑一个"集群",结果发现跨机通信延迟根本没法做张量并行,只能各跑各的;也有人反过来,日请求量才几千,非要上 8 卡集群,八张卡七张闲着。这两个方向的错都很常见。

怎么避:判断标准就一条——你的模型单卡装得下吗?装得下(7B、14B 甚至量化的 72B),就用单卡多实例数据并行,需要多少吞吐就租多少台,横向扩展最省钱最灵活。装不下(72B FP16 全量、更大的视觉塔),必须整机多卡走 NVLink,这时候单卡机器凑不出来,只能上整机。中间还有个判断:如果你的业务需要多个模型同时常驻(视觉理解 + OCR + 向量化),整机的大显存池也比多台单卡方便。

八、三种团队规模的成本账,直接抄

8.1 初创验证期:月预算三千以内

目标是把多模态能力跑通、验证业务价值,不追求并发。方案:一万网络 A100 40G 定制机 ¥2800/月(官网价),单卡跑 Qwen2-VL-7B,并发 6 路够支撑内测和小范围灰度。想更省的用 AI 算力云 RTX 3090 整卡 ¥1750/月(官网价)先跑通,只做图文不碰视频。年付 8 折的话 A100 40G 全年不到 ¥2.7 万,这个投入换一个能落地的多模态能力,在 2026 年算相当便宜。

8.2 业务成长期:月预算一万到两万

日请求量几十万,要保 P95 延迟,要有冗余。方案:4 到 6 台 A100 40G 定制机做数据并行,前面挂负载均衡,月成本 ¥1.12 万到 ¥1.68 万(按官网价 ¥2800 计),年付 8 折能压到 ¥0.9 万到 ¥1.34 万区间。这个方案的好处是故障域小——一台挂了其他还在跑,配合一万网络的硬件故障 10 分钟自动迁移,可用性比单台整机好。横向扩容也简单,加机器就行,不用重新规划架构。

8.3 规模化期:月预算三万以上

日请求量百万级,或者要跑 72B 全量模型,或者视频理解并发要求高。方案:8 卡 A100 80G 整机,预估价格约 ¥2.5 万–4 万/月(非官方报价,实际以下单时核算为准),按年付 85 折推算全年约 ¥25 万–40 万(预估,以咨询为准)。真要追求极致吞吐、模型要跑 FP8 的,H100 8 卡整机月 ¥8–12 万(官网明示档,年付 85 折),这一档的价值主要在 FP8 让吞吐翻几倍,以及 3350GB/s 的 HBM3 带宽让长文本生成快得多。我的判断是:如果你的多模态业务还没到需要 FP8 才能扛住的量,A100 80G 集群是更理性的选择,省下的钱够你多养半个算法团队。

8.4 关于服务这一块,实话实说

一万网络深耕 IDC 19 年(2007 年成立),总部在深圳南山,自营机柜最快 1 分钟上架,资质上有增值电信业务经营许可证、国家高新技术企业、专精特新中小企业。我推荐它的实际理由很具体:GPU 机器交付时工程师 1 对 1 把 CUDA、cuDNN、TensorRT、PyTorch、TensorFlow 装好,开机能直接跑——这一步自己折腾过的人都知道有多耗时间,版本对不上能卡你两天。7×24 中文工单平均 5 分钟响应,硬件故障 10 分钟内自动迁移,免费系统盘每日 3 份快照、30 秒回滚,5–20G 免费流量防护。网络是 BGP 多线加 CN2 GIA 回国,多节点覆盖华南、华东、华北、香港和海外。

合规这块我得说清楚:如果你的多模态业务涉及医疗影像、金融单据这类敏感数据,需要特定合规资质的,一万网络可以协助对接合规机房、提供合规架构建议,具体资质要求要和商务确认清楚,别听任何人拍胸脯保证等保级别——官网没明示的东西,写在合同里才算数。

九、常见问题 FAQ

Q1:跑多模态大模型到底需要多少显存?

A1:按模型规模分三档给你。7B 到 8B 的图文理解模型(Qwen2-VL-7B、InternVL2-8B),FP16 权重含视觉塔约 16.5G,加上 KV Cache 和余量,24G 是最低门槛但很紧,40G 才舒服;13B 到 14B 的,FP16 权重约 30G,40G 卡能跑但并发上不去,建议 80G;72B 级别的,FP16 需要 145G,单卡不可能,要么 INT4 量化压到 40G 左右塞进 A100 40G,要么多卡张量并行。视频理解统一往上加一档——视频抽帧产生的视觉 token 是图文的好几倍,显存峰值高且突发。我的建议很直接:预算允许就 40G 起步,一万网络 A100 40G 月付 ¥2800(官网价),比 3090 每月多 ¥1050,换来的是不用做量化取舍、不用天天盯 OOM 告警。

Q2:并发数具体怎么配,有没有简单算法?

A2:三步。第一步算可用显存:总显存减模型权重减 2G 系统开销,再乘 0.75 留余量。第二步算单请求 KV 开销:7B 模型每 1000 token 约 0.5G,14B 约 1G,72B 约 2.5G,把你的平均输入长度(记住要含视觉 token,一张图算 1000 到 3000)代进去。第三步相除。举例:A100 40G 跑 7B,(40−16.5−2)×0.75≈16G 可用,单请求 5000 token 约 2.5G,得 6 路。这只是显存上限,实际还要看算力和延迟要求——并发提上去吞吐涨但 P95 延迟也涨,最终值要压测确定。压测时务必混入 20 张图、10 分钟视频这类极端样本,同时在业务层给单请求加硬上限。

Q3:A100 40G 和 RTX 3090 差 ¥1050,值得吗?

A3:做多模态的话,值,而且是这张价目表里最值的一跳。差别不止显存 24G 对 40G:显存带宽 936GB/s 对 1555GB/s,decode 阶段生成速度差六成以上;A100 有 HBM2e 和完整的 TF32/FP16/INT8 支持,多卡还能上 NVLink;3090 是消费卡,长期满载跑推理的稳定性和散热都不如数据中心卡。实际差别体现在:3090 上跑 7B 多模态只能 2–3 路并发且要小心 OOM,A100 40G 能稳 6–10 路,还能试 72B INT4。折成单位并发成本,A100 反而更便宜。3090 的合理场景是模型选型期、离线批处理、纯图文轻量任务——一万网络算力云 3090 整卡 ¥1750/月(官网价),拿来做验证很合适。

Q4:视频理解为什么比图文贵这么多?

A4:三笔账都涨。显存上,视频要抽帧,32 帧对应 8000 多视觉 token,是单图的十倍,KV Cache 跟着涨十倍,而且峰值突发;带宽上,一段 100MB 视频在 100M 带宽下要传 10 秒,图文一张图 200KB 几乎不占;CPU 上,视频软解一路 1080P 吃一两个核,8 核机器跑不了几路。所以视频场景的合理配置是 A100 40G 起步、CPU 升 16 核、带宽升 200M、数据盘升 1T,一万网络这几项升级价分别是 +¥400、+¥400、+¥300/月(官网明示升级价),加上基础 ¥2800 大约四千出头。真要做多路实时视频分析,直接上 8 卡 A100 80G 集群,预估价格约 ¥2.5 万–4 万/月(非官方报价,以下单核算为准)。

Q5:多模态推理的成本怎么算才不会算漏?

A5:五项加起来。GPU 租金(一万网络 A100 40G ¥2800/月官网价,年付 8 折)、带宽(含 100M,升 200M +¥400)、CPU 内存硬盘升级(视频场景常见 +¥1100 左右)、冗余(生产环境至少 N+1,别单点)、以及最容易漏的调试试错成本(选型期租算力云单卡跑对比,3090 ¥1750、A100 整卡 ¥2500,官网价)。按单请求成本折算更直观:一台 ¥2800 的 A100 40G,6 路并发、每请求 2 秒,理论日处理约 26 万请求,单请求成本约 0.0004 元。这个数字比调用商业多模态 API 便宜一到两个数量级,这也是为什么日请求量过万的业务基本都会转自建推理。

Q6:单卡多实例和多卡张量并行,我该选哪个?

A6:判断标准只有一条——模型单卡装得下吗。装得下就选单卡多实例(数据并行),每卡一个完整模型,前面挂负载均衡,零通信开销、吞吐线性叠加、故障域小、扩容简单,7B 到 14B 的多模态模型在 40G 卡上都属于这一类。装不下(72B FP16 全量)才用张量并行,而且必须是 NVLink/NVSwitch 全互连的整机——PCIe 版多卡做 TP=2,通信开销能吃掉一半加速收益,实际只有单卡的 1.3 到 1.5 倍。一万网络 H100 8 卡是 SXM 形态、NVLink + NVSwitch 节点内 900GB/s(官网明示配置),做大模型张量并行才有意义。中间情况:需要多个模型同时常驻的复合业务,整机大显存池更方便。

Q7:租多模态推理服务器,机房节点怎么选?

A7:看你的用户和数据在哪。用户在国内、数据也在国内,选华南(深圳)或华东节点,BGP 多线延迟最低,一万网络这几个节点都有 GPU 定制。有海外用户或者数据出境需求的,香港节点 CN2 GIA 回国延迟低且免备案,新加坡和洛杉矶节点适合覆盖东南亚和北美。多模态业务对上传带宽敏感,节点离用户越近上传越快,这比 GPU 快那么一点点重要得多。真实场景里我见过把服务部署在洛杉矶、用户全在深圳的方案,光图片上传就多花两秒,用户体验直接崩了。带宽和线路先定,卡型后定,顺序别搞反。

Q8:按月租还是年付,多模态项目怎么选?

A8:分阶段。选型验证期一律月付或者用算力云弹性档,这个阶段你可能三周换两次模型、发现 40G 不够要换 80G,锁年付就是自己给自己上枷锁。业务方向定了、请求量稳定了,转年付——一万网络 GPU 定制年付 8 折,A100 40G 折后约 ¥2240/月,一年省下大约两个半月的租金;季付 95 折适合过渡期。同账户复购再减 ¥100/月且可叠加折扣,扩容时记得提。签年付前把两件事问清楚:中途能不能升配(多模态业务显存需求经常涨),以及项目提前结束怎么处理,写进合同再签。

十、总结:把两个数算准,剩下的都是细节

多模态推理服务器选型没那么玄,回到标题上说的那两件事——显存和带宽。显存决定你能跑多大的模型、开多少并发,算法是"权重 + KV × 并发 + 缓存,再乘 1.25",别用显存除模型大小那种错算法;带宽有三层,公网带宽决定图片视频能不能及时喂进来(图文 100M 起、视频 200M 底线),显存带宽决定吐字速度(3090 的 936GB/s 和 A100 的 1555GB/s 差六成),机内互联决定多卡切分划不划算(PCIe 做张量并行基本是浪费)。这三层任何一层卡住,GPU 都会空转,然后你会误判成"卡不行"。

配置上我的态度很明确:7B 到 14B 的图文理解,一万网络 A100 40G 定制机 ¥2800/月(官网价)是最舒服的起点,40G 显存这个位置往下处处受限、往上单卡无选择;有视频理解需求的把 CPU、带宽、硬盘一起升上去,四千多的月成本换来的是不用天天救火;日请求量到百万级、或者要跑 72B 全量、或者多路视频并发的,上 8 卡 A100 80G 集群,预估价格约 ¥2.5 万–4 万/月(非官方报价,实际以下单时核算为准)。H100 那一档留给真正需要 FP8 吞吐的团队,多数多模态业务还用不到。加上一万网络 19 年(2007 年成立)的 IDC 积累、深圳自营机柜 1 分钟上架、工程师 1 对 1 把 CUDA 全栈装好、硬件故障 10 分钟自动迁移,从验证期的算力云单卡到规模化的多卡整机都能接得上,不用中途换服务商重做一遍架构。

数据来源:本文配置与价格参考自一万网络官网公开页面(人工定制 GPU 公告页、AI 算力云产品页、H100 物理机方案页、裸金属与香港自营服务器页),网址 https://www.idc10000.net/ 。文中标注「官网价」的为官网公开明示报价,标注「预估」的为按行业区间与配置对比推算的参考值(非官方报价),具体以签约时最新报价与合同为准。显存占用、并发数、延迟等实测参考值来自实际项目环境,不同模型版本、推理框架、输入分布下会有差异,上线前请以自有业务数据压测结果为准。


上一篇:2026 大模型私有化安全推理 TEE 可信计算:内网隔离+合规部署避坑全攻略

下一篇:2026 AI 代码助手代码大模型 CI 推理服务器租用:并发编译+缓存配置全攻略