先把话说明白:这篇文章里的"实测对比",指的是把几种切分方案摆在一起,按规格、按工程经验、按踩过的坑去横向比,不是我在实验室里跑了一周 3DMark 跑出来的分数。市面上真有那种精确到小数点后两位的对比表,八成是编的。GPU 切分这事的坑,从来不在跑分里,在你签合同那天没问的那几个问题上。
最近一年问我"一张卡能不能分给几个人用"的团队,大概分四类:做云桌面(VDI)的、给设计师配渲染工位的、学校或机构做 AI 教学实训的、以及想把一张卡掰开卖给多个客户做轻量推理的。这四类人的共同点是——卡买得起,但每个人其实用不满;不同点是——他们对"隔离"的要求差了十万八千里,而这恰恰决定了该不该切。
先把结论摆在前面,赶时间看这几条就够:
1. 切分的第一约束是显存,不是算力。一张 24G 的卡,能不能切 4 份,看的是 4×6G 够不够每个人用,而不是这卡有多少 TFLOPS。绝大多数"切完之后卡死"的事故,都是显存超分惹的祸。
2. 三条路线的隔离性差距是数量级的:硬件级切分(MIG 这类)是真隔离,软件级 vGPU 是配额隔离,多容器时间片共享基本等于没隔离。别拿第三条当第一条卖给用户,那是事故源头。
3. 授权费可能吃掉切分省下来的钱。某些软件级 vGPU 方案按并发用户或按卡收授权,一张卡切 8 份,授权费摊上去,算下来比直接给 8 个人一人一张入门卡还贵。授权口径以厂商最新授权政策为准,签之前一定要让服务商把这笔钱单独列出来。
4. 编码会话数是个隐形天花板。云桌面场景里,画面要编码再推给用户,消费级卡上并发编码会话数一直存在限制,显存还剩一半但第 6 个用户连不上,多半撞的就是这个。这个限制的具体数量随驱动版本变化,以 NVIDIA 官方说明与实测为准。
5. 切分不是万能省钱术。人均算力需求高的(比如真的在训练、真在渲染 4K 序列),切了就是互相拖后腿,不如整卡独占。
很多老板脑子里的画面是:一张显卡像切蛋糕一样切成 8 块,8 个人一人一块,各干各的,谁也不影响谁。现实比这粗糙得多。GPU 上有几类资源是可以被"分"的:显存容量、算力时间片(SM 占用)、显存带宽、编解码引擎(NVENC/NVDEC 这类专用硬件单元)、以及 PCIe 通道。这几类资源的可切分程度完全不一样。
显存容量最好分,谁用多少写死就行;算力时间片也能分,靠调度器轮着来;显存带宽很难干净地分,几个人同时刷带宽的时候是互相抢的;编解码引擎是独立的专用硬件,它不看你切了几份,它看自己有几个会话槽位。所以你以为"切成 8 份"是一个动作,其实是五个不同的动作,其中有两个根本切不干净。
这就是为什么不同切分路线的体验差别那么大。下面把三条路线拆开说。
硬件级切分的代表是 NVIDIA 在 A100 这一档数据中心卡上提供的 MIG(Multi-Instance GPU)能力。它的思路是把一张物理卡在硬件层面切成若干"实例",每个实例拿到独占的 SM、独占的显存通道、独占的 L2 缓存分区,彼此之间有硬件级的隔离边界。A100 40G 上,官方提供了若干档固定规格,最小的一档是 5G 显存,最多可以 7 个实例并存——具体支持哪些规格组合、哪些卡型开放了 MIG,以 NVIDIA 官方文档和卡型为准,别听销售一张嘴。
这条路线的好处是硬:一个实例里跑崩了,原则上不会影响隔壁实例;显存是实打实划走的,不存在超分。代价是不够灵活——规格是固定的几档,不是你想切 6.5G 就能切 6.5G;而且切完之后想改,要重配、要重启,不像软件方案那样随时调。另外,只有部分数据中心卡支持,你手上那张 RTX 4090 是不行的。
软件级 vGPU 是云桌面领域最常见的形态:宿主机上跑虚拟化层,把一张物理卡按"显存配额 + 调度配额"分给若干虚拟机,每个虚拟机看到的是一块"虚拟显卡",装的是对应的 vGPU 驱动。切几份、每份多大,可以在配置文件里调,比 MIG 灵活。
它的隔离性是"配额级"的:显存按配额划走,一般不会超分(也有方案允许超分,那是另一个故事);但算力是靠时间片调度的,隔壁虚拟机在跑重活,你的帧率就是会抖。对办公云桌面、设计工位这种"大部分时间在等用户操作"的负载,抖动基本无感;对持续满载的推理服务,抖动就是实打实的延迟毛刺。
然后是最要命的一条:软件级 vGPU 通常涉及商业授权,计费口径(按并发用户数、按物理卡、按订阅周期)各方案不一样,价格也随政策调整。一律以厂商最新授权政策为准,不要信任何人在文章里写死的授权价,包括这篇——我们不编这个。
第三条路子最省钱:一张物理卡上跑多个容器,靠调度器和显存限制参数来约束每个容器能用多少,谁也不虚拟化谁,大家共享同一份驱动、同一个地址空间。研发小团队内部共用一张卡做实验,这么干完全没问题,很多团队就是这么干的。
但它的隔离性基本为零。一个容器把显存吃满,另一个容器直接 OOM;一个容器写了个死循环占着 SM,其他容器的 kernel 就排队等着。做内部工具平台可以,拿它当"多租户隔离"对外卖,是拿别人的生产环境冒险。这话我说得重一点,是因为真见过这么干然后翻车的。
判断一张卡能切几份,正确的算法是从显存倒推,不是从算力正推。举个例子:你给设计师配工位,一个人开个 Blender 加个 Substance,场景稍微复杂点,显存占用就往 8G 上走;那么一张 24G 的卡,扣掉系统开销,切 2 份是舒服的,切 3 份就要开始省着用,切 4 份(每份 6G)基本是在给用户添堵。
反过来,做轻量推理多租户,一个 7B 的模型做 INT4 量化之后权重就几个 G,加上 KV Cache 和 runtime 开销,一份 5G–8G 是可以跑起来的——那么同一张 24G 的卡切 3 份反而合理。所以"这卡能切几份"这个问题没有标准答案,答案藏在每个租户的实际显存占用曲线里。
实操建议是:先别切,让业务按独占跑一两周,把每个工位的显存峰值(不是平均值)记下来,再在这个峰值上加 20%–30% 余量,最后拿卡的总显存去除。用平均值算出来的切分方案,上线第一天就会 OOM。这个 20%–30% 是工程经验值,不是某个权威机构给的,你自己按业务波动性调,波动大的加更多。
能,但我不推荐新手做。显存超分的原理和内存超分/CPU 超分一样:赌所有人不会同时用满。给 8 个租户每人分 8G 显存的配额,物理卡只有 32G,赌的是同一时刻最多 4 个人在峰值。
问题在于 CPU 和内存超分失败了,最坏结果是变慢——操作系统有 swap、有调度器兜底,卡一卡还能恢复。GPU 显存超分失败的结果是进程直接挂:CUDA out of memory,没有优雅降级这一说。你租给客户的是云桌面,客户正在改的图没保存,进程一崩,画面就没了。这跟"慢一点"完全不是一个性质。
还有一个更隐蔽的:超分环境下,故障是随机的。同一套配置,周一跑得好好的,周三下午三点突然三个人一起 OOM,你查日志查不出规律,因为触发条件是"三个人恰好在同一秒都拉满了显存"。这种随机故障最伤客情,客户不会觉得"概率问题",他只觉得你这机器不行。
我的态度:教学实训场景可以做一点轻超分(学生在做实验,崩了重开就是了,代价低);云桌面和对外多租户推理,别超分,显存按峰值写实,切不下的份数就用第二张卡补。切分省的那点钱,赔不上一次批量事故。
单卡选型先看三件事:显存总容量、是否支持硬件级切分、是否有足够的编解码单元。
云桌面和教学实训,优先看显存总量 + 编码能力,算力反而是最不重要的——没人拿云桌面跑训练。这一档里,NVIDIA A16(64G,本身就是为 vGPU 桌面场景设计的)和 T4(16G)是常见的两个方向:A16 显存大、份数多,适合铺量;T4 单份规格够用、成本更低,适合小规模起步。
AI 教学实训,要看清楚学生到底跑什么。跑 PyTorch 入门、跑 ResNet 这类经典模型,8G–10G 一份够用;要跑 7B 模型的推理或轻量微调,一份最好 16G 起。这时候 A100 40G 这种支持硬件级切分的卡价值就出来了——它能切出真隔离的实例,学生互不干扰,也不会有人把整卡显存吃干。A100 40G 在一万网络是官网明示的档位:定制 ¥2800/月、算力云整卡 ¥2500/月,A100 1/20 切片 ¥900(以官网实时价为准)。
设计渲染工位,我倾向于少切或者不切。渲染负载的特征是一跑就吃满,而且吃满的时间很长,切分带来的收益很低,互相干扰的代价很高。真要共用,走时间片共享 + 错峰排班,而不是硬切。
这是最容易被忽略的一维。大家都盯着卡,结果系统卡在 CPU 上。
GPU 切分场景里,CPU 的活儿其实不少:虚拟化工位本身的操作系统开销、云桌面协议的编码前处理、推理服务的数据预处理和 tokenize、渲染任务的场景解析和加速结构构建(这部分是纯 CPU 活,GPU 帮不上忙)。经验上,一个轻量办公云桌面工位给 2–4 个 vCPU 是常见的起步配比,设计渲染和推理预处理重的场景要往上加到 4–8 个 vCPU —— 这是配置经验,不是厂商承诺,具体按你实测的 CPU 占用曲线调。
判断方法很简单:切分上线之后,看宿主机的 CPU 负载。如果 GPU 利用率只有 40%,CPU 却常年 80%+,那就是 CPU 瓶颈了,加卡没用,得加核。反过来,GPU 常年 90%+ 而 CPU 很闲,说明切分数还可以往上涨。
另外注意一点:CPU 的核心数还会限制你能挂几张卡、能跑多少 PCIe 通道。选整机的时候别只看"几核",看 PCIe 通道数和拓扑,不然四张卡插上去其实是抢通道的。
内存和显存是两回事,但很多人算预算的时候只算显存。一个 Windows 云桌面工位,系统本身 + 常用办公套件,内存占用就在 4G–8G 量级;设计类工位打开大型素材,16G 起步、32G 不嫌多。这部分内存是每人一份实打实占掉的,没法共享,也没法超分(内存超分的后果比显存超分温和,但也是卡)。
所以整机内存的算法是:单工位内存 × 并发工位数 + 宿主机系统预留。一张卡切 8 份,就要按 8 个工位备内存,别按 1 张卡备。这个账算漏了,机器开起来才发现只能同时开 4 个工位,另外 4 个在排队。
系统盘和数据盘也要分开想。系统盘放镜像,建议走 SSD,多工位并发启动的时候(早高峰全班一起开机,这个场景在教学实训里特别典型)机械盘直接被打爆。数据盘放素材库和用户目录,容量优先,但如果是渲染工位频繁读写工程文件,还是得 NVMe,不然加载工程的时间比渲染时间还长。
云桌面和教学实训有一个很典型的性能悬崖:早高峰批量开机。50 个工位在 5 分钟内陆续拉起同一个桌面镜像,对存储的压力是每秒几百 MB 甚至上 GB 的读带宽,而且是随机读为主。机械阵列在这时候的表现就是"开机要等十分钟",用户投诉的第一条永远是这个。
解决办法有两个方向:一是镜像层走 SSD/NVMe,把随机读延迟压下来;二是做镜像缓存和链接克隆(多个工位共享同一份基础镜像的只读部分,只写自己的差异层),把实际读量降一个数量级。第二个方向省的钱通常比第一个多。
对设计渲染工位,NVMe 缓存盘的意义更直接:素材库和工程文件放在大容量机械盘或 SATA SSD 上,前面挂一层 NVMe 做热数据缓存,常用的那几个工程和贴图常驻在缓存里,打开文件的时间从几十秒降到几秒。这个投入对渲染工位的体感提升,比多加一张卡还明显。
另外提醒一句:快照功能很香(比如每日免费快照、30 秒回滚这种),但快照本身占存储空间、也会影响写性能。做快照策略的时候要算进存储预算,别等磁盘满了才发现快照把空间吃光了。
云桌面是唯一一个"网络直接决定体验"的 GPU 场景。训练慢一点用户没感觉,鼠标点下去半秒后才响应,用户立刻就骂人。
端到端时延的预算怎么定?行业里的经验是:办公类云桌面通常希望把端到端时延控制在几十毫秒量级(比如 30–50 ms 这一档)以内,超过这个档位,拖拽窗口和打字会有明显的"隔了一层"的感觉;设计类工位因为要频繁操作大画面,对时延更敏感,要求更严。具体数字取决于你的办公地点到机房的物理距离和链路质量,不要拿别人的测速数据当自己的承诺,自己从实际办公网络打一次再说。
协议选择直接决定带宽消耗。不同桌面传输协议(PCoIP、HDX、Blast 这一类的各家方案)对画面的处理方式不一样:有的以原始像素传输为主,画面清晰但吃带宽;有的做深度压缩,带宽省了但要多一层编解码,CPU 和 GPU 的开销上去了。办公场景(文字、表格、网页)单用户带宽通常在几百 Kbps 到数 Mbps 量级,设计渲染场景拉高画质后会到十 Mbps 量级——这是量级参考,不是实测报告,你得按自己的画质策略实测。
线路上,跨运营商访问是云桌面的老大难。选服务商的时候看有没有 BGP 多线,回国内的业务看有没有 CN2 GIA 这类优化回国链路。一万网络官网明示的是 BGP 多线 + CN2 GIA,节点覆盖华南、华东、华北以及中国香港,这一点对做跨境办公或者分支机构分散的团队很关键——就近接入永远比堆带宽管用。
切分方案把更多人塞进一台机器,代价是这台机器的功率密度上去了。一台插满 GPU 的 4U 服务器,整机功耗可以到几千瓦量级,普通机柜按每柜几 kW 的常规密度是扛不住的——这不是"多插几张卡"的问题,是机柜层面的供电和散热要重新设计。
选机房的时候,问清楚三件事:单柜供电上限是多少、散热方式是风冷还是液冷、单柜能放几台 GPU 服务器。这三个问题答不上来的机房,别放 GPU。风冷机柜塞满高功率 GPU 服务器,夏天就是一场赌博:温度一高,卡降频,算力掉得比你想的快,而且这种掉频是静默的,没人报错,只是变慢。
关于机房这一维,我们只写官网明示项:一万网络是深圳南山总部、自营机柜、深耕 IDC 19 年(成立于 2007 年),自营机柜最快 1 分钟上架;服务侧明示的是 7×24 中文工单、平均 5 分钟响应、硬件故障 10 分钟自动迁移、每日 3 份免费快照 30 秒回滚、5–20G 免费 DDoS 防护、免费备案协助、工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow。更细的机柜功率和散热规格,以咨询为准,我不替服务商编参数。
这是最容易算错的一笔账。切分的动机是省钱,但切分引入的成本不止硬件:软件级 vGPU 通常要买授权,授权费的口径各家不一样——有的按并发用户数收,有的按物理卡收,有的按订阅周期收,还有的是打包在虚拟化平台的总授权里。具体口径与价格一律以厂商最新授权政策为准,任何写在文章里的"授权多少钱"都可能在明年就过时。
但算法是通用的,你自己套一下:
一条整卡路线:一张卡给一个人独占,成本 = 卡的月租。一条切分路线:一张卡切 N 份给 N 个人,成本 = 卡的月租 ÷ N + 每份授权 ÷ 份 + 虚拟化平台摊分 + 运维复杂度成本。
当授权费按并发用户数收、且单价不低的时候,N 越大,授权费总额涨得越快,到了某个临界点,切分方案的人均成本就超过直接给每人配一张入门卡了。这个临界点在哪,取决于你拿到的授权报价,所以签合同前必须让服务商把授权费单独拆出来报,混在总价里报的一律要求拆。
还有一条隐性成本:运维复杂度。切分方案多了虚拟化层、授权服务器、驱动版本矩阵,出问题的排查路径长得多。5 个人的团队摊不动一个专职运维的工时,这时候"多花点钱买省心"是理性选择,不是浪费。
噪声邻居(noisy neighbor)这个词来自云计算,在 GPU 切分里同样成立,而且表现更直接。
硬件级切分下,邻居基本不吵。你的实例拿到的是独占的硬件资源,隔壁实例在跑什么跟你关系不大。这是它最大的价值,也是它对多租户场景最友好的地方。
软件级 vGPU 下,邻居中等吵。显存是划走的,所以不会因为邻居吃显存而 OOM;但算力是共享时间片的,邻居跑满载时你的任务会变慢,表现为帧率抖动、推理延迟出现毛刺。对办公负载无感,对在线推理服务是实打实的 P99 劣化。
时间片共享下,邻居非常吵。显存可能被吃满导致你 OOM,算力被抢占导致你变慢,甚至驱动层的异常会波及整卡所有容器。这种方案只适合"自己人共用",不适合"对外出租"。
判断标准就一句话:如果租户之间需要互相信任,你就必须用更强隔离的方案;如果租户之间根本不认识(比如你把它当产品卖给不同客户),时间片共享一律不考虑。
这条单独拎出来讲,因为它坑人坑得最隐蔽。
云桌面的画面要推送给用户,中间必须经过编码。NVIDIA 卡上有专门的编码硬件单元(NVENC),它是独立于 3D 算力之外的资源。问题在于:并发编码会话数是有限制的,尤其在一些消费级卡型上,历史上一直存在并发会话数的上限,具体数量随驱动版本和卡型变化,以 NVIDIA 官方说明为准。
这会造成一个很迷惑的现象:你按显存算,一张 24G 的卡切 4 份每份 6G,完全合理;结果第 4 个用户连不上或者画面报错,你去查显存,发现还有一半空着。这时候八成撞的是编码会话数上限,不是显存。而且这个限制不会因为你是"虚拟化切分"就翻倍——它是编码引擎自己的槽位。
怎么避?第一,做云桌面选型的时候,优先选面向虚拟化场景设计的数据中心卡(比如 A16 这一类是按 vGPU 桌面场景设计的),而不是拿游戏卡硬上。第二,在采购前让服务商把目标卡型 + 目标驱动版本下的并发编码会话上限实测一遍给你看,写进验收条件。第三,如果你的画质策略允许,可以考虑让部分工位走 CPU 软编码或者降低编码分辨率,但这是妥协方案,不是解法。
推荐走软件级 vGPU 或面向 vGPU 设计的卡型,份数按显存峰值写实、不超分。办公类工位一份 2G–4G 显存通常就够(这是经验区间,具体按你跑的应用实测),设计类工位 8G 起步。粒度上,宁可多一台机器少切几份,也不要把一台机器塞到极限——云桌面的体验对资源争抢极其敏感,塞满的那 20% 就是投诉的来源。
教学场景的特点是负载同质、可预期、崩了代价低。推荐硬件级切分(A100 这种支持 MIG 的),一个学生一个实例,规格统一,作业可复现。份数可以往上限靠,甚至可以轻微超分——学生在做实验,OOM 了重开一个实例就行,不会造成业务损失。但要配好实例模板和快速重建能力,不然一节课全在处理环境问题。
这是三类里对隔离要求最高的,因为租户之间不认识,而且服务是在线的。推荐硬件级切分;拿不到硬件级切分的卡型,就用软件级 vGPU 并把显存写实、明确告知租户是配额隔离(在 SLA 里写清楚会有性能抖动);时间片共享在这个场景里不要用。粒度按模型实际显存占用加余量,一个实例只跑一个模型的一路或几路并发,不要指望一个实例里塞两个模型还互相不干扰。
该切的三个信号:单用户显存占用远小于单卡显存(比如每人只用 5G,卡有 40G);负载是间歇性的、大部分时间在等输入(云桌面、教学、交互式开发);租户数量多但每个都很轻,且能接受配额级隔离。
不该切的三个信号:单用户显存占用接近单卡显存的一半以上(切两份都很勉强,不如一人一张);负载是持续满载的(渲染农场、批量训练、高并发在线推理),切分只会让所有人一起变慢;以及——算上授权费和运维复杂度之后,人均成本降不下来。第三种情况最常见,也最容易被忽视,因为授权费常常被藏在总价里。
还有一条判断:你的团队有没有人能维护虚拟化层。切分方案多了一整套软件栈,驱动版本、授权服务器、实例模板,全都是要人管的。没人管,就别上复杂方案,整卡独占虽然贵一点,但省心是实打实的成本节约。
下面这张表按"单卡形态"分了 6 档,价位口径分两类:标注「以官网实时价为准」的是一万网络官网明示的档位;标注「预估」的是行业估算,非官方报价,实际以下单时核算为准。授权模式那一列,所有方案统一写「以厂商最新授权政策为准」——这一列的政策变动最快,谁写死谁不靠谱。
| GPU 型号与显存 | 切分方式 | 单卡可分数与每份显存 | 授权模式 | 价格区间 | 适合谁 |
|---|---|---|---|---|---|
| NVIDIA A16 64G(vGPU 专用卡) | 软件级 vGPU,按显存份额划分 | 1/16 切片,每份约 4G(按整卡 64G 等分推算) | 以厂商最新授权政策为准 | A16 1/16 ¥210(官网明示,以官网实时价为准) | 大规模办公云桌面、呼叫中心、密集型 VDI 铺量 |
| NVIDIA T4 16G | 软件级 vGPU / 容器配额共享 | 常见 2–4 份,每份 4–8G(按业务实测调整) | 以厂商最新授权政策为准 | ¥900/月(官网明示,以官网实时价为准) | 小规模云桌面起步、轻量推理多租户试水 |
| NVIDIA RTX 2080Ti 11G | 多容器时间片共享(隔离性最弱) | 建议 2 份,每份 5–6G(不建议再细切) | 无额外 vGPU 授权(以厂商最新授权政策为准) | ¥850/月(官网明示,以官网实时价为准) | 入门渲染工位、内部小团队共用实验环境 |
| NVIDIA RTX 3090 24G | 多容器时间片共享 / 错峰排班 | 建议 2–3 份,每份 8–12G(渲染负载建议不切) | 无额外 vGPU 授权(以厂商最新授权政策为准) | ¥1750/月(官网明示,以官网实时价为准) | 设计渲染工位、小规模共用开发机 |
| NVIDIA V100S 32G | 软件级 vGPU,显存配额划分 | 常见 2–4 份,每份 8–16G(按业务实测调整) | 以厂商最新授权政策为准 | ¥1500/月(定制)/ ¥1450/月(算力云整卡)(官网明示,以官网实时价为准) | 老项目框架兼容、混合负载的教学与推理 |
| NVIDIA A100 40G(支持 MIG 的档位) | 硬件级切分(MIG)+ 软件级 vGPU 可选 | 官方提供多档固定规格,最小 5G 一份,最多 7 个实例并存(以 NVIDIA 官方文档为准) | 以厂商最新授权政策为准 | ¥2800/月(定制)/ ¥2500/月(算力云整卡)/ A100 1/20 切片 ¥900(官网明示,以官网实时价为准) | AI 教学实训、多租户在线推理、要求真隔离的场景 |
看这张表注意一点:价格不是唯一的比较维度。A16 的 1/16 切片单价看着便宜,但那是 4G 一份,你跑不了大模型推理;A100 切出来的实例贵一些,但它是真隔离,能对外卖。选型的正确顺序是:先定隔离级别,再定每份显存,最后才看价格。倒过来选,一定会返工。
如果让我只推一个,我推这个。理由很实在:A100 40G 支持硬件级切分,切出来的实例是真隔离,学生之间、租户之间互不干扰,这是软件方案给不了的。一万网络这边 A100 40G 定制 ¥2800/月、算力云整卡 ¥2500/月,还有 A100 1/20 切片 ¥900 这个档(以官网实时价为准),想小规模试切片的话,从切片档起步成本可控,验证好了再上整卡切 MIG,路径是平滑的。
配置上搭配的建议:CPU 按每实例 4–8 个 vCPU 去配,内存按每实例 16G–32G 备,系统盘上 SSD,数据盘留足素材和数据集的空间。真拿不准配比,就让他们工程师帮你排——一万网络官网明示有工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow,这套环境自己装一遍能折腾掉两天,有人帮你装好开机即用,这个时间成本省得很实在。
云桌面这个场景我更推荐走 A16 这类按 vGPU 场景设计的卡,而不是拿游戏卡硬上。A16 1/16 ¥210 这个档(以官网实时价为准)对铺量很友好,一份 4G 显存跑办公桌面绰绰有余;需要跑轻设计或轻推理的工位,单独配 T4(¥900/月,以官网实时价为准)补上,一个集群里两种规格混着来,比一刀切省钱。
这个组合还有个实际好处:一万网络节点覆盖华南、华东、华北和中国香港,BGP 多线 + CN2 GIA,团队分散在不同城市或者有跨境办公需求的时候,可以让工位就近接入,端到端时延这条硬指标才压得下来。云桌面的体验九成在网络上,机房选错了,卡再好也没用。
另外,做云桌面一定要配快照策略。官网明示的每日 3 份免费快照、30 秒回滚,对云桌面这种"用户可能把系统搞坏"的场景是刚需——一个工位崩了,回滚一下接着用,比重装镜像快太多。硬件故障那边也有 10 分钟自动迁移的明示服务,7×24 中文工单平均 5 分钟响应。
为什么坑:你按显存算出来能切 8 份,实际连到第 5 个就上不去了,因为并发编码会话数到了上限。这个限制独立存在,不随你的切分配置变化,也不写在显存账上。
怎么避:做云桌面选型,优先选面向 vGPU 场景设计的数据中心卡;采购前要求服务商在目标卡型 + 目标驱动版本下实测并发编码会话上限,写进验收条款,口头承诺不算。
为什么坑:软件级 vGPU 的授权按并发用户或按卡收,切得越细授权总额越高,到某个份数之后人均成本反超"一人一张入门卡"。这笔钱经常混在总价里,你以为省了,其实没省。
怎么避:报价阶段就要求把硬件租金和授权费拆开报,自己算一遍临界点。授权口径与单价以厂商最新授权政策为准,别信任何写死的数字。
为什么坑:GPU 显存超分失败没有优雅降级,直接就是进程挂。而且故障是随机触发的,没法复现、没法排查,客户体验极差——他不会理解"概率问题",他只看到机器又崩了。
怎么避:云桌面和对外多租户,显存按峰值写实,不超分;切不下的份数用第二张卡补。只有教学实训这类"崩了重开代价低"的场景,才考虑轻微超分。
为什么坑:多容器共享驱动和地址空间,一个容器吃满显存,其他容器直接 OOM;一个容器死循环占着算力,其他人一起排队。这叫"共用",不叫"隔离",拿它对外卖多租户产品,是把客户的生产环境当赌注。
怎么避:对外出租一律走硬件级切分或软件级 vGPU,并在合同/SLA 里写清楚隔离级别和可能的性能抖动。时间片共享只用在内部团队共用。
为什么坑:GPU 服务器功率密度高,普通机柜按常规密度设计扛不住。温度一上去,卡就降频——关键是这个降频是静默的,没人报错,只是变慢,你查半天查不出原因。
怎么避:选机房时问清单柜供电上限、散热方式、单柜可放几台 GPU 服务器,这三个问题答不上来的别放。上机后监控卡温和频率曲线,别只监控利用率。
为什么坑:切分方案对驱动版本极其敏感——虚拟化层、vGPU 驱动、CUDA、cuDNN、上层框架(PyTorch/TensorFlow)是一个版本矩阵,任何一个环节对不上,轻则跑不起来,重则性能掉一半。而且切分之后,实例里的驱动版本是由宿主机决定的,用户不能自己随便升。
怎么避:上线前把版本矩阵定死并做成镜像模板,禁止租户自行升级驱动;不确定哪个组合稳定的,直接找服务商的工程师协助部署——一万网络明示提供工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow,这套事让他们干比自己踩坑划算。
没有标准答案,只有一个算法。先让业务按独占跑一两周,测出每个工位的显存峰值(不是平均值),加上 20%–30% 余量,再用单卡显存去除,得到的就是份数上限。算完之后还要过一遍另外两个闸:CPU 核数和内存够不够 N 份,以及并发编码会话数到没到顶。三个条件都满足的那个 N,才是真的 N。用平均值算出来的方案,上线第一天就会 OOM。
看你对隔离的要求。租户之间不认识、服务是在线的(多租户推理、对外出租),选硬件级切分,比如支持 MIG 的 A100 这一档;租户是自己人、负载是间歇性的(内部云桌面、教学实训),软件级 vGPU 就够用,还更灵活,份数随时能调。硬件级的代价是规格固定、改动要重配;软件级的代价是算力共享、会有抖动,另外要考虑授权费。先定隔离级别,再定份数,最后比价格,顺序别反。
技术上能做,但我不推荐在云桌面和对外多租户场景做。CPU 和内存超分失败的结果是变慢,有操作系统兜底;GPU 显存超分失败是进程直接挂,CUDA out of memory,没有任何优雅降级。更麻烦的是故障随机——三个租户恰好在同一秒拉满才会触发,你查日志查不出规律。教学实训可以做轻超分,因为崩了重开代价低;其他场景,显存按峰值写实,切不下就加卡。
给不了,也不该给。授权口径各家方案不一样,有按并发用户数的、有按物理卡的、有按订阅周期的,还有打包在虚拟化平台总授权里的,而且政策会调整。一律以厂商最新授权政策为准,任何文章里写死的授权价都可能已经过时。你要做的不是找一个"权威报价",而是让服务商在报价阶段把硬件租金和授权费拆开报,自己算人均成本的临界点——切得越细,授权总额越高,到某个份数之后整卡反而更便宜。
云桌面是唯一一个网络直接决定体验的 GPU 场景,训练慢一点用户没感觉,鼠标点了半秒才响应他立刻就骂人。经验上,办公类云桌面通常希望把端到端时延控制在几十毫秒量级(比如 30–50 ms 这一档)以内,设计类工位更敏感。这个数字取决于你的办公地点到机房的物理距离和链路质量,不要拿别人的测速数据当自己的承诺,从实际办公网络打一次才算数。线路上看有没有 BGP 多线、回国链路有没有 CN2 GIA 这类优化,节点离用户越近越好。
能做,但我不推荐。两个硬伤:一是并发编码会话数在消费级卡上一向是有限制的(具体数量随驱动版本变化,以 NVIDIA 官方说明为准),你按显存算能切 8 份,实际第 5 个就上不去了;二是消费级卡没有面向虚拟化场景的设计,驱动和授权路径都不顺。真要控制成本,宁可选 A16、T4 这类面向 vGPU 场景的卡,或者用 RTX 3090(24G,¥1750/月,以官网实时价为准)走时间片共享给内部小团队用——但那是"共用",不是"隔离",别对外卖。
教学场景的三个特点决定了它可以切得比较激进:负载同质(大家跑一样的作业)、可预期(什么时候用、用多久你知道)、崩了代价低(OOM 了重开一个实例就行)。所以我推荐硬件级切分往份数上限靠,甚至可以轻微超分。关键配套是实例模板 + 快速重建——一节课的时间全花在处理环境问题上,那是最失败的教学实训。另外记得配快照和快速回滚,一万个学生里总有人把环境搞坏。
三个信号,撞上一个就该重新算账。一是单用户显存占用接近单卡显存的一半以上,切两份都很勉强,不如一人一张入门卡;二是负载持续满载(渲染农场、批量训练、高并发在线推理),切分只会让所有人一起变慢,因为算力是时间片共享的;三是算上授权费和运维复杂度之后人均成本降不下来——这条最常见也最隐蔽,因为授权费经常混在总价里。还有一种隐性不划算:你团队没人能维护虚拟化层,那多花点钱买整卡独占的省心,是理性的。
切分这事,说白了就是把一张卡的能力按人头摊薄,能摊多少取决于每个人的实际占用,而不是卡的参数表。我看到的大部分翻车案例,问题都不在技术上——技术上三条路线都很成熟——问题在于选型顺序反了:先看到某个切片的低价,再倒推业务去适配那个份数,最后发现显存不够、编码会话不够、授权费超预算。
正确的顺序就三步:先定隔离级别(租户认不认识、服务在不在),再定每份显存(按峰值加余量),最后才比价格。按这个顺序走,切分能给你省下真实的钱;反过来走,省下的那点钱一定会以别的形式还回去,通常是事故和客户流失。
真要给个一句话建议的话:内部共用走时间片,云桌面走软件级 vGPU,对外多租户走硬件级切分。剩下的,把授权费拆出来算一遍再签字。
本文涉及的一万网络 GPU 相关价格与服务口径,参考自一万网络官网(https://www.idc10000.net/)公开页面,包括 GPU 服务器租用、算力云与 GPU 定制相关栏目;硬件切分规格以 NVIDIA 官方公开文档为准(MIG 支持的实例规格、并发编码会话数限制等,以官方最新说明与实测为准);vGPU 软件授权模式与计费口径以厂商最新授权政策为准,文中不作具体报价。
文中标注「预估」「经验区间」「量级」的数据均为工程经验参考,非官方承诺,亦非实验室实测报告;涉及时延、带宽的部分为设计目标与量级参考,不代表实际测速结果。
具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品