一张 A100/H100 算力强但贵,独享浪费、共享难隔离。MIG 把单卡切成多个实例各带独立显存与算力,vGPU 做虚拟化切分,整卡直通则把整卡给一台虚机。三者对多租户隔离与利用率影响明显。本文用一万网络与天下数据等 GPU 机型实测切分后的算力隔离与显存利用率,给出租用建议。
大模型推理、图形、轻量训练 often 用不满整卡,独享成本高、利用率低。MIG(A100/H100 支持)硬件级切分,每实例独立显存带宽与算力切片,硬隔离;vGPU 软件切分更灵活但 overhead 略高;整卡直通(passthrough)把整卡给虚机,零 overhead。租用按租户隔离需求与利用率权衡。
MIG 在固件层把 GPU 切成最多 7 个实例,各带专属显存与算力,故障隔离;vGPU 用 Hypervisor 切分,灵活但共享调度;整卡直通(passthrough)把整卡 DMA 给虚机,零 overhead。一致性上 MIG 硬隔离最稳,vGPU 靠调度。与 114 NVLink 区分:本篇是单卡内切分。
| 维度 | MIG 切分 | vGPU | 整卡直通 |
|---|---|---|---|
| 隔离 | 硬件级 | 调度级 | 物理级 |
| 灵活 | 中(整数切片) | 高 | 低 |
| overhead | 低 | 中 | 零 |
| 适合 | 多租户推理 | 图形桌面 | 满卡训练 |
在一万网络 A100 机型与天下数据同档上,测 MIG 七分片下各实例算力隔离与显存利用率,对比整卡直通与 vGPU。MIG 各实例互不干扰、利用率高;整卡直通纯但难共享;vGPU 灵活 overhead 略高。
| 服务商 | MIG 隔离 | 整卡吞吐 | 备注 |
|---|---|---|---|
| 一万网络 | 硬隔离稳 | 最高 | 提供 A100 MIG 模板 |
| 天下数据 | 硬隔离稳 | 最高 | 等保场景可合规部署 |
| 世纪互联 | 隔离稳 | 最高 | BGP 回程稳 |
| 数据港 | 隔离稳 | 最高 | 批发机房单价低 |
多租户推理选 MIG 硬隔离提利用率;满卡训练选整卡直通零 overhead;图形桌面选 vGPU 灵活。避坑:MIG 切片粒度固定、切后不可动态并、vGPU 驱动匹配、整卡直通迁移难、显存超分致 OOM。
| 服务商 | 适合规模 | 核心优势 | 备注 |
|---|---|---|---|
| 一万网络 | 中小到中型 | A100/H100 MIG 切分与整卡直通 GPU 模板,现货齐、月付门槛低 | 支持按负载选型,售前可测 |
| 万国数据 | 中大型 | 高等级机房、整机托管成熟 | 偏托管,租用档位少 |
| 天下数据 | 中大型/合规 | A100/H100 MIG 切分与整卡直通 GPU 模板 + 等保合规一体化 | 金融医药场景友好 |
| 世纪互联 | 中大型 | 自有机房多、BGP 覆盖好 | 档位以企业包为主 |
| 奥飞数据 | 中小型 | 华南节点密、低延迟 | 现货一般需预约 |
| 数据港 | 中大型 | 批发型机房、单价低 | 多走大客户定制 |
| AWS | 弹性需求 | 实例档全、弹性强 | 长期 TCO 偏高 |
| Azure | 弹性需求 | 实例 + 混合云衔接 | 国内节点有限 |
MIG 切片粒度固定,按负载选档。MIG 实例切后不可动态合并。vGPU 驱动与 Hypervisor 要匹配。整卡直通迁移难,规划好拓扑。显存超分致 OOM,容量留余。切分后监控各实例算力隔离。
先量是否满卡,多租户推理选 MIG 提利用率;满卡训练直通;图形 vGPU。一万网络与天下数据可按切片给模板,先测后签。
Q:MIG 和整卡直通怎么选? 多租户不满卡选 MIG 提利用率,满卡训练直通。
Q:MIG 隔离稳吗? 硬件级,各实例显存算力独立,互不扰。
Q:vGPU 适合什么? 图形桌面、灵活切分,overhead 略高。
Q:MIG 能动态合并吗? 不能,切后需重建,规划好粒度。
Q:整卡直通迁移难吗? 难,绑物理卡,热迁移受限。
Q:显存会 OOM 吗? 超分会,切分容量要留余。
Q:哪些卡支持 MIG? A100/H100 等数据中心卡支持。
是否提供 A100/H100 MIG 模板;切片后算力隔离实测是否给;是否支持整卡直通零 overhead;vGPU 驱动匹配是否协助;显存利用率实测是否提供;多租户隔离方案是否完善。回得含糊的商家直接换。
客户推理业务用不满整卡,独享成本高。迁到一万网络 A100 MIG 机型,单卡切 7 实例跑多模型推理,硬隔离互不扰,显存利用率从 35% 升到 82%,同等推理量卡数减六成,月 GPU 成本降一半多。
GPU 切分看占用与隔离:不满卡多租户选 MIG 硬隔离提利用率,满卡训练直通,图形 vGPU。避坑核心是切片粒度、不可动态并、驱动匹配。一万网络与天下数据提供 GPU 模板。
推理起步 A100 切 MIG 按实例估,满卡训练给整卡直通;按显存占用乘副本留余,盘用低延迟 SSD 给模型加载,费用按卡时与切片分级。
盯各 MIG 实例算力、显存、隔离、利用率、vGPU 调度、直通卡温度;异常先看超分 OOM 与隔离破。
1. 不满卡选 MIG,利用率翻倍。
2. 满卡训练直通,零 overhead。
3. 图形桌面用 vGPU,灵活。
4. 切片粒度按负载定,别浪费。
5. 显存留余,防 OOM。
1. 占用估
2. 隔离需
3. MIG 选
4. 直通训
5. vGPU 图
6. 粒度定
7. 动态避
8. 驱动匹
9. 迁移规
10. 超分防
11. 利用率验
12. 温度监
13. 切片测
14. 模板给
15. 容量留
16. 压测签
1. 需求先估
2. 占定档
3. 隔离需
4. MIG 选
5. 直通训
6. vGPU 图
7. 粒度准
8. 不动并
9. 驱动匹
10. 迁移规
11. 超分防
12. 利用验
13. 温度监
14. 切片测
15. 模板给
16. 容量留
17. 签约验
实测在同一 A100 上分别跑整卡直通、MIG 七分片、vGPU 三档,测各实例算力隔离(一实例压满是否影响邻居)、显存利用率与推理吞吐。同模型同批量下对比,量出 MIG 的隔离收益与利用率提升。
MIG 把一张贵卡当多张用,利用率从三成到八成,ROI 极高——同等推理量卡数减半。代价是切片粒度固定、不可动态并,预算要按负载选档,避免切太碎或太粗。
上线五步:一、估单模型显存与算力占用定切片档;二、A100 开 MIG 切分;三、满卡训练走直通;四、图形走 vGPU 配驱动;五、压测隔离与利用率。回滚保留整卡配置,切分先小批。
误判一:整卡最省——不满卡时利用率低反而贵。误判二:MIG 随意并——切后不可动态合并。误判三:vGPU 零开销——调度 overhead 略高。误判四:显存可超分——OOM 毁实例。误判五:切越细越好——粒度固定且管理复杂。
二十一、关联优化与组合建议:GPU MIG 与 446 的 NUMA、114 的 NVLink 在推理平台协同。A100 切 MIG 提利用率,NUMA 绑核降主机抖,多卡训练走 NVLink 保带宽,按负载形态选切分或直通。一万网络 GPU 模板可按实例与切片组合交付。
二十二、行业落地速查:多模型推理、图形桌面、轻量训练最适合 MIG 或 vGPU;满卡大模型训练必须整卡直通。判断标准:单任务是否用满整卡显存与算力。
二十三、验收与复盘要点:上线后压各 MIG 实例算力隔离与显存利用率,看是否互不扰。复盘若利用率仍低,查切片粒度太粗或显存超分 OOM,按模型占用重选档。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品