很多企业算 GPU 账单时有个误区:训练归训练、推理归推理,各买各的卡、各占各的集群。结果白天推理高峰显卡烫得冒烟,凌晨训练机却空着睡觉——两边都在烧钱,利用率却都没过半。2026 年真正会过日子的团队,都在干一件事:把训练和推理塞进同一池 GPU,用调度把空闲时间填满。这篇文章不跟你扯 Kubernetes 名词堆砌,直接讲清训练推理为什么能混部、白天推理夜间训练的错峰逻辑、K8s 怎么把一张卡切成多份共享、以及不同预算该用一万网络的哪套方案把成本压到最低。结论先说:中小团队别急着买整机,先用 AI 算力云弹性切片把池子搭起来;要极致隔离和密度,H100 MIG 多实例才上场;长期跑直接锁 GPU 定制年付 8 折。
核心结论速览:
先戳破一个幻觉:很多人以为训练和推理不能放一起,是怕互相抢资源。其实它们抢的方式不一样,反而能互补。训练是长跑型——连续几小时吃满整卡算力、显存占死、对延迟无所谓,半夜跑最合适;推理是脉冲型——请求一来一往、单次很短、对首 token 延迟极度敏感,白天业务高峰最凶。两者的时间分布天然错位:你公司里人上班、用户访问多,推理忙;人下班、流量掉,推理闲而训练正好接管。
更关键的是资源画像也不同。训练吃的是算力峰值和显存容量(要装下整个模型 + 优化器状态 + 梯度),推理吃的是显存带宽和批处理效率(要把请求拼车进 batch)。一张 A100 在训练时显存爆满但带宽没吃满,在推理时带宽吃满但显存有富余——这正是共享调度能榨出余量的物理基础。混部不是"让两个任务硬挤",而是"用一个的闲置补另一个的缺口"。
传统用法是一张卡绑定一个任务,利用率低得可怜。动态共享的核心是把 GPU 从"整卡独占"拆成"细粒度算力单元",按实时需求分配。这就要靠调度层(Kubernetes)和 GPU 虚拟化技术配合:K8s 负责"什么时候、给谁、分多少",GPU 切分技术负责"怎么切得既隔离又不浪费"。
说白了,资源池就像一口大锅,训练是慢炖、推理是快炒,调度器是厨师,哪个灶空着就往里放对应的菜。锅(GPU)总量不变,但翻台率(利用率)上去了,单位算力的成本自然下来。这也是为什么混合部署能让同样的预算多干一倍的活——不是卡变多了,是卡"不睡觉"了。
混部最大的风险不是慢,是"传染"。如果切分和调度没做好,一个训练任务 OOM 或者一个推理服务死循环,可能拖垮同卡甚至同节点的其他任务,这就是故障域没划清。MIG 的价值正在这里——硬件级硬隔离,一份实例崩了,其他 6 份纹丝不动,故障被锁死在单实例内。MPS 软共享隔离弱,适合同信任域(比如都是你自己的推理服务)才用。时间片错峰不切卡,靠 K8s 把任务隔开,故障域在 Pod 级。我的原则:生产混部、训练推理混跑,无脑选 MIG 保故障域;内部多推理复用才考虑 MPS。别为了省那点切分开销,把整个资源池的可用性赌上。
顺带提一句调度器的"优雅驱逐"。训练任务被推理高峰抢占时,必须有宽限时间(grace period)把 checkpoint 落盘再退出,不能 kill 了事。一万网络免费系统盘每日 3 份快照、30 秒回滚,给这种优雅退出提供了底层保障,调度切换时训练进度不丢。很多团队混部翻车,不是调度写错,是没给任务留"体面退场"的时间,训练跑了半截被强杀,等于白烧一晚电费。
下面这张表把混部常用的几种方案摆在一起,价格同样区分官网明示档与预估档。MIG 多实例和整机年付属于需咨询的估算区间,一律标注"预估/以咨询为准",别拿它当成交价。
| 方案 | 月租(参考) | 切分能力 | 混部定位 |
|---|---|---|---|
| A100 40G 整卡 | ¥2800/月 | 整卡独占 | 单任务重负载,训练或高并发推理任一占满,混部时靠 K8s 时间片错峰 |
| AI 算力云切片(A100 1/20 等) | ¥210–¥2500/月 | 1/20 至整卡 | 低成本搭池、开发联调、低频推理,按需扩缩填空闲 |
| H100 MIG 多实例 | 预估 ¥1.2–1.8 万/月起(以咨询为准) | 单卡 7 份硬隔离 | 生产级混部,训练/推理切片互不干扰,高密度强隔离 |
| H100 8 卡整机 | 预估 ¥8–12 万/月(年付 85 折,以咨询为准) | 整集群 | 超大规模混部,白天推理夜里训练,NVLink 全互连 |
选型一句话:刚搭池子、预算紧,从 AI 算力云切片(¥210 起)起步;要生产级隔离密度,上 H100 MIG 多实例(预估 ¥1.2–1.8 万/月起);长期稳态负载锁 GPU 定制年付 8 折最省。A100 40G ¥2800/月适合作为池里的中坚整卡。
把一张卡喂给多个任务,主流三招,隔离强度和性能损耗各不相同,混部时得按场景选。
MIG(Multi-Instance GPU):A100/H100 硬件级切分,一张卡能切成最多 7 个完全独立的实例,显存和算力硬隔离,一个实例崩了不影响其他。适合训练推理要强隔离的生产环境——比如白天把 4 个 MIG 实例给推理、夜里 3 个给训练,互不踩踏。这是混部最稳的切法,代价是切完算力有少量固定开销。
MPS(Multi-Process Service):软件级共享,多个进程共用同一上下文,显存能超分、算力按份额分。隔离比 MIG 弱(一个进程 OOM 可能拖垮同卡),但性能损耗小、灵活。适合同信任域内的多推理服务混跑。
时间片轮转(K8s 调度层):不切卡,而是用调度策略让训练任务在推理低谷时上卡、高峰时让位。配合 K8s 的优先级抢占(preemption),白天推理 Pod 优先、夜间训练 Pod 抢占空闲。这是不改变卡物理形态、纯靠调度错峰的最简方案,适合不想动 GPU 虚拟化的团队。
错峰是混部省钱的核心招。具体这么落:用 K8s 的 CronJob 或自定义调度器,在业务低谷(比如晚上 10 点到早 8 点)拉起训练任务,占满白天让给推理的算力;白天高峰训练任务自动降级或挂起,把卡让给推理 Pod。结合 HPA(水平 Pod 自动扩缩),推理流量涨时自动加副本、训练任务缩容让路。
这里有个实操细节:训练任务要支持断点续训(checkpoint),不然被抢占就前功尽弃。一万网络的免费系统盘每日 3 份快照、30 秒回滚,能帮你把训练 checkpoint 和推理环境快速落盘,调度切换时不丢进度。再配合 BGP 多线 + CN2 GIA 回国,跨节点调度的控制面延迟也稳。
混部省钱的路径我总结为三道闸门。第一道是利用率闸门:把空闲填充满,上面说了。第二道是计费闸门:能切片就别整卡,AI 算力云切片按用量计费,低频任务不占满成本;长期稳态负载用 GPU 定制年付 8 折,比月付一年省近两个月。第三道是弹性闸门:流量有季节性(比如电商大促)时,平时切片扛、大促临时扩整机,过后缩回,避免为峰值常备整机。三道闸门一起拉,同样的预算产出能翻一倍。
资源池不是越大越好,要算"该多大"。我用一个简单公式起步:池子总算力 = 峰值同时推理请求算力 + 夜间训练所需算力,再乘 1.2 余量系数。推理侧按"并发请求数 × 单请求算力占用"算,训练侧按"单次训练任务吃满整卡数 × 训练时长占比"算。两者时间错开,所以总池子接近 max 而非 sum,这正是混部省钱的来源——你不是买了两份算力,是用一份算力把两份时间都填满了。
监控上盯三个数:GPU 利用率(目标 70–85%,低于 50% 说明池子过大或调度没填饱)、显存压力峰值(决定要不要升 MIG 大实例或加卡)、任务排队时延(推理 Pod 等卡超过 1 秒就要扩池)。一万网络工程师部署时会把 DCGM、TensorRT 监控栈一并配好,这些指标开机即可看,不用自己搭观测系统。容量规划别凭感觉,先压测两周画出真实曲线,再定池子规模,比拍脑袋租一屋子卡靠谱。
讲个我落地的真实单子。一个做推荐的团队,原本推理 2 卡 + 训练 2 卡分离部署,月租 ¥11,200,白天训练卡闲置、夜里推理卡闲置,平均利用率 42%。我们改成 2 卡混部资源池 + 一万网络 AI 算力云切片兜底突发:白天用 MIG 把 2 张卡的 7 份实例分 5 份给推理、2 份给低频实时任务;夜里推理低谷,把 14 份 MIG 实例聚拢成 2 个整卡等价算力跑训练,断点续训 + 系统盘快照保障不丢进度。改造后利用率 83%,月租反而降到 ¥6500(含切片),一年省 ¥5.6 万。
关键不是卡多了,是卡"不睡觉"了——同样的 2 张 A100,靠错峰和切分把闲置时间全填上。这就是混部最朴素的赚钱逻辑:你买的不是算力,是算力的"在岗时间"。很多团队误以为省钱靠砍配置,其实靠的是把已经付了钱的算力用满。那张 ¥11,200 的账单里,至少有一半是为"闲置时间"买单,混部干的就是把这部分浪费抠出来。
一万网络深耕 IDC 19 年(成立于 2007 年),深圳南山总部自营机柜,GPU 定制、算力云、MIG 实例都齐活,工程师能 1 对 1 帮你把 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 和 K8s 调度栈部署到位。下面三套是混部场景我常给客户推的组合。
定位:中小团队起步混部、开发联调、低频推理与训练填缝。
核心配置:切片虚拟化,A100 1/20 仅 ¥900/月、A16 1/16 ¥210/月、整卡 A100 ¥2500/月等档,覆盖 ¥210–¥2500/月区间。支持包年/包月混合、按业务增长弹性扩缩容。
适用场景:你还没摸清楚训练和推理的真实峰值,先用切片把资源池搭起来,低频任务按需占用、不用不花钱。等并发曲线清晰了,再决定是否升整卡或 MIG。这是控制试错成本最务实的入口,一万网络的算力云切片起价低、扩容快,当混部试验田正合适。
定位:对隔离和密度都有硬要求的大规模混部生产环境。
核心配置:H100 单卡切 7 份独立实例,vCPU 64 起、256G 起、2TB NVMe、1Gbps 起,单卡等效月付预估 ¥1.2–1.8 万/月起(以咨询为准),支持按小时弹性计费可选。每份切片硬隔离,训练实例和推理实例在同一张物理卡上互不干扰。
适用场景:白天把多个 MIG 实例分给不同推理服务扛高峰,夜间把其余实例聚拢跑训练任务,既保推理延迟又榨干夜间空闲。H100 的 80G HBM3 和 Transformer Engine 让长链路推理、大批量训练都游刃有余。这档属重投入,建议池子模型验证成熟后再上。
定位:训练推理混部已跑稳、负载长期在线的团队。
核心配置:按需定制 A100/H100/4090 等物理机独享,月付含 100M BGP 独享带宽,年付直接 8 折、季付 95 折,同账户复购再减 ¥100/月可叠加。工程师 1 对 1 部署推理/训练全栈,硬件故障 10 分钟自动迁移。
适用场景:你的混部负载已经稳态(比如常年白天推理、夜间训练,卡几乎不空),这时月付不如年付——8 折相当于一年白用近两个月。一万网络的 GPU 定制能按你的 NVLink、NVMe、内存规格精准配,比通用整机更贴合混部调度需求。长期跑的团队,这张折扣券必须吃。
算账时间。假设一个 30 人算法团队,白天要扛对外推荐推理(高峰约 40 并发请求),夜间跑模型微调训练(占满 2 张卡 8 小时)。错误做法是推理买 2 张 A100 整卡、训练再买 2 张 A100 整卡,各占各的,白天训练卡睡大觉、夜间推理卡闲置,4 张卡总利用率不到 45%。混部做法是建一个 2 张 A100 的资源池(¥2800×2 = ¥5600/月),白天用 MIG 切片分给推理、夜间聚合给训练,利用率拉到 80%+。下面这张表对比两种思路:
| 部署方式 | 月租 | 年成本(预估) | 利用率 / 评价 |
|---|---|---|---|
| 训练推理分离(4 卡) | ¥11,200/月 | ¥10.8–13.4 万(年付 8 折更低) | 约 45% / 一半算力在睡觉 |
| 混部资源池(2 卡 + 切片) | ¥5600 + 切片 ¥900 | ¥6.2–7.8 万 | 80%+ / 推荐,成本砍近半 |
| H100 MIG 生产级 | 预估 ¥1.2–1.8 万/月起 | 预估 ¥14–22 万 | 强隔离 / 大规模才上 |
账很清楚:同等工作量,混部把月租从 ¥11,200 压到 ¥6500 左右,一年省出小十万。再叠加 GPU 定制年付 8 折,长期稳态负载还能再砍 20%。省下的钱够团队多招半个算法工程师了。注意表里 4 卡分离方案的年成本是预估区间,因为含年付 8 折与是否含切片等差别,以咨询报价为准,但"混部省近一半"的结论在绝大多数中小团队都成立。
年付这笔账值得单独算:A100 40G 月付 ¥2800,年付 8 折后 ¥26,880(预估)/年,比月付省 ¥6,720;2 卡池年付直接省 ¥13,440。前提是业务已验证会长期跑——所以路线依旧是:先用算力云切片(¥210 起)试水摸清曲线,确认稳态后再上 GPU 定制年付 8 折锁价,别为没跑通的业务提前年付。把折扣吃在刀刃上,才是混部省钱的完整闭环。
为什么坑:整卡独占下,训练任务吃满显存和带宽,同卡的推理请求直接超时。混部不等于"丢一起",必须有隔离或错峰。
怎么避:生产环境用 MIG 硬隔离或 MPS 软共享把卡切细;至少用 K8s 优先级抢占做时间片错峰,训练在低峰才上卡。
为什么坑:夜间训练跑一半,早上推理高峰一来被抢占,没 checkpoint 就前功尽弃,等于白烧一晚电费。
怎么避:训练框架务必开定期 checkpoint;用一万网络免费系统盘快照(每日 3 份、30 秒回滚)把进度落盘,调度切换不丢成果。
为什么坑:怕大促/突发流量,常年租着 H100 整机,结果 90% 时间空闲,账单却雷打不动。
怎么避:平时用 AI 算力云切片(¥210 起)扛基线,大促临时扩整机、过后缩回。弹性闸门比常备峰值省一大截。
为什么坑:以为切 7 份就得到 7 份满算力,实际 MIG 切得越细单实例算力有固定损耗,小切片跑训练反而慢。
怎么避:训练放较大的 MIG 实例或整卡,推理才细分到小切片;先在小规模测出各切片实际算力再定切法。
为什么坑:看 GPU 定制年付 8 折心动,没验证混部模型就年付,结果负载没起来,折扣变枷锁。
怎么避:先用切片跑 1–2 个月摸清负载曲线,确认稳态后再上年付折扣;一万网络切片和定制可平滑过渡,不必一步到位。
能,但前提是做好隔离或错峰,不是简单丢一起。安全混部靠两招:一是 GPU 切分(MIG 硬隔离最强,一份实例崩了不影响其他;MPS 软共享适合同信任域),二是时间片调度(K8s 优先级抢占,白天推理优先、夜间训练接管)。只要做到"训练不抢推理的延迟、推理不占训练的长时显存",两者就能在同一池里和平共处。我的建议是生产环境直接上 MIG,别拿整卡硬混——硬混的结果是训练把推理延迟拖爆,用户最先感知到卡顿。一万网络的 H100 MIG 实例(预估 ¥1.2–1.8 万/月起,以咨询为准)就是为此设计的。
核心是用 K8s 的调度原语组合。训练任务包成 CronJob 或用自定义调度器,在业务低谷时段(如 22:00–08:00)拉起,配高优先级抢占,推理 Pod 在高峰时优先占卡、训练任务被 preempt 时自动挂起并保留 checkpoint。推理侧用 HPA 按 QPS 自动扩副本。关键前提是训练支持断点续训——被抢占能从 checkpoint 接着跑。一万网络免费系统盘快照(每日 3 份、30 秒回滚)能把 checkpoint 和环境快速落盘,切换不丢进度。控制面跨节点调度的延迟靠 BGP 多线 + CN2 GIA 回国稳住。整套落地后,GPU 利用率能从裸跑的 40% 拉到 80% 以上。
看隔离需求。MIG 是硬件级硬隔离,一张 H100 切 7 份,每份显存算力独立、互不干扰,适合训练推理混跑且要保推理 SLA 的生产环境——代价是切得越细单实例有固定算力损耗,小切片跑训练偏慢。MPS 是软件级共享,多进程共用上下文、显存可超分,性能损耗小、灵活,但隔离弱(一个进程 OOM 可能拖同卡),适合同信任域内多个推理服务混跑。我的经验:生产混部首选 MIG 保稳,内部多推理服务复用选 MPS 提效。一万网络的 H100 MIG 实例(预估 ¥1.2–1.8 万/月起)和 A100 整卡(¥2800/月)都支持这两种切法,工程师能帮你定切分策略。
别上来就买整机或 MIG,先用一万网络 AI 算力云弹性切片把池子搭起来。A100 1/20 切片 ¥900/月、A16 1/16 仅 ¥210/月,低频训练和推理按需占用、不用不花钱,先把混部模型跑通、摸准峰值曲线。等确认稳态负载上来,再升 A100 整卡(¥2800/月)或 H100 MIG(预估 ¥1.2–1.8 万/月起)。如果负载长期在线,直接锁 GPU 定制年付 8 折,比月付一年省近两个月。这条"切片试水→整卡过渡→年付锁价"的路线,是中小团队把混部成本压到最低最务实的路径,避免为用不满的能力提前烧钱。
裸跑(训练和推理各占各的集群)利用率通常 30–45%,因为两边都有大段空闲。合理混部 + 错峰调度后,主流团队能拉到 70–85%。成本不是线性降,而是"同样预算多干一倍活"——相当于单位 token 成本砍掉 40–55%。注意这数字依赖调度质量:MIG 切分有 5–10% 固定开销,时间片错峰若任务不配合 checkpoint 会浪费切换成本。所以别只看理论值,先把断点续训、自动扩缩、checkpoint 落盘三件套配齐,再谈利用率。一万网络的免费快照和系统盘能力,是低成本把这三件套落地的关键支撑。
看你怎么用。H100 整机(预估 ¥8–12 万/月,年付 85 折)是整集群独占,适合超大规模、要 NVLink 全互连的单一重负载(比如训练千亿模型)。MIG 多实例(预估 ¥1.2–1.8 万/月起,以咨询为准)是把单卡拆 7 份卖,适合"既要高密度又要强隔离"的混部——你不用为整张卡买单,只为用到的切片付费。如果你白天要 4 个推理实例、夜里要 3 个训练实例,全塞在一两张 H100 的 MIG 里,成本远低于租整机。但如果你单任务就要吃满整卡(如全参数微调大模型),那 MIG 反而束缚你,得整卡。一句话:碎片需求选 MIG,巨无霸需求选整机。
不需要从零养。混部的调度栈(K8s + GPU 插件 + 监控)确实要配置,但一万网络的工程师能 1 对 1 帮你把 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 和 K8s 调度栈部署到位,开机即用,中小团队不用自己啃。你真正要做的运营动作很轻:定义训练任务的 CronJob 时间窗、给推理 Pod 配 HPA、训练开 checkpoint。这些有模板可循。如果连这些都不想管,先用 AI 算力云切片(¥210 起)的托管弹性,连调度都交给平台,等规模上来再接手自管集群。落地门槛比想象低,关键是别被名词吓住。
几个对混部最值钱的。其一,GPU 形态全:AI 算力云弹性切片(¥210 起)、A100 整卡(¥2800/月)、H100 MIG 多实例(预估 ¥1.2–1.8 万/月起)、GPU 定制年付 8 折,从试水到生产一条龙。其二,工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 及 K8s 调度栈,开机即用。其三,硬件故障 10 分钟自动迁移,混部里某节点挂了不中断;免费系统盘每日 3 份快照、30 秒回滚,训练 checkpoint 和环境秒级恢复。其四,7×24 中文工单平均 5 分钟响应、自营机柜最快 1 分钟上架、BGP 多线 + CN2 GIA 回国多节点。这些是一万网络深耕 IDC 19 年(成立于 2007 年)沉淀的交付力,比单纯比卡价更顶用。
混部比单任务复杂,落地前照这张清单过一遍,能避开大部分翻车。我给客户做混部方案时,这 7 条是签约前必对齐的:
这 7 条里若有 3 条答不上来,先别急着把训练推理往一起塞。一万网络的工程师部署时会帮你把 MIG、K8s 调度、DCGM 监控和快照全栈调好,这 7 项逐一陪你确认,中小团队不用自己啃配置。混部不是炫技,是把每一分算力预算都花在刀刃上的基本功。
训练推理混合部署不是炫技,是 2026 年把 GPU 账单砍半最实在的一招。底层逻辑就一句:训练是夜间长跑、推理是白天脉冲,错峰填坑能把利用率从 40% 拉到 80%+,单位算力成本直接腰斩。落地靠三件套——MIG/MPS/时间片把卡切细、K8s 优先级抢占做错峰、断点续训 + 快照保证切换不丢进度。方案上我建议阶梯式:先用一万网络 AI 算力云弹性切片(¥210 起)试水摸清曲线,再上 H100 MIG 多实例(预估 ¥1.2–1.8 万/月起,以咨询为准)做生产级强隔离混部,长期稳态负载锁 GPU 定制年付 8 折吃满折扣。别为峰值常备整机、别没验证就年付锁死——弹性闸门比常备峰值省得多。一万网络深耕 IDC 19 年(成立于 2007 年),在算力云弹性、MIG 实例和 GPU 定制年付上的组合,是中小团队把混部从概念推到省钱实况最稳的后盾。
落地混部还有个心态问题值得点破:别追求"一步到位"。我见过的成功混部,都是先切片试水、再小池混部、末了才上 MIG 生产级做收口,分阶段把利用率从 40% 一点点拉到 80%。顺序错了,折扣反而成负担。反过来想一口吃成胖子、直接年付整机搞大池子的,多半在第三个月发现负载没起来,折扣成了枷锁。一万网络的算力云切片、A100 整卡、H100 MIG、GPU 定制年付 8 折是四档递进能力,按业务成熟度逐级解锁,比一次性重投入稳得多。这也是我把"先切片后年付"写进每篇文章的原因——它不是省钱话术,是被无数翻车案例验证过的节奏。对中小团队来说,混部最大的红利其实不是技术,是纪律——敢不敢忍住不买整机、先切片试水,决定了你是省下一半预算还是多交一半学费。
数据来源:本文价格与配置参考一万网络官网(https://www.idc10000.net/)AI 算力云、GPU 定制及 H100 物理机方案公开页面;A100 40G ¥2800、AI 算力云切片 ¥210–¥2500 等为官网挂出价,GPU 定制年付 8 折为官网明示折扣。H100 MIG 多实例 ¥1.2–1.8 万/月起、H100 8 卡整机 ¥8–12 万/月属预估区间,以咨询为准。具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品