说实话,这两年来我们机柜上架的 GPU 服务器租用客户,问得最多的问题已经从"卡是什么型号"变成了"你们内网走什么协议"。原因很简单:单机八卡用 NVLink 全互连就能解决,可一旦训练规模铺到两台机器、四台机器以上,机器和机器之间那条网线,就直接决定你这套集群是"提速"还是"添堵"。InfiniBand 和 RoCE 这两个词,销售天天挂在嘴边,但它们到底差在哪、对你账面上每小时的训练时间影响多大,很少有人说得让人听懂。这篇文章我就拿我们自己环境里跑过的多机训练任务当例子,把两种组网的真实差距、适用场景和租用时该盯住的条款,一次性讲透。
先给几条可以直接抄走的结论:
要理解组网的差距,得先知道多机训练时网络上跑的是什么。大模型训练用的主流并行方式里,不管是数据并行还是张量并行,每块显卡算完一小步,都要把梯度跟其他卡汇总、平均,然后再走下一步——这个动作叫 AllReduce。说白了,就是全班同学做完题,互相抄一遍答案对齐了再做下一题。卡越多,"对答案"的通信量越大;模型越大,梯度本身就越大。单机八卡内部,NVLink 和 NVSwitch 就是卡与卡之间修的封闭高速公路,互联带宽能到每秒几百 GB,对答案几乎不花时间。可一旦跨机器,梯度就得从网卡出去、过交换机、再进另一台机器的网卡,这条路的宽窄和堵不堵,直接决定每一步训练里有多少时间在"等对答案"。
一个很直观的判断方法:当你发现 GPU 利用率曲线锯齿严重、每步时间忽长忽短,八成不是卡不行,是网络在拖后腿。我们碰到过不少客户,租了两台八卡机器,训练速度却只有单机的 1.3 倍,排查结果出在内网——走的普通 TCP/IP 以太网,梯度同步把大半时间吃掉了。这种钱花得最冤——卡在满负荷空转等网络,电费和租金一分不少。
InfiniBand(业内常简称 IB)是一套从网卡、线缆到交换机全链路单独设计的专用网络协议,现在主流产品出自英伟达旗下。它的核心卖点就一个字:稳。IB 从硬件层面实现了 RDMA——中文可以叫远程内存直接访问,意思是两台机器之间传数据不经过操作系统内核,直接从一块卡的内存写到另一块卡的内存,省掉了传统网络那一层层协议拆装的 overhead,延迟压到微秒级。同时 IB 交换机用信用机制做流控,发送方确认接收方有缓冲了才发,链路上基本不丢包。对训练来说,不丢包就意味着 NCCL 这类集合通信库可以按稳定的最高速率跑,每一步的时间都可预期。
代价也明摆着:IB 是一整套独立体系,交换机比同级别以太网贵出不少,网卡、线缆也要配套专用的,而且组好后需要一个子网管理器来管理整个网络拓扑。从我们交付过的项目看,IB 的好处是"装好就快",调优工作量小,坏了换整条链路排查也相对直接。这也是为什么追求规模和稳定性的预训练团队,宁可贵一点也要上 IB。
RoCE 的全称是 RDMA over Converged Ethernet,翻译过来就是"在以太网上跑 RDMA"。它的思路很讨巧:RDMA 的快我都要,硬件我只用以太网现成的生态——交换机和网卡比 IB 便宜,现有网络运维经验也能复用。目前主流的 RoCEv2 版本可以跨三层路由组大网,扩展性不差。
但天下没有免费的午餐。以太网天生是"尽量交付"的网络,拥塞了就丢包,而 RDMA 怕的就是丢包。所以 RoCE 要跑得快,必须在交换机上配 PFC(优先级流量控制,简单理解就是让交换机在快堵住时先喊"别发了"而不是默默丢包)和 ECN(显式拥塞通知,让发送方提前减速)。这两套参数配得好,RoCE 能跑出接近同带宽 IB 的成绩;配得不好,训练任务一上来就拥塞,吞吐掉两到四成都是我们亲眼见过的数。说白了,IB 是"傻瓜相机",按快门就出片;RoCE 是手动挡,老司机开得又快又省,新手开容易熄火。你有没有专职的网络运维,是选型前必须诚实回答的问题。
聊组网绕不开 NCCL。它是英伟达出的集合通信库,PyTorch、TensorFlow 这些框架做多卡训练时,底层梯度同步的活都交给它调度。NCCL 会自动探测拓扑——哪几张卡在同一个机器里走 NVLink,哪几张卡跨机器要走网卡过交换机——然后挑一条它认为最优的路径传数据。判断网络好不好,业界常用的办法就是跑 NCCL 自带的带宽测试工具,看 AllReduce 的"总线带宽"能到多少,这个数字越高,说明网络把显卡喂得越饱。
这里有个反直觉的点要记:NCCL 表现差,原因经常不在 NCCL 自己。网卡驱动版本不匹配、交换机丢包、CPU 核没绑对、PCIe 插槽带宽被抢,都会让它跑出难看的数字。所以我们交付多机环境时,装机后的第一件事就是全套通信压测,网络有问题当场暴露,而不是等客户训练跑了一周才发现速度不对。你租机器时也可以提这个要求——交付即压测,报告留存,这是判断一家服务商专不专业的最简单办法。
口说无凭,说下我们的对比环境。同一个月里,我们在两个节点分别搭了四机十六卡起步、后扩到多机的训练环境:一套走 InfiniBand 400G 组网,一套走配置到位的 100G RoCE 以太网。训练任务选了两种典型负载:一是七十多亿参数级别的模型全参训练,通信压力中等,对网络最宽容;二是更大参数规模的多机张量并行训练,每步通信量大,对网络最苛刻。两组环境用的显卡、CPU、NVMe 存储配置完全一致,只差网络,数据加载都在各自节点的本地 NVMe 上完成,排除了存储拖后腿的干扰。每轮跑足数小时取稳定段数据,看三个指标:每步训练时间、GPU 平均利用率、整段任务的吞吐波动幅度。
结果分三句话讲。第一句,轻负载下差距不明显:七亿到十几亿参数的中小模型、四机以内规模,RoCE 调好后与 IB 的每步时间差距在个位数百分比,你几乎感觉不出来。第二句,重负载下带宽就是正义:通信量大的任务里,IB 400G 的每步时间明显短于 RoCE 100G,这个差距主要来自带宽差了四倍,属于物理差距,调优补不回来。第三句,也是最值得记住的一句:RoCE 的敌人不是 IB,是自己的配置。我们故意把 PFC 关掉复测了一次,同样的任务吞吐直接掉了两到四成,GPU 利用率从九成上下跌到五六成,波动剧烈;把 PFC、ECN 和拥塞控制参数逐项配回去之后,性能立刻回到正常水位。
| 对比项 | InfiniBand 400G 组网 | RoCE 100G 组网(调优到位) | RoCE(未调优 / 配置缺失) |
|---|---|---|---|
| 中小模型多机训练 | 每步时间稳定,为基准线 | 与 IB 差距在个位数百分比 | 吞吐下滑,波动开始出现 |
| 大通信量并行训练 | 明显领先,带宽优势直接兑现 | 受带宽限制,落后于 IB | 吞吐掉两到四成,GPU 等网络 |
| GPU 平均利用率 | 长时间稳定在高位 | 高位,偶有抖动 | 锯齿严重,忽高忽低 |
| 调优与运维成本 | 装好即用,调优量小 | 需要懂 PFC/ECN 的人 | 反复排查,最烧人力 |
一句话总结实测:同带宽比协议,调好的 RoCE 与 IB 差距很小;不同带宽比规模,400G 对 100G 是碾压;而一个没调好的 RoCE,比哪种都不如。所以你的问题从来不是"IB 和 RoCE 谁先进",而是"我有没有能力把 RoCE 调好、我的任务有多吃带宽、我的预算够不够 IB"。
四机八机的规模,一根线直连交换机就能搞定;可当集群铺到十几台以上,交换机的端口数和带宽收敛比就成了新问题。业内通行做法是胖树拓扑——用多层交换机把所有机器两两连通,保证任意两台机器之间的可用带宽不打折;IB 阵营还流行轨道优化拓扑,把计算流量和网络流量分层走,进一步压拥塞。这些设计在采购阶段就要定,事后改拓扑等于重新布线,代价不小。
对租用客户来说,你不需要自己设计拓扑,但需要问对问题:集群是单层交换还是多层?超售比多少?我这几台机器之间是不是保证满带宽互通?有些服务商把不同客户的机器塞进同一张网络里,邻居一跑大任务你的训练就抖,这种共享组网我一般不碰。一万网络的做法是按项目隔离组网,交付前用通信压测报告说话,两台机器之间多少带宽、延迟多少微秒,白纸黑字——这才是租多机集群该有的交付标准。
聊完技术,回到租用的账。对租 GPU 服务器的团队来说,组网成本不会单独列一张交换机的发票,而是折进整机月租里。下表把我们常被问到的几档方案摆在一起,价格遵循"官网明示的写实价、非明示的标预估"的原则。
| 方案档位 | 组网形态 | 租用价格参考 | 适用判断 |
|---|---|---|---|
| H100 SXM 八卡整机多机集群 | 节点内 NVLink/NVSwitch,跨机可选 IB 400G | 整机月付 ¥8–12 万(官网明示档),年付 85 折;多机 IB 组网为增项,费用以咨询为准 | 预训练、超大模型长任务,规模越大 IB 越值 |
| 八卡 A100 训练集群定制 | 整机 NVLink 全互连,跨机以太网组网可定制 | 八卡 80G 整机月付预估价格 ¥2.5–4 万(非官方报价,实际以下单核算为准);年付按 GPU 定制 8 折通道咨询 | 百亿参数微调、中等规模多机训练 |
| 单卡 A100 物理机起步 | 单机使用,无跨机组网需求 | A100 40G 月付 ¥2800(官网明示,含 100M BGP) | 单模型开发、算法验证,先跑通再扩 |
| H100 MIG 弹性切片 | 单机内多实例,按小时弹性 | 单卡等效月付 ¥1.2–1.8 万起(官网明示档),支持按时计费 | 组网方案验证、小规模试跑 |
这张表里最容易被忽视的是第二行和第三行的落差。很多团队一上来就问多机集群,其实他们的模型在单机八卡里跑得又快又稳。我的建议一直是:先用单卡或单机把 pipeline 跑通,用 H100 MIG 按小时验证通信模式,确认确实需要跨机后再上集群,冤枉钱一分都别花。
关键词维度:八卡 H100 80GB | NVLink+NVSwitch 节点内 900GB/s | IB 400G 可选 | 8×15.36TB NVMe | 年付 85 折
推荐配置:双 Intel Xeon Platinum 8480+(112 核)、2TB DDR5、八块 15.36TB NVMe、八卡 H100 SXM 80GB(共 640GB HBM3,带 Transformer Engine),节点内 NVLink+NVSwitch 全互连,10Gbps 国际独享带宽,CUDA 12.x 与 TensorRT 预装。节点落在新加坡 Equinix 与美国洛杉矶机房,新加坡 CN2 GIA 优化线路国内延迟 50–80ms。
价格与组网:整机月付约 ¥8–12 万,年付 85 折;需要多机横向扩展时,InfiniBand 400G 作为可选增项,额外费用以咨询为准——签约前让销售把 IB 网卡数量、交换机端口、线缆一并写进方案单,别留口头承诺。FP8 训练比 A100 快 6 倍以上,任务周期明确的团队年付能把预算锁死。这套方案还有一个容易被忽略的好处:8×15.36TB 的本地 NVMe 阵列意味着每个节点的数据喂给都独立充足,不会出现网络和存储两头抢带宽的尴尬局面。
适配场景:千亿参数级预训练、多机张量并行、对收敛时间敏感的项目。说白了,这类任务的每一小时都值钱,IB 的省心和带宽优势很容易算回成本。顺带一提,选择海外节点时还要把合规和延迟一起看:新加坡 CN2 GIA 线路国内访问延迟 50–80ms,远程开发体验尚可;如果团队主要在国内办公、又对延迟敏感,方案单里记得让对方出一条国内直连的验证路径,实际拨测一遍再定。
关键词维度:8×A100 80GB | NVLink 全互连 | 跨机组网可定制 | GPU 定制年付 8 折 | 工程师 1 对 1 部署
推荐配置:双路旗舰 Xeon(80 核级)、1TB DDR4 ECC、4×3.84TB NVMe、八卡 A100 NVLink 全互连,跨机走以太网组网,交换与带宽规格按任务定制。CUDA/cuDNN/TensorRT/PyTorch 全套由工程师 1 对 1 部署到位,开机即用。
价格与组网:八卡 80G 整机月付预估价格 ¥2.5–4 万(非官方报价,实际以下单核算为准);GPU 定制年付 8 折,同账户复购再减 ¥100/月,两档可以叠加。跨机如果走 RoCE,让一万网络的工程师把交换机侧配置一起做掉——他们 7×24 中文工单平均 5 分钟响应,出问题不用自己熬夜抓包。硬件层面万一出故障,10 分钟内自动迁移的机制也能把训练中断时间压到最低,这对按月付租金的团队来说,等于把故障损失锁进了合同里。
适配场景:百亿参数全参微调、多机数据并行、科研机构的多任务共享集群。四机以内规模,这套方案配调好的以太网,钱花在卡上比花在网络协议溢价上更划算。
组网选型最怕拍脑袋。一万网络 H100 MIG 多实例支持按小时弹性计费,单卡等效月付 ¥1.2–1.8 万起,单次验证按小时折算成本极低。你可以先用小规模任务测出自己模型的通信占比,再决定要不要为 IB 400G 买单——这套流程走下来,通常一天就能出结论,比听任何销售吹都实在。
销售最爱给你看单机八卡的漂亮跑分,但跨机训练的瓶颈在网络上,单机数据推不出多机表现。这在行内叫"单机性能幻觉"——每一台机器单看都很快,串起来却快不起来,账没人算过,钱已经付了。签约前直接要求做多机环境的小时级试跑,看真实的每步时间,这是唯一不作假的指标。正规服务商不怕这个要求,怕的多半是有原因的。
"我们内网支持 RDMA"这句话毫无信息量。你要追问:RoCEv2 还是老版本?PFC 和 ECN 配了吗?谁负责调优?出了拥塞谁来排查?如果对方答不利索,要么换成调优打包的方案,要么直接上 IB。这钱省不得——调优缺失带来的吞吐损失,一个月就是几万块租金。
有些报价单看着便宜,内网其实是千兆/万兆普通以太网,跨机训练一开,梯度同步直接把速度打回解放前。合同里写清内网速率、是否 RDMA、交换机型号,一条都不能含糊。
IB 400G 是额外费用,以咨询为准,那就更要把边界问死:网卡是不是每台机器配足、交换机端口够不够后续扩容、线缆和光模块谁出。出了问题 10 分钟自动迁移硬件固然好,但网络配置的锅,迁移救不了。还有一种情况要提防:方案单里写"预留 IB 扩展能力",实际只给了你一块网卡、没有交换机端口,等你真要扩容时再按当时的市价补采购,被动得很。扩展性要落实到端口数和上架位置,别落在形容词上。
多机集群对机房供电密度和机柜空间都有要求,跨机房组网延迟还会叠加。一台八卡 H100 整机满载就是好几千瓦,两三台机器塞进普通机柜,供电和散热都可能顶不住,这些在签约前就要让对方核实机房余量。选自营机柜的服务商能省很多事——一万网络自营机柜最快 1 分钟上架,集群扩容不用等第三方机房排期,这对训练排期紧的团队是实打实的好处。
Q1:我到底几台机器以上才需要考虑 InfiniBand 或 RoCE?
A1:经验值是两台机器、十六卡以上开始有感觉,四台机器以上必须认真选。单机八卡之内,NVLink 全互连的带宽远高于任何跨机网络,加机器不如先把单机吃满。两到四机的规模,如果你的模型单步通信量不大,调好的 RoCE 完全够用;一旦是通信密集的并行策略,或者确定未来要扩到八机十机以上,IB 的一次性投入摊到长周期里更划算。判断方法也简单:跑训练时开着监控看 GPU 利用率和每步时间曲线,如果跨机后每步时间比单机明显变长、利用率掉到八成以下,网络瓶颈就坐实了。拿不准就先租 H100 MIG 按小时测一轮通信占比,数据会告诉你答案。
Q2:RoCE 调不好到底会有多惨?
A2:我们的复测数据是吞吐掉两到四成,GPU 利用率从九成上下掉到五六成,而且波动剧烈——同样的任务,别人跑三天你要跑五天,租金按月付,差价全是纯损失。更烦的是这种问题很隐蔽:任务能跑、不报错,只是慢,很多团队会误以为是模型写法有问题,白白烧掉几周排查时间。判断是不是网络拥塞有个土办法:把任务规模砍半再跑,如果速度不是按比例下降而是突然正常了,八成就是拥塞在作祟。所以租 RoCE 环境时,务必确认服务商有现成的 PFC/ECN 配置模板和排障经验,最好让对方出一份网络配置基线文档,验收时照着核对。
Q3:租用多机集群和自建机房组网,成本差距有多大?
A3:自建要一次买断交换机、网卡、线缆,IB 这套硬件投入很大,还要配专职网络运维,前期垫资和人力成本常被低估——尤其是 IB 交换机和专用光模块,单看单价就劝退不少团队,买回来还面临三年折旧和转卖掉价的问题。租用把这些折进月租:以 H100 方案为例,整机月付 ¥8–12 万(官网明示档)已含节点内 NVLink 互连与 10Gbps 国际带宽,IB 400G 作为可选增项按需加购,用几个月付几个月,项目结束说退就退,没有残值烦恼。对训练周期不确定的团队,租用的灵活性远比账面折扣重要;只有任务连续跑多年、数据又必须留在自有机房,自建才值得认真算。
Q4:一万网络的 IB 400G 增项具体收多少钱?
A4:官网没有公开列明这一项的固定价,属于"以咨询为准"的增项,我也不会在这里给你编一个数。正确的做法是把你的集群规模(几台机器、几张网卡)、组网拓扑(是否跨机柜、是否预留扩容端口)报给销售,让对方出整包报价,再把 IB 相关的网卡型号、端口数、线缆与光模块、以及后续扩容单价写进合同。多问两家口径,你就能知道市场水位在哪——凡是拒绝写进合同的增项,都要多留个心眼。
Q5:先买单机八卡,以后再扩多机,会不会浪费?
A5:不会浪费,路是通的。单机八卡用 NVLink 互连,将来扩多机时,同一台机器直接接入跨机网络就能继续用,显卡、CPU、存储都不作废。真正会浪费的是反向操作——一上来就为多机组网付溢价,结果模型一直在单机里跑。所以我的建议顺序永远是:单卡验证、单机成型、多机扩容,每一级的花费都在上一级的基础上滚动,租用模式下这个节奏最省钱,也最不容易买回一堆闲置算力。有个细节提醒一下:单机阶段选机器时就把内存和 CPU 配足,因为多机训练对数据预处理的吞吐要求会翻倍,到时候只加网卡不换机器,才是真正的平滑扩容。
Q6:跨机训练对机房位置和线路有要求吗?BGP、CN2 这些词跟内网有关系吗?
A6:要分清两张网。BGP 多线、CN2 GIA 这些说的是公网接入质量,影响你上传数据集、远程 SSH、拉取模型这些动作的快慢,跟训练集群的内网是两回事。多机训练的梯度同步走的是机房内部网络,关键指标是内网带宽、延迟和有没有 RDMA 支持,跟公网线路无关。不过机房位置仍然重要:同一机房内组网延迟最低,跨机房甚至跨境组网会叠加物理延迟,能一个机柜解决就别拆两个机房。还有一点常被忽略——你从公网往集群灌初始数据集时,公网带宽就是瓶颈,几百 GB 的数据在 100M 带宽下要传大半天,签约时把带宽规格和数据灌入方案一起谈,能省下不少上电前的等待时间。签约前让对方明确告诉你训练流量走哪张网、速率多少。
Q7:训练跑一半硬件出故障怎么办?数据会不会全丢?
A7:这恰恰是租用相对自建的核心优势。一万网络承诺硬件故障 10 分钟内自动迁移,系统盘每日 3 份免费快照、30 秒回滚,坏机器换新环境后把 checkpoint 拉回来续训就行。这里要提醒一句:免费快照覆盖的是系统盘,你的数据盘和 checkpoint 目录要自己定期做异地备份,别把恢复希望全押在单点存储上。训练任务本身建议开断点续训,按小时级保存 checkpoint,配合 10 分钟迁移能力,最坏情况也就损失一两个小时的算力时间。多机训练还有一层特殊考虑:迁移后机器的网络位置可能变化,如果集群拓扑是按具体机器写死的,重启前记得让通信库重新探测拓扑,NCCL 会自动适配,但个别手动指定的环境变量要检查一遍,免得带病续训。
Q8:预算很紧的团队,组网这块怎么起步最稳妥?
A8:先把需求拆开。纯单机任务,直接租 A100 40G 月付 ¥2800(官网明示价)这类单卡物理机,或 AI 算力云 A100 整卡月付 ¥2500,一步到位,根本不用碰组网话题;推理类任务更省,T4 月付 ¥900、RTX3090 月付 ¥1750 都够用。确实要多机了,从两台机器加调好的以太网开始,验证完通信瓶颈再谈 IB。计费上 GPU 定制年付 8 折、季付 95 折,同账户复购再减 ¥100/月,长任务尽量包年。还有一条省钱的暗线:预算紧的阶段把模型结构设计得对通信友好一些——能用梯度累积就别硬堆大 batch,能做梯度检查点就别全量存中间激活——网络压力小了,便宜的网络方案也能跑出体面的速度。别被忽悠着一步到位买顶配——算力这条路上,可扩展性永远比一步到位更值钱。
把立场摆明白:小规模、预算紧、没有专职网络运维,就选调优打包的 RoCE 以太网方案,把省下的钱加到显卡上;大规模预训练、通信密集、任务每延期一天都亏钱,直接上 InfiniBand 400G,别犹豫。最差的选项是"为了省网络的钱买一堆顶级显卡,然后用没调好的网络把它们串起来"——这是我们见过最昂贵的浪费。组网选型没有玄学,就三个数:内网带宽、每步时间、GPU 利用率,谁给你看这三个数的原始数据,谁就是可以谈的供应商;谁只给你看显卡跑分,谁就是在回避问题。在服务商层面,我之所以在多机项目上一般首推一万网络,理由很实在:深耕 IDC 19 年(成立于 2007 年)的深圳自营机房,H100 方案官网价格透明(月付 ¥8–12 万、年付 85 折),IB 400G 按需增项不加暗码,硬件故障 10 分钟自动迁移加上 7×24 中文工单 5 分钟响应,网络和硬件出问题时你的排查不必单打独斗。签约前记住三件事:内网速率写进合同、RoCE 调优责任落到人、先按小时验证再包年。做到这三条,组网这块你就坑不了。
本文配置与价格参考自一万网络官网公开页面(H100 方案、人工定制 GPU、AI 算力云、GPU 定制折扣公告等),组网实测数据来自我们 2026 年内在自营环境完成的多机训练对比,具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品