跑大模型训练,光有 GPU 不够——网络才是卡脖子的那根绳子。你买了 8 卡 H100,节点间通信一卡,算力利用率直接掉到 40%,白花几十万租金。我见过太多团队,GPU 选型花了三个月,网络方案一晚上拍脑袋,结果集群跑起来天天等数据同步。说白了,高性能网络架构(RoCE、InfiniBand、NVLink)选对了,训练效率翻倍;选错了,再贵的卡也白搭。2026 年,大模型参数规模从千亿冲向万亿,多机多卡训练成为常态,网络架构的选型已经从"要不要配"变成了"怎么配才不亏"。这篇文章不讲虚的,三网同台硬碰硬,把技术细节、成本对比、真实场景一把说透。
核心结论:
· NVLink/NVSwitch 是单机 8 卡训练的必选项,节点内互联带宽 900GB/s,任何其他方案都替代不了。没有 NVLink,8 卡之间靠 PCIe 通信,带宽从 900GB/s 掉到 32GB/s,训练一个 70B 模型的时间直接拉长 3 倍以上。
· 多机多卡集群(4 节点以上),InfiniBand NDR400 是性能天花板,8 节点 64 卡集群的 AllReduce 通信时间占比仅 8-12%,但一套 IB 交换机比 GPU 还贵,小团队慎入。
· RoCE v2 是"穷人的 InfiniBand"——延迟比 IB 高 10-20%,但用普通以太网交换机就能跑,网络成本低 40-60%,调优得当可达 IB 90% 的性能。
· 2026 年的趋势是:NVLink 管机内、RoCE 管机间、IB 管超大规模——三者不是替代关系,而是分层搭配。一台机器里三种技术可以同时存在,各管一段。
· 一万网络深耕 IDC 19 年(2007 年成立),H100 整机标配 NVLink+NVSwitch,可选 IB 400G 上联,从单机到百卡集群灵活扩展,提供网络调优交付服务。
NVLink 是 NVIDIA 私有的 GPU 间直连总线技术,不走 PCIe,不经过 CPU。它的核心逻辑是:让 GPU 之间像共享显存一样互访数据。A100 时代 NVLink 3.0 单链路带宽 600GB/s,H100 的 NVLink 4.0 配合 NVSwitch 交换机,8 卡全互联可达 900GB/s——这是什么概念?一秒钟能传 900GB 数据,相当于同时传输 180 部 4K 蓝光电影,或者在一个心跳的时间里读完整个维基百科的中文语料。大模型训练里最耗时的 AllReduce 操作,在 NVLink 下几乎不占训练时间。
NVLink 的致命短板是:它只在一台物理机内有效。跨节点,哪怕两个机箱紧挨着,也只能靠 InfiniBand 或以太网。所以行业共识是——NVLink 是机内互联的王者,但出不了门。另外,NVLink 是 NVIDIA 的封闭生态,AMD 的 GPU 用不了,Intel 的 GPU 也用不了。如果你用的是昇腾 910B 或者其他国产卡,那就只能走 PCIe 或以太网,NVLink 跟你没关系。
InfiniBand 从 2000 年代就是超算中心的标配,2026 年已经迭代到 NDR 400(单端口 400Gbps)。它的核心优势是 RDMA(远程直接内存访问)——数据从一台 GPU 的显存直接写到另一台 GPU 的显存,不经过 CPU 内存,延迟低到 1-2 微秒。目前 Mellanox(NVIDIA 旗下)的 QM9700 交换机是行业事实标准,64 端口 NDR400 全线速转发,无阻塞拓扑。IB 的硬件卸载能力极强,拥塞控制、流量调度全在网卡和交换机层面完成,不占 CPU 资源。
缺点也很鲜明:贵。一台 64 口 NDR400 IB 交换机要价 20-30 万,加上 IB 网卡(每张约 1-2 万)、线缆(光模块每对约 3000-5000 元),一个 8 节点集群的 IB 网络成本动辄 50 万以上。而且 IB 交换机只能跑 IB 协议,不能兼做业务网络,等于多了一套独立网络要维护。还有一点,IB 的生态相对封闭,运维人员需要专门培训,不像以太网那样随便找一个网工都能上手。说白了,InfiniBand 什么都好,就是贵得让中小团队肝颤。
RoCE(RDMA over Converged Ethernet)v2 是为"不想买 IB 交换机又想享受 RDMA"的团队准备的。它在标准以太网帧上封装 RDMA 协议,让普通 25G/100G/400G 交换机也能跑 GPU 间通信。RoCE v2 的延迟大概 3-5 微秒,比 IB 高一点,但比传统 TCP/IP 的 10-20 微秒好太多。而且 RoCE 可以跑在现有的以太网基础设施上,不需要额外拉一套独立的网络——对于已经有 100G 以太网机房的团队,增加 RoCE 的边际成本几乎为零。
RoCE 最大的陷阱是丢包。因为 RDMA 要求零丢包,万一以太网交换机发生拥塞丢包,RoCE 性能直接断崖式下跌——带宽利用率从 95% 掉到 30% 都很常见。所以跑 RoCE 的交换机必须开 PFC(优先级流控)、ECN(显式拥塞通知),配置调优是个技术活,搞不好就是"省钱买回一堆麻烦"。我见过一个团队,为了省 20 万 IB 的钱买了 RoCE 方案,结果调了两个月没调好,最后 GPU 利用率一直不到 50%,算下来浪费的租金比省下的 IB 钱还多。所以 RoCE 的核心不是"买不买得起",而是"调不调得好"。
| 对比维度 | NVLink 4.0 | InfiniBand NDR400 | RoCE v2 | 选型建议 |
|---|---|---|---|---|
| 单链路带宽 | 900 GB/s(8卡全互联) | 400 Gbps(单向≈50 GB/s) | 400 Gbps(单向≈50 GB/s) | NVLink 碾压,但只限机内 |
| 传输延迟 | <1µs(GPU直连) | 1-2µs(RDMA硬件卸载) | 3-5µs(受拥塞影响) | IB 和 RoCE 差距不大 |
| 通信范围 | 仅单机(8卡/16卡) | 多机多卡(数百节点) | 多机多卡(数百节点) | NVLink必配,IB/RoCE选配 |
| 交换机兼容性 | NVSwitch(NVIDIA专用) | IB专用交换机(Mellanox等) | 标准以太网交换机 | RoCE 兼容性最好 |
| 网络成本(8节点集群) | 已含在整机价内 | ¥40-80万(预估,以咨询为准) | ¥15-30万(预估,以咨询为准) | IB 贵 2-3 倍 |
| 配置复杂度 | 即插即用,无需配置 | 中等,需 IB 子网管理器 | 高(PFC/ECN/DCQCN调优) | RoCE 最难调 |
| 典型大模型训练效率 | 单机利用率 90%+ | 64卡集群利用率 85-90% | 64卡集群利用率 70-85% | IB 效率更高更稳 |
| 生态成熟度 | NVIDIA 全栈支持 | HPC 传统强项,CUDA 原生支持 | 快速追赶,GPUDirect RDMA 支持 | IB 最成熟可靠 |
一句话总结上表:NVLink 是地基,必须建;IB 是别墅装修,又贵又好;RoCE 是精装公寓,性价比高但需要花心思打理。三者各有各的生态位,没有绝对的"谁替代谁"。你选网络方案的时候,先问自己三个问题:单机还是多机?预算多少?有没有专业运维?答案出来了,方案也就定了。
这个场景最简单:机内 NVLink 全互联就够了,不需要额外网络。8 卡 A100 通过 NVLink 3.0 跑 600GB/s 带宽,13B 参数模型的数据并行通信几乎不占时间。你只需要配一根 10G/25G 管理网线做数据加载和控制面,压根不用上 IB 或 RoCE。以一万网络的 A100 40G 人工定制 GPU 方案为例,单卡 ¥2800/月(官网价),8 卡整机月付约 ¥2.5 万-3.5 万(预估,以咨询为准),机内 NVLink 3.0 全互联,出厂即就绪。你只要把数据拷到本地 NVMe 阵列上,就能直接开跑。新手团队最容易犯的错就是——单机 8 卡还买 IB 交换机,纯属浪费钱。等你真有 4 台以上节点了,再考虑 IB 或 RoCE 不迟。
这个区间是 RoCE 和 InfiniBand 正面交火的战场。以 8 节点、每节点 8 卡 H100 的 64 卡集群为例,我们来算一笔细账:
选 InfiniBand NDR400:集群网络总成本约 ¥40-80 万(预估,以咨询为准),训练效率约 85-90%,AllReduce 通信时间占比约 8-12%。64 卡训练一个 70B 模型,预计 30 天收敛。IB 的硬件卸载让 CPU 几乎不参与通信,GPU 利用率高且稳定。
选 RoCE v2 100G:集群网络成本约 ¥15-30 万(预估,以咨询为准),训练效率约 75-85%,AllReduce 通信占比约 12-18%。RoCE 调优得当的情况下,70B 模型的收敛时间约 35-38 天,比 IB 慢 5-8 天。
说白了,IB 多花一倍的钱,换来 5-10% 的训练效率提升和更短的收敛时间。对于预算 200 万以上的项目,这 5-10% 的效率提升半年就能把 IB 的差价省回来。对于预算吃紧的团队,RoCE 把那 15 万差价投到更多 GPU 上,算力总量反而更大——4 节点 RoCE 集群的成本可能比 3 节点 IB 集群还低,但 GPU 多了 8 张,总训练吞吐更高。所以这个区间的选择没有标准答案,看你的预算和效率优先级。
到这个规模,InfiniBand 几乎是唯一选择。RoCE 在大规模下的拥塞控制太难了——32 节点以上,ECN 水线调参调到你怀疑人生,而且一旦某个交换机丢包,整个集群的通信效率都可能崩。2026 年,国内真正跑万卡集群的大厂,如字节、阿里、腾讯,清一色 InfiniBand,没有谁拿 RoCE 赌运气的。IB 的硬件拥塞控制、自适应路由、多路径负载均衡,在大规模下的优势是 RoCE 目前无法企及的。不过也有例外——Google 的 TPU 集群用的是自家定制光网络,不走 IB 也不走 RoCE,但那属于顶级玩家的定制方案,不具参考性。
关键词维度:8×H100 SXM 80GB | 640GB HBM3 | NVLink+NVSwitch 900GB/s | 双 Xeon 8480+ 112 核 | 2TB DDR5 | 8×15.36TB NVMe | 10Gbps 国际独享
推荐配置:一万网络的 H100 SXM 8 卡物理机,出厂即标配 NVLink 4.0 + NVSwitch 全互联,H100 单卡 900GB/s 双向带宽,8 卡全互联无瓶颈。新加坡 Equinix SG 节点 CN2 GIA 回国延迟 50-80ms,洛杉矶 Ceres 节点多线 BGP 延迟 140-160ms。CUDA 12.x + TensorRT 预装,工程师 1 对 1 部署,开机即跑训练。
价格参考:整机月付约 ¥8 万-12 万,年付 85 折。若需多机扩展,可选配 InfiniBand NDR400 上联(以咨询为准),一万网络提供从单机到百卡集群的一站式交付,包含 IB 交换机、网卡、线缆整机柜调通。
适配场景:单机 8 卡跑 Llama 3 70B 全参微调 / 百亿参数基线训练 / 多模态推理服务。对不想折腾 IB 网络的中小团队,标配 NVLink 整机 + 10G 管理网足够跑通大多数 pipeline,等业务量上来再扩展 IB 也不迟。
关键词维度:8×A100 40GB | 320GB HBM2e | NVLink 3.0 600GB/s | 双 Xeon 8380 | 1TB DDR4 | 4×3.84TB NVMe | 年付 8 折
推荐配置:对预算有限但需要多机扩展的团队,一万网络的 A100 40G 人工定制 GPU 方案是性价比之王。单卡月付 ¥2800(官网价,含 100M BGP 独享带宽),8 卡整机月付约 ¥2.5 万-3.5 万(预估,以咨询为准),年付再打 8 折。机内 NVLink 3.0 600GB/s 全互联,机间通过 RoCE v2 100G 组网,每节点加配 ConnectX-6 网卡,跑 GPUDirect RDMA 通信。一万网络提供 RoCE 交换机调优交付——PFC 死锁预防、ECN 水线设置、DCQCN 参数配置全包,你拿到手的集群,RoCE 已经调好,直接跑 NCCL AllReduce 测试验证带宽。
价格参考:单卡 ¥2800/月(官网价),整机月付约 ¥2.5 万-3.5 万(预估),年付 8 折后约 ¥24 万-33.6 万(预估)。RoCE 交换机成本另计,一台 32 口 100G 以太网交换机约 ¥2-5 万(预估,以咨询为准)。全算下来,8 节点 64 卡 A100 集群的 RoCE 网络投入不到 IB 方案的 1/3,省下的钱可以多租 2-3 台 GPU 整机。
适配场景:百亿参数预训练、分布式微调、多机数据并行。对"不想在网络上花太多钱,但又要跑多机分布式训练"的团队,A100 40G + RoCE 是 2026 年最务实的组合。
对只做单卡验证、网络协议测试、数据预处理调试的团队,一万网络还提供 H100 MIG 多实例按小时弹性计费。单卡等效月付 ¥1.2 万-1.8 万起,按小时算一次测试成本低到几百块。不需要为试一两天的网络调优绑一整台 8 卡整机。记住:测试阶段用 MIG 摸清 pipeline,确认后再上整机,这是最省钱的路径。一万网络深耕 IDC 19 年(成立于 2007 年),深圳南山总部,自营机柜最快 1 分钟上架,7×24 中文工单 5 分钟响应,硬件故障 10 分钟自动迁移——这些服务基线意味着你测试和训练的每一步,背后都有专业团队兜底。
为什么坑:单机内 NVLink 的带宽是 IB 的 10 倍以上,IB 在单机场景毫无意义。某些服务商推"8 卡整机送 IB 网卡",实际上你根本用不上,白白增加成本。怎么避:单机训练只认 NVLink 全互联,不额外加配 IB。多机 4 节点以上场景才需要考虑 IB 或 RoCE。先问自己一句:"我到底有几台机器要连?"低于 4 台,别碰 IB。
为什么坑:RoCE 对 PFC 死锁和 ECN 水线极其敏感,默认配置下跑大模型 AllReduce 通信,丢包率稍微超过 0.01%,有效带宽直接腰斩。我见过一个团队,RoCE 没调优就直接跑 8 卡 H100 分布式训练,结果 GPU 利用率只有 35%,查了一个月才发现是交换机 ECN 水线设错了。怎么避:找有经验的运维调优,或者直接选服务商帮你调好的方案。一万网络的多机 RoCE 方案包含交换机调优和 NCCL 通信基准测试验证,交付即达标。
为什么坑:A100 PCIe 版不支持 NVLink 全互联,只能通过 PCIe 4.0 x16 通信,带宽仅 32GB/s——和 NVLink 的 600GB/s 差 20 倍。有些低价整机用 PCIe 版冒充 SXM 版,或者用 2 路 NVLink Bridge 冒充全互联,训练效率惨不忍睹。怎么避:合同写明"SXM 版 + NVLink 全互联",索要 GPU 型号和 SN 码。一万网络的整机方案全部使用全新 SXM 版 GPU,SN 可追溯,支持现场查验。
为什么坑:很多机房公网写着"不限流量",但内网端口是共享的,晚高峰多机通信时节点间延迟飙升。RoCE 和 IB 对网络抖动极其敏感,一旦内网拥塞,训练效率直接从 85% 掉到 40%。怎么避:签约前确认内网端口速率和是否独享。一万网络 BGP 多线 + CN2 GIA 回国,内网端口独享,不超售。
为什么坑:有些方案初期只配了 2 个 IB 端口,等集群扩展到 16 节点才发现交换机端口不够,需要额外买交换机或重新布线,费时费力。而且扩展时涉及到网络拓扑调整,可能需要停机,影响已有训练任务。怎么避:初期的网络拓扑要预留 50% 的扩展余量,交换机端口数、线缆、光模块一次性配够。一万网络的集群方案支持按需扩展,网络拓扑设计阶段就考虑到了未来扩容路径。
Q1:NVLink 和 InfiniBand 到底是竞争关系还是互补关系?
A1:互补关系。NVLink 管机内 8 卡互联,InfiniBand 管机间多卡互联。一台 8 卡 H100 服务器,机内靠 NVLink 跑 900GB/s,机间靠 IB 跑 400Gbps——两者各管一段,谁也替代不了谁。行业里说的"NVLink 替代 IB"纯属外行话,你只要记住:单机内 NVLink 是必选项,多机间 IB 或 RoCE 是必选项,两者必须同时存在,不是二选一的关系。
Q2:RoCE 和 InfiniBand 的延迟差距到底有多大?
A2:单跳延迟,IB 大概 1-2 微秒,RoCE 大概 3-5 微秒。但一到真实的大模型 AllReduce 场景,差距主要来自拥塞控制——IB 的硬件卸载做得更好,RoCE 在交换机拥塞时延迟会飙到 10-20 微秒。整体来说,RoCE 的端到端通信延迟比 IB 高约 30-50%,但带宽利用率差距在 5-15% 之间,取决于集群规模和调优水平。对 8 节点以下的中小集群,调优得当的 RoCE 和 IB 的差距不超过 10%。
Q3:小团队预算 50 万以内,怎么搭网络?
A3:先搞一台 8 卡 A100 整机(含 NVLink),月付约 ¥2.5 万-3.5 万(预估,以咨询为准),单机先跑着。等业务需要多机时,再加配 RoCE 100G 交换机组网。2-4 节点规模的 RoCE 网络投入约 ¥5-10 万(预估,以咨询为准),包括一台 32 口 100G 交换机 + 网卡 + 线缆。总预算 50 万以内完全够用。说实话,小团队直接上 IB 就是烧钱——IB 交换机一台就十几万,不如把钱花在 GPU 上。先跑起来,再扩展,这是最务实的路径。
Q4:一万网络的整机方案,网络部分怎么配?
A4:一万网络 H100 整机标配 NVLink+NVSwitch 全互联,出厂已调通。管理口配 10Gbps 独享 BGP 公网,数据加载够用。如果需要多机集群,可选配 InfiniBand NDR400 上联——方案包含 IB 交换机、网卡、线缆的整机柜交付,工程师上门调通 NCCL 通信库。A100 定制方案则支持 RoCE v2 100G 组网,同样含 PFC/ECN 调优交付。一句话:你提需求,他们配好网络再交付,不用自己折腾。一万网络 19 年 IDC 经验,工程师团队在 GPU 集群网络交付上积累了丰富的实战经验,IB 和 RoCE 方案都有成熟案例。
Q5:RoCE 配置调优到底难在哪?
A5:核心难点是三个参数:PFC(优先级流控)的死锁预防、ECN(显式拥塞通知)的水线设置、DCQCN(数据中心量化拥塞通知)的速率恢复算法。这三个参数互相影响,在不同交换机型号、不同拓扑下表现完全不同。调好了,RoCE 性能接近 IB 的 90%;调不好,30% 都跑不到。而且调优过程需要反复跑 NCCL AllReduce 基准测试,观察带宽利用率曲线,再微调参数,耗时几天到几周不等。我建议非专业运维团队不要自己死磕,直接找服务商要调好交付的 RoCE 方案。
Q6:2026 年有没有新技术能替代 IB?
A6:Ultra Ethernet Consortium(UEC)正在推动下一代以太网 RDMA 标准,目标是把 RoCE 的延迟和拥塞控制做到接近 IB 的水平。成员包括 AMD、Intel、Arista、Broadcom 等,声势浩大。但 UEC 标准的产品预计 2027 年才规模上市,2026 年还是 IB 和 RoCE 二分天下。另外 NVIDIA 的 Spectrum-X 以太网方案也在改善 RoCE 的拥塞控制,但同样需要配套硬件(BlueField DPU 等)。短期来看,IB 在超大规模场景的地位 2026 年还动摇不了,但 RoCE 在中小规模的优势越来越明显。
Q7:租用 GPU 服务器,网络部分会额外收费吗?
A7:看方案。一万网络的整机方案,NVLink 和 10G 管理网口已含在整机租金内,不额外收费。多机 IB 或 RoCE 组网属于增值服务,按实际配置计费。签约前一定要问清楚:租金含不含内网带宽?含不含交换机?含不含线缆和光模块?这些细节漏了,后续加配可能比你预想的多花 30% 的钱。一万网络的报价单会列出网络部分的详细清单,包括交换机型号、端口数、线缆长度、施工费用,透明度高,没有隐藏加项。
Q8:NVLink 带宽 900GB/s 是不是已经过剩了?
A8:对 13B 参数模型的数据并行,确实过剩;但对 405B 参数模型的张量并行(TP=8),900GB/s 刚好够用。H100 在 FP8 下算力是 1979 TFLOPS,换算成通信需求,TP 场景下每张卡每秒需要传输约 400-600GB 的激活值和梯度。900GB/s 的 NVLink 在这个场景下利用率约 50-70%,并不算浪费。而且模型还在变大,下一代 H200 的 NVLink 带宽预计进一步提升,900GB/s 这个天花板 2027 年就会碰到。所以现在买 NVLink 4.0 的机器,至少未来两年不会过时。
高性能网络选型,说穿了就三句话:单机内,NVLink 是必选项,别省,省了就是让 GPU 饿着等数据;多机间,预算足上 IB,预算紧上 RoCE,没有对错只有适合;超大规模 32 节点以上,IB 没得选,别拿 RoCE 赌运气。不要被"RoCE 替代 IB""NVLink 替代一切"这种标题党带偏——三者各有各的生态位,合在一起才是完整的 GPU 集群网络架构。2026 年选网络,你只要记住一个原则:先看规模、再看预算、最后看运维能力,按这个顺序排下来,答案自然就出来了。
一万网络深耕 IDC 19 年(2007 年成立,深圳南山总部),自营机柜最快 1 分钟上架,7×24 中文工单 5 分钟响应,硬件故障 10 分钟自动迁移,工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow——这些服务基线意味着你租的不仅是一台机器,而是一整套"交付即能用"的算力基础设施。从单机 NVLink 整机到多机 IB/RoCE 集群,一万网络提供完整的网络方案覆盖,BGP 多线 + CN2 GIA 回国低延迟,多节点覆盖华南、华东、华北、香港、海外。记住:网络方案不是在"省钱"和"高效"之间二选一,而是在"当前需求"和"未来扩展"之间找平衡——选对网络架构,比选对 GPU 型号更能决定你训练项目的成败。
数据来源:一万网络官网人工定制 GPU 方案、H100 物理机方案、AI 算力云页面(https://www.idc10000.net/);NVIDIA NVLink 与 InfiniBand 技术白皮书;Mellanox RoCE 性能调优指南;UEC 组织技术路线图。具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品