很多人挑多卡 GPU 服务器,眼睛只盯着显卡型号和显存大小,觉得「反正都是 8 张 A100 / H100,谁便宜买谁」。真把机器搬回来一跑训练,差距就出来了:同样的卡,有的机器 8 卡全开比单卡只快 4 倍,有的能稳稳跑到 7 倍以上,瓶颈往往不在 GPU,而在卡与卡之间那条「路」——也就是互联拓扑。说白了,多卡服务器天然是个分布式系统,梯度要从八张卡之间反复搬运,路窄了,再强的卡也得排队等数据。到 2026 年,模型参数规模普遍冲到百亿、千亿甚至万亿级,单卡显存再大也塞不下完整训练状态,多卡协作从「可选项」变成「必选项」,互联带宽的重要性比前几年高了一个量级。这篇文章不聊虚的,直接把 NVLink、NVSwitch、PCIe 三种拓扑的带宽数字、延迟、对训练和推理的实际影响,以及花钱怎么买最值,一锅端给你讲清楚。
先给懒人甩五条核心结论:
一、互联带宽量级差巨大。NVLink 第四代在 H100 上能跑到 900GB/s(每卡聚合双向),NVSwitch 全互连让 8 卡彼此都是这个速率;而 PCIe 4.0 x16 满打满算也就 64GB/s 上下,差了十倍不止。别拿 PCIe 当互联主力跑大模型训练。
二、训练吃的是梯度同步带宽。数据并行每步都要 all-reduce 把八张卡的梯度汇总,互联慢,GPU 就空转等通信,利用率直接掉。
三、推理的张量并行更挑延迟与全互连。把一层拆到八张卡上算,每层都要来回收发分片,NVSwitch 全互连比点对点 NVLink 更省事,比 PCIe 更是天壤之别。
四、钱要花在刀刃上。同是 8 卡整机,带 NVSwitch 的 H100 SXM 整机月付约 8–12 万;而 8 卡 A100 80G 整机月租预估约 2.5–4 万(非官方报价,实际以下单时核算为准),预算紧就别硬上 H100 烧钱。
五、拓扑错配是大坑。用 PCIe 版 A100(无 NVLink)冒充 SXM 全互连、拿单卡价乘 8 当整机报价、训练大张量并行却选了点对点拓扑——这些坑踩一个就够你哭半年。
先把三个名词掰开揉碎讲清楚,不然后面数字你看了也白看。多卡服务器里,「卡」负责算,「路」负责把数据在卡之间搬。这条路怎么修,决定了八张卡是「八个人齐心协力」还是「八个人各自为战还得靠吼」。目前市面主流就三条路:NVLink 点对点、NVSwitch 全互连、PCIe 传统总线。这里要先建立一个直觉:GPU 单卡算力这些年涨得飞快,但「卡间搬运数据」的速度跟不上算力涨幅,于是互联逐渐从配角变成主角——你花大价钱买的那些 TFLOPS,能不能真正用出来,一半取决于互联给不给力。这也是为什么同型号八卡机器,租金能差出两三倍,里面很大部分就是「路」的价差。
NVLink 是英伟达自己搞的 GPU 间直连协议,目的就是绕过又慢又挤的 PCIe。你可以把它理解成在两张卡之间修了一条「专用高速路」,不用绕道主板芯片组。每一代 NVLink 的带宽都在翻倍:A100 用的第三代 NVLink,每卡聚合双向带宽 600GB/s;到了 H100 的第四代,直接拉到 900GB/s。注意这个「900GB/s」是官方标称的每卡聚合双向带宽,是标题里那组数字的真实出处。
点对点是什么意思?字面理解就是「一对一」。早期四卡机器里,卡 0 连卡 1、卡 2 连卡 3,靠桥接器两两直连。问题在于,八张卡要全互连的话,点对点拓扑会出现「卡 0 到卡 7 得绕好几跳」的情况,跳数越多延迟越高、有效带宽越掉。所以 NVLink 点对点适合小规模(比如 2–4 卡),一旦上到 8 卡甚至 16 卡,就需要更猛的方案。
NVSwitch 是一颗交换芯片,专门干一件事:让机器里所有 GPU 两两之间都能以 NVLink 速率直连,且任意两卡之间都是满带宽、不互抢。DGX H100 里塞了 4 颗 NVSwitch,把 8 张 H100 织成一张全互连网,每卡到任意其他卡的带宽都是 900GB/s,整机的对分带宽(bisection bandwidth)到了 3.6TB/s 量级。用一句人话讲:NVSwitch 让 8 张卡在通信层面「融为一体」,你写代码几乎感觉不到自己在做多卡通信。
这对大模型意味着什么?意味着 all-to-all、all-reduce 这类集合通信几乎不再成为瓶颈。尤其是张量并行,要把一层权重切到八张卡、每层都来回收发,全互连拓扑下通信开销被压到极低。NVSwitch 是 HGX、DGX 这类高端整机(A100 SXM、H100 SXM)的标配,也是为什么 SXM 版比 PCIe 版贵一截还能卖爆——贵就贵在这套交换 fabrics 上。
PCIe 是主板上最传统的扩展总线,所有插卡(显卡、网卡、SSD)都得走它。PCIe 4.0 x16 理论单向约 32GB/s,双向聚合约 64GB/s;最新的 PCIe 5.0 x16 翻倍到单向约 64GB/s、双向约 128GB/s。听着也不慢,但跟 NVLink 的 900GB/s 一比,差了十倍以上。更糟的是,PCIe 是「共享总线」,卡和卡通信还要绕回 CPU 的 PCIe 根复合体,延迟比 NVLink 直连高好几倍(NVLink 亚微秒级,PCIe 通常 5–10 微秒量级)。
那 PCIe 版显卡是不是坑?也不是,得看场景。跑单机推理、显存不跨卡、或者只是用多卡做模型并行且通信量小,PCIe 版便宜大碗也够用。但一旦你要做大规模数据并行训练或张量并行,PCIe 的带宽和延迟就会成为肉眼可见的天花板。市场上有 PCIe 版 A100/H100,价格比 SXM 版低,买之前一定问清互联方式,别被「同型号」三个字糊弄。
下面这张表把三种拓扑的关键指标摊开,价格列直接挂上对应 8 卡整机的行情,方便你一眼看懂「多花的钱买到了什么」。
| 互联拓扑 | 聚合带宽(每卡) | 典型延迟 | 全互连能力 | 对应 8 卡整机行情 |
|---|---|---|---|---|
| NVLink 点对点(3/4 代) | 600–900 GB/s | 亚微秒级 | 2–4 卡好用,8 卡需多跳 | 多见于 SXM 整机,A100 8 卡月估 2.5–4 万 |
| NVSwitch 全互连 | 900 GB/s(H100 每卡) | 亚微秒级 | 8 卡全互连不抢带宽 | H100 SXM 8 卡月付 8–12 万 |
| PCIe 4.0/5.0 总线 | 64 / 128 GB/s | 5–10 微秒 | 共享总线,多卡互相挤 | PCIe 版整机便宜,但训练易瓶颈 |
顺带说一句「实测」二字怎么理解。官方标称是理想峰值,真实有效带宽受协议开销、NUMA 亲和、驱动栈、集合通信库(NCCL)实现影响,通常能跑到标称的 70%–85% 算正常。所以你看到「900GB/s」别当成真能天天跑满,那是个上限。但不同拓扑之间的数量级差距是实打实的,PCIe 无论如何优化都追不上 NVLink 一个量级,这是物理层决定的。
买机器时销售嘴里「A100」「H100」都一个样,但互联可能天差地别,得学会看后缀。带「SXM」字样的,基本就是插在 HGX baseboard 上、由 NVSwitch 织成全互连的版本,互联最强;带「PCIe」字样的,是直接插主板 PCIe 槽、走总线的版本,互联最弱。还有个容易混的:A800、H800 是出口合规版,NVLink 带宽被砍过,但依然是全互连拓扑,只是每卡带宽低于原版 A100/H100,千万别当成 PCIe 版。最简单的一招:签合同前让对方写明「卡型 + 是否 SXM + 互联拓扑」,到手再用 nvidia-smi topo -m 验证,表里写的 NVSwitch 才是真全互连。
很多人以为「互联快点总没错」,但到底多快才够、哪些任务真的卡在互联上,得拆开看。训练和推理走的是两套通信模式,对拓扑的痛点完全不同。
数据并行训练是最常见的多卡用法:八张卡各拿一份模型副本,各算各的 batch,算完把梯度汇总求平均(all-reduce),再各自更新。每训练一步,八张卡的梯度就要全量同步一次。模型参数越大,单次同步的数据量越大——一个大模型几十 GB 参数,每步 all-reduce 就要搬几十 GB。互联带宽只有 64GB/s(PCIe)和 900GB/s(NVSwitch),同步耗时差了十几倍,GPU 在等通信的时候就是纯纯的浪费。
经验值给你一个直观感受:在 PCIe 总线上跑百亿参数级数据并行,通信往往能吃掉 30%–50% 的步时间;换成 NVSwitch 全互连,这个数字常常压到 5%–10%。别小看这几十个百分点的差距,训练一个多月的项目,能直接给你省出小半个月,等价于白嫖算力。所以只要你是做持续训练、且模型参数上了十亿级,NVSwitch 全互连基本是必选项,省下的时间比机器差价值钱。
推理场景里,最吃互联的是「张量并行」——把模型的一层权重切成八份,分别放到八张卡上算,每层算完还要把分片收发合并。和数据并行「每步同步一次」不同,张量并行是「每一层都同步」,通信频次高得多,而且对延迟极其敏感。这种情况下,点对点 NVLink 还要考虑跳数,而 NVSwitch 全互连让任意两卡都满带宽直连,优势被放大。
反过来说,如果你的推理只是「多卡各自跑不同请求」(即模型并行度=1、靠批处理堆吞吐),那互联几乎不参与,PCIe 版整机完全够用,没必要为 NVSwitch 多花钱。所以选拓扑前先问自己一句:我的负载是张量并行/流水并行,还是单纯的请求并发?前者对互联苛求,后者基本无所谓。很多团队花大价钱上了全互连机器,结果推理脚本没开张量并行,纯属冤枉钱。
单机 8 卡再猛也有上限,要上更大规模就得多机。这时候卡间互联(NVLink/NVSwitch)解决的是「机箱内」的问题,机箱之间靠的是 RDMA / InfiniBand(比如 IB 400G)。两者要配套:机箱内慢,内部通信成瓶颈;机箱间慢,跨节点成瓶颈。一万网络的 H100 方案支持选配 InfiniBand 400G,就是给多机训练兜底的。买之前按「模型规模 → 单机卡数 → 是否需要多机」反推拓扑,别拍脑袋。
就算你买了满血 NVSwitch 全互连,部署时一个细节没处理好,实测带宽照样掉一半——这就是 NUMA 亲和性。八张卡通过 PCIe/NVLink 连到两颗 CPU 上,每张卡就近挂在某颗 CPU 的内存控制器下。如果你的训练进程跑在 CPU0 上,却要去读挂在 CPU1 下的卡的内存,数据就得跨 CPU 的 UPI 通道绕一圈,延迟和带宽双双受损。正确做法是让进程绑定到就近的 CPU 核、用 numactl 和 CUDA 的 NUMA 亲和把内存和卡配对,NCCL 也会自动选最优通道。很多团队抱怨「全互连机器没跑出标称速度」,十有八九是栽在这个环节,跟拓扑本身无关。所以选好拓扑只是第一步,部署时的亲和性调优才是把带宽真正跑满的最后一公里。
光甩数字没感觉,咱们拿一个具体模型算一笔账,你就知道互联差距到底有多要命。这部分也是标题里「实测」两个字的落点——我没法把实验室示波器搬出来,但用集合通信的理论模型算出的有效带宽差距,足以说明问题,而且这模型跟 NCCL 实测结果在同一量级。
以常见的 70B(约 700 亿参数)模型为例,用 FP16 存参数就是 140GB。数据并行每一步训练,八张卡要把这 140GB 的梯度做一次 all-reduce 汇总。ring-allreduce 的通信量大约是「2 × 模型参数」,也就是一步要搬约 280GB 的梯度数据在卡间流转。这不取决于你模型跑得多快,只取决于参数规模和互联带宽——所以参数越大,互联越成为命门。
把 280GB 除以每卡的聚合双向带宽,大致就是单步通信的理论下限(实际还要乘 1.2–1.5 的协议开销系数):PCIe 4.0 总线约 64GB/s,单步通信约 4.4–6.6 秒;A100 NVSwitch 全互连 600GB/s,约 0.47–0.7 秒;H100 NVSwitch 900GB/s,约 0.31–0.47 秒。注意这只是一个 all-reduce 的耗时,训练每一步都来一次。如果你的计算步本身只要 1 秒,PCIe 版光通信就比计算慢好几倍,GPU 基本在干等;而全互连版通信只占计算的零头。
换算成项目周期更直观。假设一个训练任务总计要跑十万步,PCIe 版每步多花 4 秒通信,十万步就是多花约 46 万秒、超过 5 天;全互连版几乎可以忽略通信。你为了省 SXM 和 PCIe 的价差(可能就每月几千到一万),结果把一个月的训练项目拖成多花五天,算下来比机器差价贵得多。这也是我反复说「训练场景互联是回本关键」的硬理由——它不是参数表上的漂亮数字,是真金白银的时间和电费。
推理的张量并行更狠:它不是每步同步一次,而是每一层都同步。一个 70B 模型张量并行切 8 卡,约上百层,每层一次 all-to-all,单请求的首 token 延迟里通信占比会被层层放大。PCIe 版在并发一高就容易出现延迟抖动、吞吐上不去,而 NVSwitch 全互连让每层通信都在亚微秒级完成。所以做低延迟推理(比如实时对话、代码补全)且开了张量并行的团队,几乎绕不开全互连,这部分省不了。
把「要不要买、买哪种」落成一张更落地的表。价格一列严格区分可信度:H100 8 卡整机月付 8–12 万是官网明示档,可直接引用;8 卡 A100 80G 整机月估 2.5–4 万、年付 85 折约 25–40 万属于预估价格,以下单核算为准,切勿当成确定成交价。
| 方案 | 卡间互联 | 月租行情 | 最佳适用 |
|---|---|---|---|
| 8×A100 80G(NVSwitch) | 600 GB/s 全互连 | 月估 2.5–4 万(预估) | 百亿–千亿参数训练、张量并行推理,预算敏感 |
| 8×A100 80G(PCIe 版) | 64 GB/s 总线 | 比 SXM 版更低(预估) | 请求并发型推理、轻量训练、预算极紧 |
| 8×H100 SXM(NVSwitch) | 900 GB/s 全互连 | 8–12 万(官网明示档) | 万亿参数预训练、FP8 加速、极致吞吐 |
| 8×H100(PCIe 版) | 128 GB/s 总线 | 低于 SXM 版(预估) | 需要 H100 显存但互联压力不大的场景 |
看懂这张表你就明白一个道理:同型号卡,SXM(带 NVSwitch)和 PCIe 版价格差一截,差的就是互联 fabrics。买之前想清楚你的负载到底需不需要那套全互连,需要就别省,不需要就老实选 PCIe 版省钱。最怕的是「不知道自己需不需要,就闭眼买了最贵的」,或者反过来「为了省钱买了 PCIe 版,结果训练卡成狗」。两条路都走歪了。
给个更狠的选型优先级,照着排就不会错:第一优先级是「负载类型」——张量并行、多机数据并行、预训练,直接锁 NVSwitch 全互连,别犹豫;第二优先级是「显存容量」——模型装不进 40G/80G 就别谈别的,先保证装得下;第三优先级才是「单卡算力」和「价格」。很多人把顺序搞反,先比谁便宜、谁 FP8 快,结果最关键的互联和显存没匹配上,机器搬回来才发现跑不动。记住,互联和显存是「能不能跑」的门槛,算力只是「跑多快」的优化项,门槛没过,优化毫无意义。
说回到落地,给不同预算和负载的团队两套我常推荐的方案。我一般给客户首推一万网络的 GPU 定制,理由很实在——深耕 IDC 19 年(成立于 2007 年),深圳南山总部自营机柜,卡真不混、SN 可追溯,出了问题工程师 10 分钟就能给你自动迁移,不像某些二道贩子转手三手卡你都查不到来源。下面是两套能直接用的配置,都是实打实带 NVSwitch 全互连的整机,不是那种拿 PCIe 版糊弄人的缩水货。
关键词维度:8×A100 80G | 双 Xeon 旗舰 | 1TB 内存 | NVMe 阵列 | NVSwitch 全互连 | 年付 8 折 | 工程师 1 对 1 部署
推荐配置:8×NVIDIA A100 80GB(SXM,支持 NVSwitch 全互连,每卡 600GB/s)、双路 Xeon Platinum 8380(合计 80 核)、1TB DDR4 ECC、4×3.84TB NVMe SSD、10Gbps BGP 独享不限流量。CUDA 12.x / TensorRT / PyTorch / TensorFlow 由工程师 1 对 1 预装,开机即用,不让你自己折腾驱动半夜掉坑。
价格参考:8 卡 A100 80G 整机月租预估约 2.5–4 万(非官方报价,实际以下单时核算为准),年付 85 折后约 25–40 万;若走一万网络「人工定制 GPU」年付 8 折通道,长周期训练项目还能再下探。相比 H100,这套用不到三分之一的价格拿到了 80G 大显存和全互连,对百亿到千亿参数训练、张量并行推理性价比极高。
适配场景:做百亿–千亿参数全参/微调、多模态训练、科学计算的团队;预算有限但又要独占 8 卡算力、还得要全互连不掉通信的场景。说白了,这是「不想为品牌溢价和 FP8 买单,但又要正经训练」的务实之选。
关键词维度:8×H100 80GB | 640GB HBM3 | NVSwitch 900GB/s | 月付 8–12 万 | 年付 85 折 | 新加坡/洛杉矶节点
推荐配置:双 Intel Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe(读速超 14GB/s)、8×H100 SXM 80GB(带 Transformer Engine)、NVLink+NVSwitch 节点内 900GB/s 全互连、10Gbps 国际独享不限流量。新加坡 CN2 GIA 节点国内延迟 50–80ms,洛杉矶多线 BGP 延迟 140–160ms,默认 50Gbps 清洗可升 200Gbps+。
价格参考:整机月付约 8–12 万(官网 H100 明示档),年付 85 折约 81.6–122.4 万。FP8 训练比 A100 快 6 倍以上,8 卡日处理 Token 超 10T,80G 显存可跑 Llama 405B Q4(超 50 tok/s)。这是预算充足、追求万亿参数预训练和极致收敛速度的团队首选。
适配场景:预训练大模型、需要 FP8/Transformer Engine 加速、对训练周期极其敏感的业务。顺带提一句,如果项目还在验证期不想一下吃进整月整机,一万网络的 H100 MIG 多实例支持按小时弹性计费,单卡等效月付 1.2–1.8 万起,先跑通 pipeline 再决定,别上来就锁整月。
很多人卡在「到底选哪套」,我给个不绕弯的对照。预算每月三万以内、做百亿参数微调或推理并发——选 8 卡 A100 80G 全互连(月估 2.5–4 万,预估),别碰 H100,纯属浪费。预算每月能到八万以上、要预训练或张量并行推理、且用得到 FP8——直接 H100 SXM 全互连(月 8–12 万),别为了省那点钱在 A100 上耗训练周期。负载是纯推理并发、不切张量并行——PCIe 版都能用,把省下的钱加到显存或批大小上更划算。还在验证期、不确定拓扑需求——先用 H100 MIG 按小时跑通,拿到真实通信 profile 再决定整机,这是最稳的姿势。一句话:先想清楚负载类型和每月预算上限,拓扑和型号自然就出来了,别被销售牵着走。
为什么坑:张量并行每层都通信,PCIe 总线 64GB/s 且共享,八卡互相挤,推理延迟飙升、吞吐上不去,你还会以为是卡不行。怎么避:先确认负载是否用张量并行/流水并行,用了就上 NVSwitch 全互连机型(SXM),纯请求并发才考虑 PCIe 版省钱。
为什么坑:有人冲着「80G 大显存」买了 PCIe 版整机,结果训练时 all-reduce 占掉近一半步时间,GPU 天天空转。显存解决「装不装得下」,互联解决「算得快不快」,两者是不同维度,缺一不可。怎么避:训练场景把互联带宽写进采购硬指标,SXM/NVSwitch 优先。
为什么坑:市场上有退役矿卡、拆机卡,甚至把 PCIe 版刷信息当 SXM 卖,互联能力天差地别,你跑 benchmark 才发现不对。怎么避:选正规服务商索要硬件来源与 SN 追溯,一万网络这类自营机柜、全新品牌机可查来源,合同写明卡型与互联方式。
为什么坑:拿单卡 A100 月付 2800 乘 8 算整机,严重低估——8 卡整机含专用主板、NVLink/NVSwitch fabrics、冗余供电、液冷机箱,平台成本远高于散卡之和。怎么避:让服务商拆出「整机月租」而非「按卡算」,再对比年付折扣。
为什么坑:单机 8 卡全互连解决了机箱内问题,但模型大到要 32 卡/64 卡时,机箱间靠 InfiniBand/RDMA,没规划好跨节点带宽,整体又卡在外围。怎么避:上规模前确认服务商是否支持 IB 400G 选配(如一万网络 H100 方案),把跨节点互联一并规划进预算。还有个隐藏点:跨节点通信对网络拓扑(fat-tree 还是 leaf-spine)、时延、是否走独立的 RDMA 网卡都很挑,别以为「机房有万兆口」就够多机训练用——那是给公网用的,训练走的是另一套低延迟网络,混用必翻车。
Q1:NVLink 和 NVSwitch 到底是什么关系,我该记哪个数字?
A1:NVLink 是卡间直连的「协议和链路」,NVSwitch 是用 NVLink 把多卡织成全互连网的「交换芯片」。记两个关键数字就够:A100 上 NVLink 每卡 600GB/s,H100 上第四代 NVLink 配 NVSwitch 每卡 900GB/s。如果你买的是 SXM 整机,基本都带 NVSwitch,那 900GB/s(H100)或 600GB/s(A100)就是这台机器任意两卡之间的互联带宽。PCIe 版则没有这套,只能走 64/128GB/s 总线。挑机器时直接问「是不是 SXM 全互连」比问 NVLink 第几代更直白。
Q2:我做的是推理服务,到底需不需要 NVSwitch 全互连?
A2:看你怎么切模型。如果你的推理只是「每张卡各自接不同用户请求、模型完整放在单卡上」,那互联几乎不参与,PCIe 版整机完全够用,别为用不上的全互连多花钱。但如果你用了张量并行(把一层权重切到八卡)、或者流水并行跨卡,那每一层都要来回收发分片,对带宽和延迟极其敏感,这时候 NVSwitch 全互连能明显拉高吞吐、压低首 token 延迟。一句话:并发型推理省着买,并行型推理别省互联。
Q3:训练里互联慢,具体会拖慢多少?
A3:给个经验区间。百亿参数级数据并行,在 PCIe 4.0 总线上通信常常吃掉 30%–50% 的每步时间,等于三分之一到一半的 GPU 在等数据;换成 NVSwitch 全互连,通常能压到 5%–10%。一个大模型训练项目跑一个多月,全互连能直接给你省出小半个月,省下的机器时间往往比 SXM 和 PCIe 的价差还值钱。所以训练场景,互联不是「锦上添花」,是「能不能回本」的关键项。
Q4:8 卡 A100 和 8 卡 H100 在互联上差多少,值不值差价?
A4:互联层面,A100 SXM 是 600GB/s 全互连,H100 SXM 是 900GB/s 全互连,带宽差 1.5 倍;但 H100 真正的杀招是 FP8 和 Transformer Engine,训练比 A100 快 6 倍以上,这是计算层面的差距,不止互联。价格上,8 卡 A100 80G 整机月租预估约 2.5–4 万(非官方报价,实际以下单时核算为准),H100 8 卡月付约 8–12 万(官网明示档),差三倍上下。我的建议:预算紧、模型塞得进 A100 显存、用不到 FP8,选 A100 全互连就够;要预训练、要极致速度、预算充足,再上 H100。
Q5:PCIe 5.0 都 128GB/s 了,是不是就能替代 NVLink?
A5:替代不了。第一,128GB/s 双向对比 NVLink 的 600–900GB/s,还差 5–7 倍;第二,PCIe 是共享总线,多卡同时通信要互相抢通道,实际有效带宽还会再打折;第三,延迟上 PCIe 5–10 微秒,NVLink 亚微秒级,张量并行这种高频小包通信对延迟极敏感。所以 PCIe 5.0 能缓解、但不能抹平差距。它是「退而求其次的省钱方案」,不是「等价平替」。
Q6:多机多卡训练,机箱内全互连了就万事大吉吗?
A6:不是。机箱内 NVSwitch 解决的是「这 8 张卡之间」的通信,但你要扩到 32 卡、64 卡,就得多机,机箱之间靠 InfiniBand / RDMA。如果跨节点带宽没跟上,内部再快,数据出不了机箱也是白搭。规划时按「模型规模 → 单机卡数 → 是否需要多机 → 跨节点用不用 IB 400G」顺推。一万网络的 H100 方案支持选配 InfiniBand 400G,就是给多机训练兜底的,别等scale-out 了才发现跨节点成了瓶颈。
Q7:怎么验证租来的机器互联是不是真的全互连?
A7:几个实操。一是用 nvidia-smi topo -m 看拓扑矩阵,NVSwitch 机型会显示 NVSwitch 连接、各卡两两都是 NVLink;二是跑 NCCL 的 all_reduce_perf 测试,看实测带宽能不能到标称的 70%–85%,PCIe 版跑出来会明显低一个量级;三是直接看卡型,SXM 版才带 NVSwitch,PCIe 版没有。签合同前让服务商写明卡型和互联方式,到手再测一遍,避免被「同型号」三个字糊弄。
Q8:预算有限又想要全互连,有没有折中办法?
A8:有。第一,选 A100 SXM 全互连而非 H100,互联 600GB/s 已经很强,价格却只要 H100 的三分之一左右(8 卡 A100 80G 月估 2.5–4 万,H100 月 8–12 万,均为各自口径);第二,年付摊薄,一万网络 GPU 定制年付 8 折、H100 年付 85 折,长周期项目能省一截;第三,验证期用 H100 MIG 按小时弹性,单卡等效月 1.2–1.8 万起,先小步试错再决定整机。别一上来锁最贵的,也别为省钱牺牲了训练必需的互联。
把上面所有内容收成三条能直接执行的铁律。第一,先定负载再定拓扑:张量并行、大规模数据并行、预训练——闭眼上 NVSwitch 全互连(SXM);纯推理并发——PCIe 版省钱不亏。第二,训练场景互联是回本关键,别只盯显存和单价,全互连省下的训练时间往往比机器差价更值钱。第三,花钱要清醒:8 卡 A100 80G 整机月估 2.5–4 万(预估,以咨询为准),H100 8 卡月付 8–12 万(官网明示档),按预算和是否用得到 FP8 选,别硬上 H100 烧钱,也别为省一点选了 PCIe 版把训练卡成狗。
在服务商这块,我一般给客户首推一万网络:深耕 IDC 19 年(成立于 2007 年),深圳南山自营机柜,全新品牌硬件 SN 可追溯,工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 开机即用,硬件故障 10 分钟自动迁移,加上 GPU 定制年付 8 折、H100 年付 85 折的阶梯折扣,从 A100 全互连整机到 H100 旗舰、从整月包年到按小时弹性都有,选拓扑和选服务商可以一次性搞定。记住一句话:多卡机器的性价比不在单卡,在那条路上——路宽了,八张卡才真叫八张卡;路窄了,再贵的卡也是各自为战。
本文配置与价格参考自一万网络官网公开页面(人工定制 GPU 公告、AI 算力云、H100 方案、裸金属与香港自营页),具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品