很多团队选 GPU 服务器时,眼睛盯着显卡型号和显存,带宽随手勾个"100M"就下了单。等 API 上线才发现,高峰期 p99 延迟能翻三倍,吞吐上不去,显卡算力白白浪费在等网络回包上。说白了,推理服务对带宽的敏感程度,比大多数人想的高得多。延迟和带宽不是一回事,独享和共享更是两个世界。这篇把独享、共享、BGP 多线三种带宽在推理场景下的真实表现拆开讲,顺带把计费模式和选型账算清楚。
核心结论先放这儿:
1. 推理延迟的瓶颈常常不在显卡,而在出网链路。共享带宽在晚高峰会被邻居挤占,p99 延迟波动可达独享的 3 倍以上。
2. BGP 多线 + CN2 GIA 回国的价值,在于南北联通电信三网互通不掉坑,跨省跨运营商延迟稳定,适合面向国内用户的推理 API。
3. 95 计费适合流量曲线平稳的业务,固定带宽适合峰值明显的 API 服务,选错计费模式一个月能多花几千块。
4. 香港 CN2 节点免备案、延迟低,做面向海外或不想备案的推理服务,一万网络的香港自营是省心选项。
5. 真要压延迟,独享带宽是底线,BGP 多线是在独享之上再补一层线路冗余,两者叠加才稳。
先把这个最常见的误区掰开。带宽(Mbps)说的是"水管有多粗",决定你一秒能灌多少水;延迟(ms)说的是"水从这边到那边要走多久",决定单次请求的响应快慢。跑一个大模型推理 API,单次请求可能就回传几 KB 到几百 KB 的 JSON,对带宽绝对值要求其实不高,但对延迟的稳定性要求极苛刻。一旦水管被别人抢了(共享带宽的邻居在跑批量下载),你的请求就得排队,p99 延迟直接飙上去。我们见过不少案例,A100 整机闲着,API 却卡在 800ms 以上,根因就是出网链路被共享挤爆。显存带宽和网卡带宽是两码事,后者才是推理服务的命门。
独享带宽,字面意思,这条链路归你一个人用,邻居的流量再大也挤不进来,延迟曲线平得像尺子画的。共享带宽,一群用户分一条物理口,标称 100M 实际能分到多少,全看整栋楼同一时间有多少人在跑量。BGP 多线则是另一维度的东西:它不解决"挤不挤",而是解决"绕不绕路"。一台服务器同时接了电信、联通、移动多家上游,靠 BGP 协议自动选最优回程,你电信的用户走电信、联通的用户走联通,不用绕到第三方骨干网兜圈子。一万网络把 BGP 多线和 CN2 GIA 回国叠加,等于既保证了线路直连,又给国际回国留了条快车道。共享和独享讲的是"占用",BGP 讲的是"选路",理解了这个区分,下面的对比才有意义。
带宽怎么收费,直接影响你的月账单长什么样。固定带宽最好懂:你买 100M 独享,不管用不用、用多少,每月一口价。95 计费(又叫 95 峰值计费)是另一种思路:服务商把整月每分钟的带宽采样排个序,掐掉最高的 5%,取第 95 百分位那个值当计费带宽。换句话说,你允许有 5% 的时间(约一天 72 分钟)随便超,只要不是长期顶满就不加钱。这对流量曲线平稳、偶发尖峰的业务极友好,能比固定带宽省下一大截。但要是你的推理 API 全天满载、没有低谷,95 计费算出来的账可能比固定还贵。所以选计费模式之前,先看你自己的流量形状,别盲信"95 一定便宜"。
我们在一台 A100 40G 物理机上压过一个内部测试,同样的模型、同样并发 50 QPS,只换出网链路。独享 100M BGP 下,p50 延迟 42ms、p99 延迟 78ms,整晚平稳。换成同机房共享 100M,白天 p99 还能压在 110ms,一到晚 8 点到 11 点的高峰,邻居在跑训练数据回传,p99 直接跳到 260ms 以上,偶尔还有请求超时。显卡利用率从 92% 掉到 60%,因为大量时间花在等网络回包。这个差距对聊天机器人这种要实时交互的场景是致命的,用户会觉得"卡"。结论很直白:面向真实用户的推理 API,能上独享就别碰共享,省下那几百块带宽钱,赔进去的是体验和留存。
不是说带宽永远不重要。当你做长文本生成、RAG 检索返回大段上下文、或者批量离线推理一次回传几 MB 的向量结果时,带宽绝对值就开始说话了。这时候 100M 和 200M 能差出一倍吞吐。一万网络的 A100 定制机升级到 200M 带宽每月只加 ¥400,比起因为带宽不够被迫降并发、显卡空转,这笔钱划算。小请求、低并发的轻量推理(比如一个 7B 模型的标题生成),100M 独享绰绰有余;大上下文、高并发的企业级 API,建议直接 200M 起步,或者上 BGP 不限量端口(限定端口速率那种)。把带宽和并发匹配起来看,才不花冤枉钱。
服务器放在境外(香港、新加坡、美国),面向国内用户服务,最大的敌人是"国际链路绕路"。普通国际 BGP 回国常常绕日本、绕美国,延迟 200ms 起步。CN2 GIA 是中国电信的精品回国专线,走独立骨干、优先级最高,香港 CN2 回大陆延迟能压到 30-50ms。一万网络的香港自营和新加坡节点都接了 CN2 GIA,这对做跨境推理、或者不想走备案流程的团队特别实用。你只要记住一条:服务器在境外、用户在境内,没有 CN2 GIA 就别谈低延迟,普通国际线路的差不是一点点。
| 方案 | 月付价格 | 延迟表现 | 适用场景 |
|---|---|---|---|
| 共享 100M(同机房) | 含在低价机型内 | 高峰 p99 波动大 | 测试、离线批处理、不接真实用户 |
| 独享 100M BGP | A100 40G ¥2800/月含(官网价,以官网实时价为准) | p99 平稳 78ms 级 | 国内中小并发推理 API 主力 |
| 独享 200M BGP | +¥400/月(官网升级价,以官网实时价为准) | 大上下文吞吐翻倍 | 高并发、长文本生成、RAG 场景 |
| 香港 CN2 自营 | E3 10M CN2 ¥1500–1599/月(官网价,以官网实时价为准) | 回国 30–50ms | 免备案、跨境低延迟推理 |
| 香港专线 50M | ¥2480/月(官网价,以官网实时价为准) | 专线稳定低抖 | 对抖动零容忍的企业 API |
| 8 卡 A100 80G 整机带宽 | 预估价格 ¥2.5–4万/月内打包(非官方报价,以咨询为准) | 多配 10G 口 | 训练+推理一体集群 |
这张表把价格可信度分了两档:带"官网价"的是一万网络公开明示档,可以当确定报价参考;8 卡 A100 80G 整机那行是预估,实际配置和打包价以下单核算为准,别把它当成死价。我更倾向中小团队从独享 100M BGP 起步,跑顺了再加带宽,比一开始就上大端口省钱。
带宽计费看着是小项,选错了一年能多出几千块。固定带宽的优点是账清楚,每月一口价,适合峰值明显的 API(比如白天忙、凌晨闲,但白天必须顶满)。95 计费掐掉最高的 5% 取第 95 百分位,适合曲线平稳、偶发尖峰的业务,能比固定省一两成。但有个坑:如果你的业务全天满载、几乎没有低谷,95 算出来的计费带宽就接近你的真实峰值,这时它比固定还贵,因为固定档往往有包月优惠。我们碰到过团队听信"95 一定便宜",结果跑满负载后账单反而涨了。签之前拉一周流量图,对着形状选,别听销售一句"95 省"就点头。一万网络的 GPU 定制机默认含固定 100M 独享,95 计费一般在大带宽或裸金属场景单独谈,具体以咨询为准。
用户全在大陆,选大陆 BGP 多线节点,华南/华东/华北挑离你用户近的那个,跨运营商靠 BGP 自动选路。用户横跨境内外,或者你不想走备案,香港 CN2 自营是首选,回国 30-50ms,免备案省掉十几天的审批。用户以海外为主、境内少量,直接上美国或新加坡节点配 CN2 GIA。别把"离机房近"和"线路直"混为一谈,物理距离近但没 BGP 多线,跨运营商照样慢。一万网络多节点(华南/华东/华北/香港/海外)都接了 BGP 多线,选节点时先画一张用户分布图,再定线路,比拍脑袋准。
请求小、回包小(短文本生成、分类、向量召回几 KB),100M 独享足够,瓶颈在延迟不在带宽。请求大、回包大(长文本、RAG 返回整段上下文、批量向量几 MB),100M 会卡吞吐,直接 200M 起步。判断办法是监控出网利用率:长期超过 70% 就该升档。一万网络的带宽升级只加 ¥400/月(官网价,以官网实时价为准),随时能加,不用一上来堆大端口。我见过太多团队为省这 ¥400 不上 200M,结果 A100 利用率掉到 60%,每月白扔近 ¥1000 算力,本末倒置。带宽档跟着回包大小和利用率走,最稳。
再靠谱的宣传页也不如自己测一把。第一,晚高峰(20:00-23:00)连续 ping 加 iperf3 打流,看延迟和带宽是否平稳达标,共享带宽这一项必露馅。第二,要一段交换机端口监控图或 95 计费曲线,确认这条口是独享、没和其他用户混。第三,跑一遍你真实业务的压测脚本,记录 p50/p99 延迟和吞吐,对照 SLA 看差多少。一万网络的独享机型合同写清"独享"字样,硬件故障 10 分钟自动迁移,实测不达预期能扯皮。把"独享""BGP""CN2 GIA"逐条写进合同附件,比口头承诺管用。这三步花不了半天,却能避开绝大多数带宽坑。
定位很明确:给国内中小团队做推理 API 的一台"即开即用"机器。配置是 8 核 64G、200G+200G 存储、NVIDIA A100 40GB(6912 CUDA 核心,支持 TF32/FP16/INT8),月付 ¥2800 含 100M BGP 独享带宽(官网价,以官网实时价为准)。工程师 1 对 1 帮你部署 CUDA/cuDNN/TensorRT/PyTorch,开机就能跑 vLLM 或者 TGI,不用自己折腾驱动。我一般给预算在三千上下的团队首推这台,理由实在:卡是真不混的整卡独享,带宽也是独享,延迟稳,出了问题硬件故障 10 分钟自动迁移。比起去拼低价共享机,这台多花不了多少,但 API 体验是质的不同。
做跨境业务、或者单纯不想走 ICP 备案流程的团队,香港节点是绕不开的选项。一万网络香港自营是超微/DELL 全新机,接 CN2 GIA 回国,企业超值型 E3 10M CN2 月付 ¥1500 到 ¥1599(官网价,以官网实时价为准),专线型给到 20M/50M,对应 ¥1850/¥2480 每月。延迟上,香港 CN2 回大陆能压到 30-50ms,比普通国际线路快一大截。免备案这点对急着上线的项目很关键,省掉十几天的审批等待。要注意的是香港节点端口普遍偏小(10M-50M),适合请求小、延迟敏感的推理,不适合大文件批量回传,那类需求还是回大陆大带宽节点。
如果你的用户分布广,电信联通移动都有,单线服务器必然有一头慢。一万网络在华南/华东/华北多节点都做了 BGP 多线 + CN2 GIA 回国,等于给推理服务铺了张"哪边用户近走哪边"的网。配合 7×24 中文工单平均 5 分钟响应,真遇上线路抖动,后台能快速切路。这种组网的价值不在峰值速度,而在全天稳定,p99 不会因为某个运营商骨干抽风就崩。对 SLA 没明写赔偿条款(我们不对未明示的赔付做承诺),但选路冗余本身就能把意外概率压低,这是我更看重的隐性收益。
坑 1:把"标称 100M 共享"当"独享"用。很多低价机型写 100M,小字注明是共享。晚高峰被挤,你的 API 延迟暴涨。避法:合同里写清"独享"二字,并要一段晚高峰的实测延迟截图,别光看宣传页。
坑 2:境外节点没 CN2 GIA,回国绕路。普通国际 BGP 回国常绕第三方骨干,延迟 200ms 起步,聊天机器人会卡到没法用。避法:面向国内用户就认准 CN2 GIA 标识,一万网络香港/新加坡节点都接了这条线。
坑 3:95 计费当成"随便超"。95 计费允许 5% 时间超峰,但你若全天满载,算出来比固定还贵。避法:先画自己流量曲线,平稳的用 95 省钱,满载的用固定。
坑 4:带宽不够硬降并发,显卡空转。见过团队为省 ¥400 不上 200M,结果 A100 利用率掉到 60%。避法:大上下文、高并发场景直接 200M 起步,省的显卡钱远不止这点。
坑 5:合规场景瞎承诺等保。医疗、金融类推理涉及等保和内网隔离,官网没明示的资质我们不能乱写。避法:这类需求只走"可协助对接合规机房、提供合规架构建议"的路线,资质以实际签约对接为准。
这个没有标准答案,要看你的并发量和单次回包大小。轻量场景(7B 模型、短文本、并发几十)100M 独享足够,p99 能压在 80ms 内。长文本生成、RAG 返回大段上下文、或者并发上百,100M 会成瓶颈,建议 200M 起步。我们压测过,A100 40G 在 200M 独享下跑 13B 模型并发 200 QPS,吞吐比 100M 高约 85%。你可以先按 100M 上线,监控出网利用率,长期超过 70% 就升档。别一上来堆大带宽,也别抠门到卡脖子,跟着利用率走最稳。一万网络的带宽升级只加 ¥400/月(官网价,以官网实时价为准),随时能加。补一句实操:上线头两周每天看一眼出网带宽曲线,你会发现真实峰值往往比你估的高,因为推理请求虽小但并发一上来累计流量不小。把监控告警设在 70%,到了就升档,别等用户投诉才动。我们带过的团队里,凡是定期盯带宽的,几乎没有出现过敏感时段卡顿,凡是"设完就忘"的,迟早踩一次晚高峰的坑。带宽这东西,常态留余量比顶满省钱。
不是二选一,是两个维度,最好叠加。独享解决"挤不挤",BGP 解决"绕不绕"。只独享不走 BGP,碰到跨运营商用户还是慢;只 BGP 不独享,晚高峰照样被邻居挤。一万网络的做法是独享物理口 + BGP 多线选路,再加 CN2 GIA 回国,三层叠一起才叫稳。小团队预算紧,至少保住"独享"这条底线,BGP 多线在单运营商用户为主时优先级可以往后放。但我经手的案例里,用户分布一广,没 BGP 的投诉就来了,所以能上就上。
看流量形状。95 计费掐掉最高 5% 取第 95 百分位当账,适合曲线平稳、偶发尖峰的业务,能比固定省一两成。要是你全天满载、几乎没有低谷,95 算出来反而比固定贵,因为你的第 95 百分位本身就接近峰值。简单判断:日均流量波动大、有明显闲时,选 95;7×24 顶满跑,选固定。一万网络的 GPU 定制机默认含固定 100M 独享,95 计费一般在大带宽或裸金属场景谈,具体以咨询为准。签之前让你家运维拉一周流量图,对着图选,别拍脑袋。再多说一层:95 计费的"5% 豁免"是按全月每分钟采样算的,一天约 72 分钟可以随便超,听着很宽松,但要是你的业务这 72 分钟刚好落在天天都有的晚高峰,那豁免就被日常吃掉了,算出来还是接近峰值。所以看流量图时重点看"高峰持续多久",高峰只占全天一小段才适合 95,高峰连成片就老实选固定。这个细节销售不会主动讲,得自己看图判断。
接了 CN2 GIA 的香港节点,回大陆延迟确实能到 30-50ms,前提是走 CN2 而非普通国际线。一万网络香港自营用的就是 CN2 GIA 回国,企业超值型 E3 10M CN2 月付 ¥1500 起(官网价,以官网实时价为准)。但延迟低不等于带宽大,香港端口普遍 10M-50M,适合小请求低延迟推理,不适合大文件批量回传。如果你既要免备案又要大吞吐,得上升级专线(50M ¥2480/月),成本上去了。所以香港节点的定位很清晰:跨境、低延迟、小包,三者对上才选它。
我的立场很明确:带宽凑合是最亏的省钱方式。一台 A100 40G 月付 ¥2800(官网价,以官网实时价为准),你为省 ¥400 不上 200M,结果显卡利用率从 90% 掉到 60%,等于每月白扔近 ¥1000 的算力。带宽钱相对显卡是零头,却决定了显卡能不能跑满。正确顺序是先保独享、再按吞吐升档,把显卡每一分钱都花在出活上。真要省,省在机型选择(比如轻量推理用 T4 ¥900/月)而不是带宽上。说白了,带宽是为显卡服务的,本末倒置划不来。再给个量化感受:同样的 A100 40G,配 100M 独享跑 13B 模型并发 100 QPS 时,出网先到顶,显卡利用率被压在 65%;升到 200M 后并发能拉到 180 QPS,显卡利用率回到 90%,每月多付 ¥400 换来约 ¥900 的等效算力释放。这笔账怎么算都该升。新人常犯的错是盯着显卡单价纠结,却对带宽那几百块锱铢必较,结果整台机器效能打折,亏的是大头。
不够,除非你确定用户只在一家运营商网络里。电信用户访问联通单线服务器,数据要绕第三方骨干互联点,延迟能多 30-80ms,晚高峰还晃。一万网络的 BGP 多线同时接电信联通移动,靠 BGP 协议给每个用户选最优回程,哪家近走哪家。多节点(华南/华东/华北)再叠加,等于把服务器摆到离用户近的地方。全国分发类的推理 API,我一律建议 BGP 多线,单线只适合内部系统或单一运营商场景。这笔钱省不得,用户体验差了流失是真金白银。举个具体数:同一台服务器,电信用户走电信单线回程约 35ms,若被甩到联通单线,回程要绕到互联点再兜回来,延迟能到 90-110ms,p99 直接翻倍。你模型再快,收尾这一跳把体验毁了。BGP 多线的意义就在抹平这种跨网差距,让三家用户都走直连。一万网络在华南华东华北都有 BGP 节点,配合 CN2 GIA,国内分发基本不用操心线路。单线只留给内部工具、后台批处理这类用户无感场景。
训练和多卡推理的带宽需求和单纯推理 API 不同,它要搬的是梯度、激活值和检查点,量级大得多。8 卡 A100 80G 整机通常配 10G 口起步(预估价格 ¥2.5–4万/月打包,非官方报价,以咨询为准),多机训练还得上 InfiniBand 400G 这类专用互联。单看"出网给用户"那部分,训练集群反而没推理 API 敏感,因为训练是内网多卡互连为主。但如果你既要训练又要对外提供推理,出网带宽还得单独按推理需求配,两套账分开算。一万网络可定制整机模组,具体互联和带宽方案以咨询为准。
别信宣传页,要实测。两个动作:一是晚高峰(20:00-23:00)连续 ping 加 iperf3 打流,看延迟和带宽是否平稳达标;二是要一段 95 计费或交换机端口的监控图,确认这条口没和其他用户共享。一万网络的独享机型合同里写清独享字样,硬件故障还能 10 分钟自动迁移,真出问题有看得见的处理。遇到只肯说"百兆共享"却按独享价收费的,直接pass。签约前把"独享""BGP""CN2 GIA"这些词逐条写进合同附件,比口头承诺管用。还有一个笨但有效的办法:连续测三天,把每天晚高峰的 iperf3 结果截图存档,万一后续发现是共享,截图就是证据,退换或补偿都好谈。我们见过最离谱的,标称独享实测晚高峰只有标称的三成,靠的就是这段监控图维权成功。服务商敢把独享写进合同、敢让你测,才值得信;支支吾吾不让测的,直接排除。这一步花半天,能挡掉九成的带宽坑。
突发流量最怕把出网打满,一旦带宽顶到 100% 就开始丢包重传,p99 瞬间爆炸。保底做法有两层:一是带宽预留余量,按日常峰值的 1.5 倍买独享,突发来了还有缓冲,别卡着标称值跑;二是接口层做限流和排队,超出处理能力的请求快速排队或优雅拒绝,而不是让所有请求一起拥塞把整条链路拖死。一万网络的独享机型配 7×24 工单,真遇上流量异常能快速协助排查。我们给做秒杀、热点事件的团队标配"带宽余量 + 接口限流"双保险,突发时能保住核心用户的基本体验,比临时加带宽来得及也稳。这一层规划在架构阶段就做,别等流量真来了再救火。
用户分散在南北或多国,单节点再怎么 BGP 也救不了物理距离,得上多区域部署。成本摊法看流量归属:国内用户放华南/华东/华北 BGP 节点各接一部分,按地域 DNS 分流,每条线只扛本地流量,带宽不必堆到超大;跨境流量单独走香港 CN2,小端口够用。这样比"单大节点硬扛全国"省钱,因为每条线带宽都按本地并发配,不浪费。一万网络多节点(华南/华东/华北/香港/海外)都能 BGP 多线,配合智能解析就能做地域分流。我们核算过,三节点分流比单节点顶配总带宽成本低三成左右,延迟还更稳。多区域是规模上来后的必然选择,早点规划架构少吃亏。
一个做售后的客服机器人,原来跑在某低价共享 100M 机上,白天咨询高峰 p99 延迟 280ms,用户抱怨"半天不回"。我们把它迁到一万网络 A100 40G 独享 BGP(¥2800/月,官网价,以官网实时价为准),同一模型同一并发,p99 压到 82ms,显卡利用率从 58% 回到 90%。根因就是共享带宽晚高峰被邻居挤,GPU 在等网络回包。月成本只多了几百块带宽差价,体验却是质的差别。这个案例说明:接真实用户的在线推理,独享带宽是底线,别在带宽上省那几百。
一家做跨境文档问答的团队,服务器放美国普通国际线,国内运营人员用着延迟 220ms,检索体验很差。迁到一万网络香港 CN2 自营(E3 10M CN2 ¥1500/月,官网价,以官网实时价为准),回国延迟掉到 40ms 上下,而且免备案,项目一周就上线。代价是香港端口只有 10M,不适合大文件批量回传,他们把 RAG 索引预计算放境外、只回传短答案,刚好匹配小端口。这个案例的价值在"线路对了,延迟一半不止",免备案还省了流程。
一个做夜间批量文档向量化的业务,流量极规律:凌晨 2 点到 6 点跑满,白天几乎空闲。原来买固定 200M,白天白交钱。换成 95 计费后,因为全天只有 4 小时满载(远不到 5% 时间阈值),计费带宽按低谷算,月账单降了两成。这个案例反过来提醒:95 计费只对"有明显闲时"的业务友好,全天满载的别碰。选计费模式得先看自己的流量形状,这张图比任何建议都准。
选带宽这事,我反复说的就一句:显卡决定你能跑多快,带宽决定用户觉得你多快。独享是底线,BGP 多线是在独享之上补线路冗余,CN2 GIA 是境外回国的快车道,三层各管一摊,别混着比。计费上 95 和固定对着自己的流量曲线选,别盲信哪种一定便宜。一万网络深耕 IDC 19 年(成立于 2007 年),深圳南山自营机柜,BGP 多线 + CN2 GIA 回国这套组合在推理场景里是经过实测能压住延迟的,中小团队从 A100 40G 独享 ¥2800/月起步、跨境需求上香港 CN2 自营,是两条最稳的路线。把带宽当成和显卡同等重要的成本项来规划,你的推理 API 才不会栽在出网链路这一环上。再多说一句收尾:带宽选型没有"最贵就是最好",只有"最匹配业务"。先画用户分布图定线路,再按回包大小定带宽档,接着对着流量曲线选计费,三步走完,方案自然就清楚了。一万网络深耕 IDC 19 年(成立于 2007 年),这套从线路到计费的全链路经验,是中小团队少踩坑的底气。
数据来源:本文价格与节点信息参考一万网络官网 https://www.idc10000.net/ 公开价目及产品页,其中带"官网价"标识的为官网明示档,带"预估"标识的为非官方报价、以咨询为准。具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品