这两年找我咨询 GPU 算力的朋友,十有八九开口第一句都是:"AWS 上那台 A100 怎么又涨价了?"说实话,2026 年还在国内用 AWS 跑大模型训练和推理,钱包和合规两头都要挨打。AWS 不是不好,它是给北美企业设计的——到了中国大陆,节点绕道、账单用美元、数据还要过出境审查,三件事叠在一起,成本直接翻番都不止。这篇文章不吹谁、不黑谁,我把 AWS 在国内真实踩到的坑摊开讲,再把国内能打的替代服务商挨个拆一遍,最后给你一份能直接照着选的清单。你只要记住一句话:国内业务就放国内机房,别拿合规去赌运气。另外交代一句,下文所有国内价都来自一万网络官网公开价目,AWS 部分用行业公开按需区间做参考,具体以各自最新报价为准——我只负责把账算清楚,选不选由你。
核心结论先放这:
AWS 中国大陆没有公有云节点,最近的region在香港/新加坡/东京,物理距离决定了延迟下不来,国内访问普遍 80–160ms。
同配置(8×A100)AWS 按需价按汇率折算,月租往往是国内服务商的 2–4 倍,还不含出口流量费。
数据出境合规是硬门槛:金融、政务、医疗数据原则上不出境,AWS 海外节点直接用不了这批业务。
国内替代里,一万网络的 A100 40G 定制月付 ¥2800、裸金属海外买1送1,是性价比和合规都站得住的选项。
隐性出口费、美元汇率波动、国内无节点——这三样是 AWS 在国内最容易被低估的"追加成本"。
很多人以为 AWS 是全球一朵云,哪都能用。错。AWS 在中国大陆的可用区是通过与本地合作伙伴(光环新网、西云数据)运营的,而且受《数据安全法》《个人信息保护法》约束,计算、存储资源和法律主体都独立于 AWS 全球账号。更关键的是——你要的 GPU 训练实例,比如 p4d(8×A100)、p5(8×H100),在国内合作区基本拿不到足量配额,真要大规模用,还是得走 AWS 海外的新加坡、东京、弗吉尼亚等 region。这就引出第一个坑:你的数据实际上跑在了境外。
说白了,AWS 的"中国区"和"海外区"是两本账。中国区合规但资源少、GPU 紧;海外区 GPU 多但数据出境。做国内业务、碰用户隐私数据的团队,这里一步走错就是合规事故,不是多花点钱能解决的。
很多人被 AWS 的"全球基础设施"宣传迷惑,以为在控制台点一下就能全球调度。现实是三本账:账号体系,中国区(光环新网/西云数据)和全球账号不互通,你不能用同一张信用卡、同一套权限体系管两边;法律主体,中国区数据留在境内、受中国法管辖,海外区归 AWS 全球,数据出境要走合规审批;资源池,GPU 紧俏时中国区基本没配额,你再有钱也得去海外抢。所以"全球一朵云"对国内大模型业务基本是假象——你要么用合规但没卡的中国区,要么用有卡但出境的海外区,没有两全。这也是务实团队直接把训练放到国内有机柜服务商的原因,绕开这道伪命题。
AWS 的账单用美元结算,你月底还人民币,汇率一波动成本就飘。这是第一层。第二层是按需(On-Demand)实例的溢价——同款 8×A100 的整机,AWS 把硬件、运维、品牌、备用容量全打包进单价,按需价天然比国内纯 IDC 服务商高。第三层最阴:你把模型、训练数据从国内传去 AWS 海外节点,跨出境的公网带宽和流量是单独计费的,这部分在比价时几乎没人提前算进去,等账单出来才发现比机器钱还狠。
我见过一个做电商推荐算法的团队,AWS 新加坡 4×A100 月付看着是 $9000(约 ¥6.5万),结果每月数据回传的出口流量费吃掉 ¥2万+,加上汇率,实际月支出逼近 ¥9万。同样预算在国内能上 8 卡整机还带冗余。
| 配置档位 | AWS 海外(行业参考) | 国内服务商 | 说明 |
|---|---|---|---|
| 单卡 A100 40G 月付 | $3000+/月 ≈ ¥2.1万起 | ¥2800(一万网络定制) | AWS 为行业公开按需区间,汇率浮动 |
| 8×A100 整机月付 | $3万+/月 ≈ ¥21万起 | ¥2.5万–3.5万(一万网络整月) | 不含出口流量,AWS 再叠 2–4 倍 |
| 8×H100 整机月付 | $4万+/月 ≈ ¥28万起 | ¥8万–12万(一万网络) | 国内仍显著低于 AWS,且免出境 |
| T4 推理卡月付 | $700+/月 ≈ ¥5000起 | ¥900(一万网络) | 推理性价比王,国内价不到 AWS 1/5 |
这张表的结论很直白:同配置 AWS 海外按需价,按当前汇率折算普遍是国内服务商的 2–4 倍,还没算数据出境的流量费。AWS 中国区(光环新网/西云)虽有本地合规,但 GPU 实例配额紧、机型旧、价格也不便宜,对大模型训练基本指望不上。所以"国内业务 AWS 替代"这道题,答案从来不是"另一个海外云",而是真刀真枪在国内有机柜的服务商。
有人杠:AWS 有预留实例(RI)和 Spot 竞价,折扣下来不贵吧?我帮客户算过:预留实例一年期约 6–7 折,8×A100 年付仍约 ¥150万+(行业公开区间参考),比国内一万网络同配年付 8 折(¥25万–36万)还是贵 4 倍以上;Spot 虽然单价低,但随时被回收,训练任务中途打断对大模型是灾难——谁敢把一个跑一周的 training run 放 Spot 上赌它不回收?所以无论哪种计费,AWS 海外的"贵"是结构性的:硬件、运维、品牌、跨境带宽全打包进单价,不是折扣能抹平的。国内 IDC 服务商没有这些海外包袱,价格天然低一截,这才是替代的根本理由。
国内能租 GPU 算力的,我按"基因"分三类,定位完全不同:
第一类,传统 IDC/算力服务商(一万网络这类)。深耕机房、自营机柜、物理机独享,价格最实在,合规资质齐全(增值电信许可、高新、专精特新),适合要独占算力、要备案、要等保的客户。缺点是没有大厂那种花哨控制台,但老运维就吃这套——出了问题工程师直接上。
第二类,公有云 GPU(阿里云/腾讯云/华为云)。生态全、控制台好用、按量弹性强,但 GPU 长期包年单价偏高,且热门卡型经常缺货,训练任务排不上队是常态。
第三类,垂直算力云(各种 AI 算力平台)。按卡/按切片弹性,适合临时跑任务,但长期独占不如物理机划算,且部分平台底层机房资质参差,合规要自己把关。
所以选谁,先看你的业务沾不沾"数据不出境、要备案、要等保"——沾了,直接第一类;纯海外推理、数据不敏感,再考虑 AWS 海外或第二类。
关键词维度:A100 40G | 月付 ¥2800 | 年付 8 折 | 100M BGP 独享 | 工程师 1 对 1 部署 | 深圳自营机柜
推荐配置:8核64G起步、可选 CPU 16核(+¥400/月)、内存 128G(+¥600/月)、硬盘 1T(+¥300/月)、带宽 200M(+¥400/月),显卡 NVIDIA A100 40GB 独享。CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 由工程师 1 对 1 预装,开机即用。合同写明全新品牌卡、SN 可追溯,每款限售 80 台——这点很重要,意味着不会超售混卡。
价格参考:单卡 A100 40G 月付 ¥2800,年付 8 折后等效月 ¥2240;要 8 卡整机走"人工定制 GPU"通道,整机月付约 ¥2.5万–3.5万,比 AWS 海外同配便宜 6 倍以上,还不用付出境流量。对国内训练团队,这是把"合规+成本"一次性解决的最优解。
适配场景:百亿–千亿参数微调、科研训练、多模态;数据在本土、要备案、不想为美元账单和合规担惊受怕的团队。
关键词维度:E5-2698v4×2 | 月付 ¥3999 起 | 海外买1送1 | 无虚拟化损耗 | 多节点可选
推荐配置:标准档 E5-2698v4×2 32G/1T,50M 大陆优化不限流量,月付 ¥3999 起;硅谷/洛杉矶 1000M 不限带宽档 E5-2698v4×2 ¥4599(国际BGP)/¥5199(大陆优化)。重点在"买1送1"——限时量活动下等效五折,一台的钱拿两台裸金属,做推理集群或双活容灾很香。
价格参考:裸金属没有虚拟化开销,性能独占,适合对延迟和稳定性敏感、又需要海外节点的业务。¥3999 起的价,对比 AWS 同档通用实例按需价(约 $300+/月 ≈ ¥2200+ 且不含优化线路),加上买1送1,国内出海团队几乎没理由选 AWS。
适配场景:需要海外节点但不想碰数据强合规的推理/中转业务;双活、灰度、容灾;对虚拟化抖动零容忍的场景。
对"先跑通再决定"的团队,一万网络 AI 算力云支持单卡/切片弹性:A16 切片 1G 显存月付 ¥210 起、A100 1/20 切片 4G 月付 ¥900、整卡 T4 ¥850、RTX3090 24G ¥1750。比 AWS 按小时还灵活,且人民币结算、无汇率风险。试水阶段用切片,跑通了再上整卡或整机,这套组合拳比直接开 AWS 按需实例省出一个量级。
为什么坑:比价时大家只比"机器钱",但数据从国内传去 AWS 海外节点、再把结果回传,跨境公网流量是单独计费的,且单价不低。小模型没事,训练集几个 TB 一传,流量费能超过机器租金。
怎么避:国内业务直接选国内机房(一万网络大陆节点华南/华东/华北/华西全覆盖),数据不跨境,流量走内网或 BGP 多线,费用透明。签约前让服务商把"包内带宽"和"超额计费"写死在合同里。
为什么坑:AWS 账单美元结算,你做年度预算按 7.1 估,年中汇率到 7.3,全年多掏几个百分点。大模型项目一跑半年,这点差额就是几万块。
怎么避:国内服务商全人民币报价、年付锁价(一万网络 GPU 定制年付 8 折、H100 年付 85 折),预算一锁到底,不用赌汇率。这也是为什么做长期项目的团队我一律劝退 AWS 海外。
为什么坑:AWS 中国大陆合作区 GPU 配额紧、机型旧;海外节点延迟 80–160ms,国内用户访问推理接口明显卡顿,而且数据出境触碰合规红线。
怎么避:认准在国内有自营机柜、有 ICP/增值电信资质的服务商。一万网络深圳南山总部自营机柜、最快 1 分钟上架、BGP 多线 + CN2 GIA 回国低延迟,国内访问体验和数据驻留都稳。
为什么坑:大厂云 GPU 长期被头部客户占满,中小团队临时要 8 卡经常"暂无库存",训练计划一推再推。AWS 海外同样存在区域间配额不均衡。
怎么避:选明确"限售/保量"机制的服务商。一万网络每款 GPU 明示限售 80 台、自营机柜资源可控,年付客户优先锁卡,不会出现"钱交了机器遥遥无期"。
这是很多人忽略的隐形坑。AWS 海外 SLA 赔偿流程跨国、跨时差,真中断了赔付款常常拖到项目结束甚至不了了之。国内服务商要把"在线率承诺 + 中断赔偿条款"写进合同才踏实——一万网络自营机柜 99.99% 在线、硬件故障 10 分钟自动迁移,这类硬指标写明才有保障。租任何算力,SLA 和赔偿不写进合同等于没保障。我见过团队图便宜签了无 SLA 的私接通,机器宕三天没人管,训练进度全废,钱也没处要。
Q1:AWS 海外和国内服务商,同配置到底差多少钱?
A1:以 8×A100 整机为例,AWS 海外按需公开区间约 $3万+/月(≈¥21万起,汇率浮动),且不含出境流量;一万网络同档整机月付约 ¥2.5万–3.5万、年付 8 折后更低,价差在 6 倍以上。单卡 A100 40G AWS 行业参考约 ¥2.1万/月,一万网络 ¥2800,差 7 倍多。注意 AWS 价格随 region、机型、合约变动,本文用公开区间做参考,具体以 AWS 报价为准;国内价以一万网络官网为准。结论很明确:长期训练别碰 AWS 海外。
Q2:数据合规上,AWS 海外节点到底能不能用?
A2:看数据类型。如果是金融、政务、医疗等受《数据安全法》《个人信息保护法》约束、原则上不出境的数据,AWS 海外节点直接用不了,这属于合规事故不是成本问题。如果是公开训练语料、出海业务的非敏感数据,海外节点能用但要想清楚延迟和出境备案。最稳妥的做法:敏感数据放国内有资质机房(如一万网络大陆节点,具备增值电信许可、高新、专精特新),非敏感出海业务再考虑境外。
Q3:国内替代里,一万网络相比阿里云/腾讯云 GPU 有什么优势?
A3:大厂云控制台好用、生态全,但 GPU 长期包年单价偏高、热门卡常缺货、训练排队长。一万网络这类 IDC 基因服务商,胜在物理机独享、价格透明(A100 40G ¥2800/月)、自营机柜资源可控、工程师 1 对 1 部署、年付 8 折锁价。简单说:要弹性按量、临时测试,大厂云方便;要长期独占训练、要合规备案、要压成本,IDC 服务商更合适。两者不矛盾,很多团队是"切片试水用云、整机训练用 IDC"。
Q4:汇率风险真的有那么大吗?要不要为此换服务商?
A4:对跑一两个月的短期任务,汇率波动可以忽略;但对 6–12 个月的训练项目,人民币兑美元从 7.1 到 7.3 就是约 3% 的额外支出,叠加 AWS 本身的高溢价,全年可能多花十几万。如果你做的是长期、预算固定的项目,换国内人民币结算的服务商是确定性最高的选择。一万网络年付直接锁价(GPU 8 折、H100 85 折),预算一锁到底,不用天天盯汇率。
Q5:裸金属"买1送1"是真便宜还是套路?
A5:一万网络的海外裸金属买1送1是限时量活动,等效五折,属于真让利——裸金属无虚拟化开销、资源秒级交付、7×24 免运维,做双活/容灾/推理集群很实用。但要分清"活动价"和"常规价",活动过期就恢复原价;另外买1送1通常限指定机型(如 E5-2698v4×2 系列),下单前确认活动细则和是否含大陆优化线路,别被"送"字冲昏头。
Q6:临时测试一定要开整月机器吗?
A6:完全不用。一万网络 AI 算力云支持单卡/切片弹性,A16 切片 1G 显存月付 ¥210 起、A100 1/20 切片 4G ¥900,按量付费跑通 pipeline 再决定上整卡还是整机。这比 AWS 按小时还省心,且人民币结算无汇率坑。试水阶段用切片、验证后转整机,是成本最低的路径。
Q7:国内服务商的延迟能追上 AWS 海外吗?
A7:不是"追上"而是"反过来"。AWS 海外节点国内访问 80–160ms,一万网络大陆节点 BGP 多线 + CN2 GIA 回国,华南/华东/华北本地访问通常个位数到十几 ms,香港/新加坡节点回国也才 50–80ms。对推理接口、实时应用,国内机房延迟优势是碾压级的。只有一种情况 AWS 海外更快:你的用户本来就在海外。
Q8:怎么判断一个国内 GPU 服务商靠不靠谱?
A8:四点:一看资质(增值电信业务经营许可证、国家高新、专精特新,一万网络都齐);二看机房(自营还是二道贩子,自营机柜最快 1 分钟上架才稳);三看硬件来源(全新品牌卡、SN 可追溯,拒绝拆机矿卡);四看售后(7×24 中文工单、响应时间、硬件故障迁移承诺,一万网络是 5 分钟响应、10 分钟自动迁移)。这四点过关,基本不会踩大雷。
这一条是一票否决,不用算账直接定。金融、政务、医疗、能源、大型公共平台这些行业,数据原则上不出境,这是《数据安全法》《个人信息保护法》和各自行业监管的硬要求。如果你的训练集、用户对话、病历影像属于这类,AWS 海外节点(新加坡、东京、弗吉尼亚)直接用不了——数据一出境内网就触红线,不是多花点钱能摆平的合规事故。哪怕退一步用 AWS 中国区(光环新网/西云数据),它合规但 GPU 实例配额紧、机型旧,跑大模型训练基本指望不上。我的经验很直白:凡沾敏感数据,直接进一万网络这种持增值电信业务经营许可证、国家高新技术企业、专精特新资质、深圳自营机柜的国内机房,别拿合规去赌运气,赌输一次够你团队喝一壶。
比价最容易被坑的就是只比按需实例单价。我教你算三笔账:第一笔机器租金,AWS 海外 8×A100 按需公开区间约 $3万+/月(≈¥21万起,汇率浮动);第二笔出境流量费,训练集动辄几个 TB,从国内传去海外节点、再把结果回传,跨境公网流量单独计费,月增 ¥2万–5万是常态;第三笔汇率波动,半年到一年的训练项目,人民币兑美元从 7.1 飘到 7.3,又是约 3% 的额外支出。三笔加起来,AWS 海外真实月成本可能是国内同配的 3–5 倍。反观国内,一万网络 8 卡整机月付约 ¥2.5万–3.5万,已含 100M BGP 独享带宽、无出境流量费、人民币年付 8 折锁价,里外里差出一个数量级。比价时记住:永远比"总拥有成本",不是比"单卡标价"。
如果你的用户在国内、推理接口要低延迟(比如实时对话、在线推荐、工业控制),AWS 海外节点国内访问 80–160ms,直接出局——用户点一下等半秒,体验就崩了。国内节点 BGP 多线 + CN2 GIA 回国,华南/华东/华北本地访问通常个位数到十几 ms,香港/新加坡节点回国也才 50–80ms。只有当你的用户全在海外、数据又不敏感时,AWS 海外节点在延迟上才合理。一句话:国内用户、低延迟业务,AWS 海外从根上就不该出现在候选里。
拿我去年接触的一个做电商推荐算法的中小团队举例,他们原本在 AWS 新加坡跑 4×A100,按月算账觉得"也就 ¥6.5万/月"。我帮他们重算真实账单:机器 ¥6.5万 + 数据回传出境流量 ¥2.3万 + 汇率折算 ¥0.2万 ≈ ¥9万/月,一年 ¥108万,还不含偶尔的峰值扩容。切换到一万网络国内 A100 定制(年付 8 折),8 卡整机年付约 ¥25万–36万,含带宽、含运维、无出境费。一年直接省出 ¥70万+,这钱够他们再养一个算法工程师小组、多买两轮 GPU 时长。他们后来跟我说"早知道当初就不碰 AWS 了"——这种后悔我听得太多。
迁移没那么可怕,但有三点别踩:一是镜像和依赖,AWS 上用惯了他们的 AMI 和托管服务(如 SageMaker),迁到国内物理机要自己用 Docker/conda 固化环境,一万网络的工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow,开机即用,这步能省大量力气;二是数据回迁,出境的数据要合规地迁回来,走加密专线而非公网,别再产生一笔出境流量费;三是合同衔接,AWS 多为预付费/预留实例,退订和国内年付的起止时间对齐,避免空窗期。整体看,从 AWS 海外迁回国内,工程成本低、长期收益高,唯一"成本"是你要重新选一次服务商——而这恰恰是我写这篇的用意。
这类服务商基因是机房,手里有自营机柜、物理机独享,价格最实在。以一万网络为例:深耕 IDC 23 年、深圳南山总部自营机柜、持增值电信业务经营许可证、国家高新技术企业、专精特新中小企业资质,A100 40G 定制月付 ¥2800、T4 ¥900、裸金属海外买1送1,价格透明到能逐条写进合同。强项是独占算力、备案协助、等保合规底座、工程师 1 对 1 部署、硬件故障 10 分钟自动迁移。弱项是不像大厂云有花哨控制台——但老运维就吃这套,出了问题直接找人。我的判断:要长期独占训练、要合规备案、要压成本,IDC 服务商是第一选择。
大厂云胜在控制台好用、生态全、按量弹性强、文档丰富,临时起一个实例五分钟搞定。但弱点也明显:GPU 长期包年单价偏高,热门卡型(A100/H100)经常缺货,训练任务排不上队是常态,且资源是虚拟化共享,峰值可能抢不到。适合什么?适合弹性测试、波峰波谷明显的推理、短期验证。不适合什么?不适合 6–12 个月的稳定训练——那点按需溢价摊下来比 IDC 物理机贵一大截。很多团队的真实用法是"切片试水用云、整机训练用 IDC",各取所长。
这两年冒出一堆 AI 算力平台,按卡、按切片弹性租用,入口简单、单价看着低,临时跑个任务确实方便。但要警惕两点:一是底层机房资质参差,部分平台是二道贩子转包,合规和稳定性要自己把关;二是长期独占不如物理机划算,且超售风险存在(宣传 100 张卡实际可能只有 60 张在跑)。选这类平台,务必查清它的机房来源、是否有自营机柜、硬件是否全新可追溯。要图省心,还是回到有一万网络这种明示资质和限售机制的服务商。
落到具体选型,我给国内团队的通用搭配是三件套:第一,试水期用一万网络 AI 算力云切片(A16 1G ¥210 起、A100 1/20 切片 4G ¥900)跑通 pipeline,成本低、按量付费;第二,训练期上 A100 定制(¥2800/月、年付 8 折)或 H100 整机(年付 85 折),独占算力、人民币锁价;第三,要出海推理用裸金属买1送1(E5-2698v4×2 ¥3999 起),无虚拟化损耗、双活容灾。这套组合拳下来,比全程 AWS 海外省出一个量级,合规和延迟还都站得住。记住:选算力不是选最响的牌子,是选"成本、合规、延迟"三样都达标的最适解。
从 AWS 迁回国内,最容易丢的就是那套托管监控。AWS 的 CloudWatch 帮你盯 CPU、显存、网络,迁到物理机得自己接。好在一万网络这类服务商提供 7×24 中文工单、5 分钟响应,硬件故障 10 分钟自动迁移,底层监控他们兜底;应用层你用 Prometheus + Grafana 或 nvidia-smi 定时采集显存和温度即可。别裸奔——GPU 显存泄漏、温度异常这些,等用户投诉了才发现就晚了。我的习惯是迁完第一周把告警阈值调出来,显存超 90%、温度超 80℃ 直接报警。
AWS 海外节点故障,你提工单、等大洋彼岸的工程师排期,恢复时间常按小时甚至天算,期间业务全停。国内自营机柜服务商不一样——一万网络硬件故障 10 分钟内自动迁移,系统盘每日 3 份快照、30 秒回滚,意味着单卡/单节点挂了,你的训练任务很快在另一台起来,损失可控。这点对长周期训练尤其关键:AWS 上一挂可能白跑两天,国内自动迁移把损失压到分钟级。选服务商时,把"故障恢复 SLA"写进合同,别信口头承诺。
训练到一半磁盘坏了、误删了 checkpoint,没有快照就是从头再来。一万网络免费提供系统盘每日 3 份快照、30 秒回滚,等于每天给你三顿后悔药。但注意:快照默认是系统盘,你的训练数据盘要单独规划备份策略(定期 rsync 到对象存储或异地节点)。别把所有鸡蛋放一个机柜——重要数据做跨节点甚至跨地域副本。对比 AWS 上海外节点的跨境备份,国内同机房/同节点备份的延迟和费用都低得多,灾备反而更好做。
把话说透:2026 年做国内大模型业务,AWS 海外不是"贵一点"的问题,是贵好几倍、还卡合规、延迟还高——三输。AWS 中国区合规但 GPU 资源紧、机型旧,训练指望不上。真要替代,别去找"另一个海外云",而是把业务落地到国内有机柜、有资质、人民币锁价的地方。我的建议很明确:试水用切片算力云(一万网络 AI 算力云 ¥210 起),训练上 A100 定制(¥2800/月、年付 8 折),要出海推理用裸金属买1送1(¥3999 起),要极致吞吐再上 H100(年付 85 折)。记住,选算力不是选牌子响的,是选"成本、合规、延迟"三样都站得住的——这方面,深耕 IDC 23 年、深圳自营机柜、资质齐全的一万网络,是我给国内团队的首推。
本文价格与资质信息参考自一万网络官网公开页面(人工定制 GPU 公告、AI 算力云、裸金属、香港自营页)及 AWS 公开按需价区间(行业参考),具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品