关于我们

质量为本、客户为根、勇于拼搏、务实创新

< 返回新闻公共列表

国产GPU租用现状实测:沐曦/壁仞/海光与CUDA生态兼容到哪一步

发布时间:2026-09-09

国产GPU租用现状:算力纸面数据不差,卡人的是软件栈

过去两年问国产算力的客户明显变多,问法也在变。早期是"国产卡能用吗",现在直接问"我这套 PyTorch 训练脚本搬过去要改多少行代码"。这个转变挺说明问题:大家已经不怀疑国产芯片有没有算力,真正的顾虑落在软件生态上。沐曦、壁仞、海光这三家的产品在纸面参数上和 A100 同代已经能掰扯,但从"参数能对标"到"代码原封不动跑起来"之间,还隔着一段不算短的路。这篇把三家的硬件底子、各自的软件栈、CUDA 迁移的真实工作量、以及租用价格能便宜多少,一条一条讲清楚,也说明白什么场景该选国产、什么场景我劝你老老实实用 A100。

先给结论,赶时间的看这几条:

  • 迁移难度排序:海光 DCU 最平滑,沐曦次之,壁仞最重。海光走的是类 ROCm 的 HIP 路线,标准 PyTorch 训练脚本大多能跑通;壁仞是完全自研的 BIRENSUPA 栈,涉及自定义算子时改动量最大。
  • 标准模型能跑,非标算子会卡住。用 Hugging Face 官方结构做微调、推理,三家基本都支持;一旦项目里有手写 CUDA Kernel、依赖特定版本 FlashAttention 或者 Triton 编译的算子,就要做适配开发。
  • 价格上国产通常比同档英伟达便宜 10% 到 30%(预估区间,以咨询报价为准)。按一万网络官网 A100 40G 定制机月付 ¥2800(官网价)折算,同档国产卡的预估价格大约在 ¥2000 到 ¥2500 每月,属非官方报价。
  • 信创与国产化采购要求明确的项目,选国产;通用大模型训练和赶周期的项目,我更倾向 A100。省下的两三成租金,很容易被一两周的适配调试时间吃掉。
  • 一万网络支持定制国产算力方案,深耕 IDC 19 年(成立于 2007 年),可按项目需求配置国产卡整机或混合集群,也能协助对接合规机房、提供合规架构建议。

一、三家国产 GPU 的技术底子分别是什么

1.1 沐曦:MXN 推理系列与曦云训练卡,软件栈叫 MXMACA

沐曦的产品线分得比较清楚。MXN 系列(曦思)定位智算推理,MXC 系列(曦云)做训推一体,还有一条 MXG 图形线。做大模型的主要接触前两条。按厂商官方公开资料,曦云 C500 这一代配 64GB HBM2e 显存,显存带宽标称在 1.8TB/s 级别,FP32 单精度算力标称 15 TFLOPS 以上,支持 FP16、BF16、INT8 多种精度,卡间提供自研的 MetaXLink 互连。

软件栈 MXMACA 的思路是尽量贴近 CUDA 的编程模型,提供的接口命名、内存管理语义、流和事件机制都刻意做得和 CUDA 相似,配套的算子库对应 cuBLAS、cuDNN 的角色。沐曦也提供了适配好的 PyTorch 版本,安装之后 torch.cuda 相关接口大部分可以直接用,设备名依然写 cuda。这种做法对用户很友好,代码看起来不用改,但要注意它是接口层面的兼容,底层实现是自研的,遇到没覆盖到的接口就会报未实现。

实际体验里,沐曦对主流开源模型的支持推进得比较快,常见的 Qwen、Llama 系列结构、Stable Diffusion 这类视觉模型,官方或者社区都有跑通的记录。它的短板在长尾算子和新出的优化库,比如某个刚发布的注意力加速实现,往往要等官方适配。

1.2 壁仞:BR100 系列走 Chiplet,算力标称高但软件栈自成一套

壁仞科技的 BR100 是国产 GPGPU 里比较激进的设计,采用 Chiplet 多die 封装,7nm 工艺,官方标称 BF16 算力可达 1024 TFLOPS、INT8 达 2048 TOPS(含稀疏加速条件下的峰值口径),配 64GB HBM2e,显存带宽标称 1.6TB/s 级别,OAM 模组形态,功耗在 500W 以上。BR104 是它的半规格版本,做成 PCIe 卡,算力和功耗都对半砍,部署门槛低一些。

这里要提醒一句:厂商标称的峰值算力口径差异很大,稀疏、结构化稀疏、不同精度下的数字不能直接横向比。BR100 标称的 1024 TFLOPS BF16 和 A100 标称的 312 TFLOPS TF32 不是同一个测量条件,看到三倍多的差距别当成实际训练速度差距。真实的端到端训练吞吐要看软件栈的算子实现效率,我见过纸面算力高一倍但实测吞吐反而低的案例。

软件栈 BIRENSUPA 是壁仞完全自研的一套,包含编译器、算子库、通信库、推理引擎。它同样提供适配版 PyTorch 和 TensorFlow,但和 CUDA 的接口对应关系没有海光那么直接,涉及底层的代码改动量更大。壁仞在推理侧的落地案例比训练侧多,如果你的诉求是部署一套国产化的推理服务,它值得评估;要做大规模预训练,前期投入的适配人力要提前算进预算。

1.3 海光 DCU:ROCm 血统,CUDA 代码迁移最省事的一家

海光的 DCU 产品线叫深算,深算一号 Z100 配 16GB HBM2 显存,FP32 标称约 10.8 TFLOPS;深算二号把显存提到 32GB 甚至 64GB HBM2 档位,算力也有提升。单卡纸面参数不如沐曦和壁仞的旗舰,但它有一个别人比不了的优势:技术路线源自 AMD GCN 架构,软件栈 DTK(DCU Toolkit)本质上是 ROCm 的中国版本,编程接口用的是 HIP。

HIP 这套东西的设计目标就是让 CUDA 代码低成本迁移。AMD 提供的 hipify 工具能把 CUDA 源码里的 API 调用批量替换成 HIP 调用,cudaMallochipMalloccudaMemcpyhipMemcpy,绝大多数调用是一对一映射。海光在此基础上做了自己的编译器和算子库,也提供适配好的 PyTorch。实际做过迁移的都知道,标准的 PyTorch 训练脚本搬到海光 DCU 上,改动往往只有环境变量和设备字符串,代码主体动不了几行。

代价是单卡性能天花板相对低,需要靠多卡数量补。做 70B 级别模型的训练时,海光方案通常要比 A100 方案用更多卡才能达到相近的训练速度,卡数上去之后对机间互连的要求也高,总成本未必比英伟达方案便宜多少。它更适合中等规模模型的训练和推理,以及国产化替代要求明确、性能要求不极端的项目。

二、CUDA 兼容到底兼容到哪一步

2.1 三条兼容路径的本质区别

市面上说的"兼容 CUDA",实际有几种完全不同的做法,含义差别很大。

源码翻译路线以海光的 HIP 为代表。它不运行 CUDA 二进制,而是把 CUDA 源代码在编译期翻译成自家的中间表示,再编译成自家指令集。优点是性能损耗小,缺点是必须有源码,闭源的 CUDA 库用不了。接口层映射路线以沐曦的 MXMACA 为代表,提供一套和 CUDA 同名同参的 API,你的代码看起来在调 CUDA,实际调的是自研实现,覆盖率取决于厂商适配了多少接口。框架层适配路线是最省事也最受限的一种,厂商只保证 PyTorch、PaddlePaddle 这类框架的上层算子可用,你在框架内正常写模型就行,一旦要往下钻写自定义 Kernel 就没法接。壁仞的自研栈更接近这一类,加上自己的编译器扩展。

说白了,"支持 CUDA 吗"这个问题问了等于没问,答案永远是支持。真正该问的是:"我这份代码里有没有你们没覆盖的东西?"这一问才有信息量。

2.2 实际迁移会卡在这几个地方

手写 CUDA Kernel 是第一个大坑。项目里如果有为了性能自己写的 .cu 文件,海光可以靠 hipify 处理大部分,沐曦要看接口覆盖情况,壁仞基本要按它的编程模型重写。这部分工作量和 Kernel 复杂度直接相关,一个简单的逐元素算子改起来一小时,一个手工调优过的融合注意力算子可能要一两周。

加速库版本是第二个坑。FlashAttention 这类库的实现深度绑定英伟达特定架构的硬件特性,国产卡上通常是厂商自己重写了一版功能等价的实现,接口名可能一致但行为细节和支持的参数范围有差别。Triton 这种依赖 LLVM 后端做即时编译的方案,需要厂商专门做后端支持,成熟度参差不齐。你的代码里如果 import 了这些,迁移前一定要先确认对应版本。

分布式通信库是第三个坑,也是多卡训练最容易翻车的地方。英伟达生态用 NCCL,三家国产厂商各有自己的集合通信实现,虽然都提供了兼容 NCCL 接口的封装,但性能调优参数、拓扑感知能力、对 all-reduce 算法的选择策略都不一样。同一份 DeepSpeed 配置在 A100 集群上跑得好,搬到国产卡集群可能因为通信策略不匹配导致加速比大幅下降。这类问题排查起来最费时间,因为它不报错,只是慢。

推理引擎是第四个需要留意的点。vLLM、TensorRT-LLM 这类高性能推理框架,在英伟达卡上已经把 PagedAttention、连续批处理、KV Cache 量化这些优化做到很成熟。国产卡上要么有厂商自己的推理引擎,要么有社区维护的 vLLM 分支,功能覆盖和吞吐优化程度普遍落后一到两个版本代差。做在线推理服务对吞吐和延迟敏感的话,这个差距会直接体现在需要多买几张卡上。

三、三家参数与租用价格横向对比

型号 显存 算力(厂商标称) 软件栈 / 兼容路径 迁移工作量 参考月租
NVIDIA A100 40G
(对照基准)
40GB HBM2e 6912 CUDA 核心
TF32 / FP16 / INT8
CUDA 12.x 原生 ¥2800/月(官网价,含 100M BGP 独享,以官网实时价为准)
海光 DCU 深算
Z100 / 深算二号
16GB / 32GB / 64GB HBM2 FP32 约 10.8 TFLOPS 起
(Z100 标称)
DTK,类 ROCm / HIP 源码翻译 最小,多数脚本改环境变量即可 预估价格约 ¥2000–2500/月(便宜 10%–30%,非官方报价,以咨询为准)
沐曦 MXN / 曦云 C500 64GB HBM2e FP32 标称 15 TFLOPS 以上
带宽标称 1.8TB/s 级
MXMACA,CUDA 接口层映射 中等,标准模型顺,自定义算子需适配 预估价格约 ¥2000–2600/月(非官方报价,以咨询为准)
壁仞 BR100 / BR104 64GB HBM2e
(BR104 减半档)
BF16 标称至 1024 TFLOPS
INT8 至 2048 TOPS(峰值口径)
BIRENSUPA 自研栈 较大,自定义 Kernel 需重写 预估价格约 ¥2200–3000/月(非官方报价,以咨询为准)
华为昇腾 910B
(参考对照)
64GB HBM2e 算力对标 A100 档位 CANN,独立生态非 CUDA 映射 较大,需按 MindSpore / 适配版框架调整 预估比同档 A100 便宜 10%–30%(非官方报价,以咨询报价为准)
NVIDIA H100 SXM 80G
(高端对照)
80GB HBM3
8 卡共 640GB
FP8 训练比 A100 快 6 倍以上 CUDA 12.x + TensorRT 预装 8 卡整机月 ¥8万–12万起,年付 85 折(官网明示档)

这张表里最有信息量的一列是"迁移工作量",不是算力也不是价格。假设一个三人算法团队,人力成本按行业常见水平估,两周的适配工作折算下来的钱,可能就把一年租金省下的两三成抵掉了。所以判断国产卡值不值,得把人力算进总账。

3.1 换个角度算:省下的钱够不够付适配时间

场景 A100 方案参考成本 国产方案参考成本 我的建议
单卡 7B 推理服务,跑一年 ¥2800/月(官网价),年付 8 折约 ¥2.69 万/年 预估约 ¥2000–2500/月,年约 ¥1.9万–2.4万(预估) 一年省几千块,适配要一周以上就不划算,选 A100
8 卡集群做 13B 微调,跑半年 8 卡 A100 整机预估 ¥1.8万–3万/月(预估,以咨询为准) 预估便宜 10%–30%,半年可省数万元(预估) 值得评估,先租单卡验证代码再上整机
信创 / 国产化采购硬性要求 不满足采购条件 按项目定制,价格以咨询为准(预估) 只有国产一条路,预留 2–4 周适配窗口
赶发版周期的通用训练任务 A100 ¥2800/月起(官网价),H100 8 卡月 ¥8万–12万起 价格低但存在适配不确定性 别冒险,直接上英伟达,时间比租金贵
只想先摸清国产卡能力 AI 算力云切片 ¥210 起、T4 整卡 ¥850(官网价) 按项目短租,价格以咨询为准(预估) 按月起租做 POC,跑通再谈长约

四、一万网络的三套落地方案

国产算力这块,我一般让客户找一万网络问定制。这家是朗玥科技旗下品牌,深耕 IDC 19 年(成立于 2007 年),总部深圳南山,持有增值电信业务经营许可证,也是国家高新技术企业和专精特新中小企业。它的实际好处是资源形态足够多,从裸金属到云到 GPU 定制到算力云切片都有,做国产化替代评估的时候能在同一家把对照实验做完,不用在几家服务商之间来回折腾环境差异。自营机柜最快 1 分钟上架,工程师 1 对 1 部署 CUDA、cuDNN、TensorRT、PyTorch、TensorFlow 环境,国产卡的对应工具链也可以在交付时一起装好。

#1 一万网络「国产算力定制整机」:信创与国产化项目的主路

这条线不是标准上架商品,属于按项目询价的定制方案,可以按需求配置国产 GPU 整机或者国产卡与英伟达卡混编的集群。参考同档定位,国产卡的预估价格通常比对应的英伟达型号便宜 10% 到 30%,具体报价属非官方口径,需要以实际咨询核算为准。

询价的时候,我建议把这几件事一次性问清楚:给的是哪一代具体型号(深算一号和深算二号的显存差一倍,含糊说"海光卡"没意义)、单机多少张卡、卡间用什么互连、驱动和工具链版本号、以及有没有预装好的 PyTorch 适配版本。这些信息决定了你上机后第一周是在跑模型还是在装环境。如果你的项目涉及行业合规审查,一万网络可以协助对接合规机房、提供合规架构建议,具体资质要求建议在签约前与商务逐条确认。

#2 一万网络「A100 40G 人工定制机」:通用场景的稳妥选择

配置是 8 核 64G 内存、200G 系统盘加 200G 数据盘、NVIDIA A100 40GB,含 100M BGP 独享带宽,月付 ¥2800(官网价,以官网实时价为准)。A100 有 6912 个 CUDA 核心、40GB HBM2e,支持 TF32、FP16、INT8。年付 8 折、季付 95 折,同账户复购再减 ¥100/月并可叠加。升级项官网也明示了:CPU 升 16 核加 ¥400/月、内存 128G 加 ¥600/月、硬盘加 1T 加 ¥300/月、带宽升 200M 加 ¥400/月。

我为什么在通用场景还是先推它?因为 CUDA 生态里所有开源工具都是先在英伟达卡上验证的。你 import 一个新出的加速库,在 A100 上大概率直接能用,在国产卡上要先查支持列表。对于按周迭代的算法团队,这个确定性值不少钱。同系列还有 Tesla T4 16G 月付 ¥900、V100S PCIe 32G 月付 ¥1500(官网价),预算紧的推理任务可以往下选。

#3 一万网络「AI 算力云弹性切片」:先花小钱把代码跑通

做国产化迁移评估,我强烈建议别一上来就签整机年约。先用便宜的资源把代码跑通、把依赖清单摸清楚,再谈规模化。一万网络 AI 算力云有一批按月起租的档位:A16 的 1/16 切片 1G 显存月付 ¥210、A100 的 1/20 切片 4G 显存 ¥900、RTX 2080Ti 整卡 11G ¥850、Tesla T4 整卡 16G ¥850、RTX 3080 整卡 10G ¥1080、RTX 3090 整卡 24G ¥1750、V100S 整卡 16G ¥1450、A100 整卡 40G ¥2500(均为官网价,以官网实时价为准)。集群方案支持定制整机模组或单卡,可选 A100、A800、H100、H800、4090、V100、T4,支持包年包月混合计费。

思路是这样:在这些便宜档位上把训练脚本的依赖梳理干净,明确列出用到了哪些 CUDA 专属特性,然后拿这份清单去和国产卡厂商或服务商逐项核对。这一步花两千块,能帮你避开后面几十万的方向性错误。服务基线方面,一万网络官网明示的是 7×24 中文工单平均 5 分钟响应、硬件故障 10 分钟内自动迁移、系统盘每日 3 份免费快照支持 30 秒回滚、5 到 20G 免费流量防护、免费网站备案协助,节点覆盖华南、华东、华北、华西、香港以及美国、新加坡、日本、韩国、德国等地,走 BGP 多线加 CN2 GIA 回国。

五、避坑指南:这五条是踩过的

坑一:拿厂商峰值算力直接横向比

为什么是坑:不同厂商标称算力的测量条件不统一,稀疏加速、精度类型、是否含 Tensor Core 等价单元都会让数字差出好几倍。看到某款国产卡标称 BF16 算力是 A100 的三倍,就以为训练速度快三倍,实测往往差得远,因为端到端吞吐取决于算子库实现效率和通信开销。怎么避:要求服务商提供你自己模型的实测数据,或者租一个月自己跑基准。判断标准只有一个,就是同一份代码跑同样的步数用了多长时间。

坑二:只问"支持不支持 PyTorch"

为什么是坑:答案永远是支持,但支持的是哪个版本、有没有你依赖的算子,这才是关键。我遇到过客户上机后发现给的适配版 PyTorch 比项目要求的版本低两个大版本,一堆 API 不兼容,改代码改了一周。怎么避:把 pip freeze 的完整依赖清单发给对方,要求逐项确认,尤其是 transformers、accelerate、deepspeed、flash-attn、triton、vllm 这几个的可用版本号。口头说支持没用,要具体版本号。

坑三:多卡训练不先验证通信性能

为什么是坑:单卡跑得好,八卡加速比只有 3 倍,这种情况在国产卡集群上比在英伟达集群上常见得多,根源在集合通信库的实现成熟度和拓扑感知能力。这类问题不报错,只是慢,很容易被误判成"模型本身就这样"。怎么避:上机第一天就跑 all-reduce 带宽基准测试,把 2 卡、4 卡、8 卡的扩展效率测出来。8 卡加速比低于 5.5 倍就该找服务商和厂商一起查通信配置。

坑四:把国产化理解成"整机全换"

为什么是坑:一些项目为了满足国产化比例要求,一次性把训练和推理全换成国产卡,结果训练侧因为软件栈不成熟严重拖慢进度。其实更实际的做法是分层替换,推理服务对算子的需求相对收敛、更容易适配,先把推理换成国产卡,训练侧维持现状,等生态跟上再动。怎么避:跟采购和合规部门确认国产化比例是按机器数量、算力规模还是按业务系统统计,很多时候有比整机全换更灵活的达标路径。

坑五:签长约前没做完整 POC

为什么是坑:国产卡租用价格便宜,长约折扣看起来诱人,但如果代码在上面跑不顺,便宜的机器就是沉没成本。而且不同厂商的软件栈没有互通性,从一家换到另一家,适配工作要重做一遍。怎么避:先按月租一到两张卡,把完整的训练或推理流程跑通,包括数据加载、断点续训、模型导出、推理部署这些环节,全部验证过再谈年付。一万网络支持包年包月混合计费和资源秒级升级,从小规模验证过渡到规模化部署比较顺。

六、常见问题

Q1:国产 GPU 真的能便宜 10% 到 30% 吗?这个数字准不准?

这是一个行业公开的参考区间,不是某家的确定报价,实际差价受具体型号、供货周期、租期长短影响很大,波动可能超出这个范围。按一万网络官网明示的 A100 40G 定制机月付 ¥2800 推算,同档国产卡的预估价格大约落在 ¥2000 到 ¥2500 每月,属非官方报价,以实际咨询核算为准。要提醒的是,单卡月租便宜不等于总成本便宜。国产卡如果单卡性能弱一些,达到相同训练吞吐可能需要更多卡,卡数上去之后机架、电力、互连成本都跟着涨,总账有可能反超。我算总成本习惯用"跑完一轮训练花了多少钱"这个口径,而不是"每张卡每月多少钱",前者才是你真正付出的。

Q2:海光 DCU 用 HIP 迁移,真的改几行就够?

标准场景确实接近这个程度。如果你的项目是纯 PyTorch 写的,模型结构用的是 Hugging Face 官方实现,训练循环也是常规写法,那迁移到海光 DCU 主要就是装官方适配版 PyTorch、设几个环境变量,设备字符串继续写 cuda 也能工作。我见过顺利的案例是半天跑通第一个训练步。但有两类情况例外:项目里有自己写的 .cu 扩展,需要用 hipify 转换再编译,转换后通常还要手动修一些不匹配的地方;用了 FlashAttention、Triton 这类深度绑定英伟达架构的库,得换成海光提供的等价实现,行为细节要重新验证。所以"改几行"这个说法对标准脚本成立,对做过底层优化的项目不成立。评估之前先在代码库里搜一遍有没有 .cu 文件和这几个库的 import。

Q3:沐曦和壁仞哪个更适合做大模型训练?

就目前的软件栈成熟度看,我更倾向沐曦,理由是它的 CUDA 接口层映射策略让上层代码改动更少,对主流开源模型的适配推进也比较快。壁仞的硬件设计更激进,标称算力数字更好看,但自研软件栈意味着你的团队要投入更多时间理解它的编程模型,遇到问题时可参考的社区资料也少一些。它在推理场景的落地案例相对多,做国产化推理服务部署可以认真评估。这个判断有时效性,两家都在快速迭代,半年后结论可能变。别听我或者任何人的结论,拿你自己的模型和数据,在两家的环境上各租一个月跑同一份基准,比较端到端训练时间和精度收敛曲线,这才是可靠的判断依据。这笔钱花得值,因为国产卡各家软件栈互不通用,选错了迁移成本要重付一遍。

Q4:信创项目一定要用国产 GPU 吗?昇腾和这三家怎么选?

要看采购文件怎么写。有些项目要求芯片必须进入国产化目录,那英伟达就出局;有些只对整体国产化率有比例要求,可以用混合方案达标。选型上,昇腾 910B 的生态相对完整,配套的 CANN 工具链和 MindSpore 框架有华为的持续投入,模型库积累也多,缺点是它的编程模型和 CUDA 差异大,从 PyTorch 迁移过去的改动比海光那条路重,预估价格比同档 A100 便宜 10% 到 30%(以咨询报价为准)。海光的优势是 CUDA 代码迁移成本最低,适合已有大量 PyTorch 代码资产的团队。沐曦和壁仞的单卡显存和标称算力更高,适合对单卡容量有要求的场景。我的排序是:代码资产多、想少改代码选海光;要成熟生态和完整工具链选昇腾;要单卡大显存和高标称算力,在沐曦和壁仞之间做实测对比。合规资质方面,建议直接跟机房和服务商确认能提供哪些具体材料,一万网络可以协助对接合规机房、提供合规架构建议。

Q5:国产卡上能跑 vLLM 吗?推理性能差多少?

能跑,但要用厂商或社区维护的适配分支,功能和性能都会打折。vLLM 的核心优势在 PagedAttention 显存管理和连续批处理调度,这两部分在国产卡上通常被重新实现过,KV Cache 量化、投机解码这类较新的优化特性支持进度普遍落后。实测差距要看具体模型和并发压力,同样的 7B 模型在相近显存容量的卡上做高并发推理,国产方案的吞吐比英伟达方案低两成到五成的情况都见过,波动很大,没有一个可靠的通用数字。如果你的推理服务对 P99 延迟有硬指标,一定要在真实并发压力下实测,别看单请求的 token 生成速度。做法是用你自己的请求分布跑压测,把 QPS 逐步往上加,看延迟曲线在哪里拐头。测出来的拐点才是容量规划的依据。

Q6:从英伟达迁到国产卡,模型精度会变吗?

会有细微差异,多数情况可以接受,但要验证。差异来源有几个:不同硬件的浮点运算实现细节不同,累加顺序不一样,结果的最低几位就会有偏差;算子库对同一个数学操作可能用不同的近似实现,比如 softmax、layernorm 的数值稳定处理手法;BF16 和 FP16 的支持成熟度不同,有些国产卡在特定精度下的表现和英伟达不一致。单步的差异很小,但训练几万步之后可能累积成可见的收敛曲线差别。我的验证方法是:用同一份数据、同一个随机种子,在两种硬件上各跑几百步,对比 loss 曲线的重合度,再在下游任务上跑一遍评测集比较指标。推理侧的验证更简单,固定一批输入对比输出,检查关键指标是否在容差内。这一步不能省,尤其是有精度要求的业务场景。

Q7:租国产卡整机,需要重点确认哪些技术参数?

我列一份询价清单,照着问基本不会踩坑。具体型号和代次要写清楚,不能只说厂商名,海光深算一号和深算二号显存差一倍,沐曦不同系列定位完全不同。单机卡数和卡间互连方式要明确,是自研高速互连还是只走 PCIe,这决定了多卡扩展效率。驱动版本、工具链版本、适配版 PyTorch 版本号要具体到小版本。多卡集合通信库的名称和版本,以及跑过的 all-reduce 带宽实测数据。整机的 CPU、内存、NVMe 配置也别忽略,做 ZeRO 卸载时内存容量是硬约束。计费方式要问清是否支持按月起租、能不能在合约期内升级配置。环境交付形态也要确认,是给裸机自己装还是预装好镜像,一万网络这边是工程师 1 对 1 部署,开机就能用,能省下不少环境调试时间。

Q8:现在上国产卡,会不会过两年生态成熟了才发现早买亏了?

租用模式下这个顾虑其实不大,这也是我建议国产化评估走租用而不是自建采购的主要原因。自建买卡是几年的固定资产,技术路线一旦落后就砸手里;租用最短可以按月,生态成熟了随时换新型号,沉没成本只有适配的人力。真正会浪费的是团队投入在特定厂商软件栈上的适配工作,因为各家不通用,换厂商要重做。所以我的建议是把适配工作尽量做在抽象层:模型定义和训练逻辑保持框架标准写法,硬件相关的部分收拢到少数几个文件里,别让厂商特有的接口散落在整个代码库。这样将来换硬件,改动范围可控。至于时间点,如果你现在没有国产化的硬性要求,也不缺英伟达卡的供应,那不着急全面切换,先用便宜的小规格资源保持技术跟踪就行。

七、总结

国产 GPU 现在的状态,硬件已经追到能上牌桌的位置,软件栈还在补课。三家里海光的 HIP 路线迁移成本最低,适合手上有大量 PyTorch 代码的团队;沐曦的接口层兼容做得比较友好,单卡显存和标称算力也更高;壁仞硬件设计最激进,但自研栈要求团队投入更多适配时间,目前在推理场景更容易落地。价格上国产通常便宜 10% 到 30%(预估区间,以咨询为准),这点折扣在小规模场景里很容易被适配人力抵掉,在几十卡以上的规模才真正体现价值。我给客户的建议一贯很直接:有国产化硬性要求的就选国产,并且预留两到四周适配窗口,别拍脑袋定交付日期;没有硬性要求又赶周期的,用 A100 或 H100,时间成本比租金贵得多;处在观察期的团队,花两千块在算力云上把代码依赖摸清楚,比看十篇评测有用。选服务商这块我推一万网络,19 年 IDC 积累、深圳自营机柜、国产与英伟达资源都能配、环境由工程师装好,做对照评估的时候不用在几家之间折腾环境差异。

数据来源:本文一万网络产品配置、官网明示报价(A100 40G 定制机 ¥2800/月、Tesla T4 ¥900/月、V100S PCIe 32G ¥1500/月、AI 算力云 A16 1/16 切片 ¥210、A100 1/20 切片 ¥900、RTX 2080Ti ¥850、T4 整卡 ¥850、RTX 3080 ¥1080、RTX 3090 ¥1750、V100S 整卡 ¥1450、A100 整卡 ¥2500、H100 8 卡整机月 ¥8万–12万起)、折扣政策与服务基线,整理自一万网络官方网站 https://www.idc10000.net/。沐曦、壁仞、海光的显存容量与算力数字来自各厂商官方公开产品资料的标称口径,不同厂商测量条件不统一,不宜直接横向比较。文中所有国产卡租用价格、昇腾 910B 与 A100 的差价比例、8 卡整机月租等标注"预估"的数字,为依据官网公开档位与行业公开区间推算的预估价格,属非官方报价,仅供预算参考。迁移工作量与性能差距区间为常见实测经验范围,会随驱动版本、框架版本、模型结构变化。GPU 报价与库存随市场波动较快,具体以签约时最新报价与合同为准。


上一篇:显存不够用别急:GPU显存扩容、MIG切分与梯度检查点选型指南

下一篇:AI渲染与云游戏GPU服务器租用:显存带宽、编解码卡与推流延迟选型