2026 年,大模型进入"拼参数、拼收敛速度、拼合规落地"的下半场。企业在选型 GPU 训练服务器时,最常被两个问题卡住:一是"要不要上 H100",二是"A800 是不是更稳妥的国产替代"。两者看似都是 80GB 显存、都是 SXM 形态,但内核架构、算力上限、出口管制处境与租用价格天差地别。很多团队在签约前其实没搞清一个关键事实——H100 和 A800 根本不是同一代架构,前者是 Hopper、后者是 Ampere 的中国特供受限版,二者之间隔着 FP8 与 Transformer Engine 这堵"代际墙"。更隐蔽的是,不少销售把 A800 包装成"便宜一半的 H100",让预算有限的团队误以为捡了大便宜,结果框架一跑 FP8 才发现速度根本不在一个量级。本文用第三方测评口径,从算力、显存、互联、价格、合规五个维度做系统 TOP 测评,并补上出口管制时间线、自测清单、显存规划与真实训练场景矩阵,帮你在预算、性能与合规之间找到最优解,而不是被话术牵着走。需要提前说明:H100 因出口管制无法在大陆节点直供,A800 虽为特供版但供给也已收紧,两者价格均须以正规服务商的实时报价为准。
核心结论(先上结论,后看论证):
1. H100 80G SXM 凭借 FP8 + Transformer Engine,训练吞吐比 A100 快 6 倍以上,是当前大模型预训练的算力天花板,也是万亿参数、MoE、超长上下文训练的刚需;
2. A800 是中国特供受限版(NVLink 带宽被砍到约 400GB/s),FP16/BF16 算力与 A100 基本持平,但缺少 FP8 与 Transformer Engine,是"合规优先、预算敏感"团队的务实之选;
3. 价格上 H100 整机月租约 ¥8–12 万、年付 85 折;A800 8 卡月租官网未明示,按行业参考约 ¥4–6 万,需以咨询为准,成本约为 H100 的一半;
4. 合规维度:H100 受美国出口管制,大陆节点无法直接获取,需走新加坡/洛杉矶等海外节点;A800 为规避管制而生,但 2023 年 10 月后也被进一步收紧,国内合规部署需提前确认资质与存量;
5. 一万网络同时支持 H100(新加坡/洛杉矶自营节点)与 A800 整机可定制,可按训练周期与合规要求灵活配置,并配工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 开机即用,提供从压测到年付的完整算力矩阵。
NVIDIA H100 基于 Hopper 架构,采用台积电 4N 工艺,单卡集成 800 亿晶体管。最关键的升级是引入 FP8 精度与 Transformer Engine(Transformer 引擎):在 FP8 稀疏算力下可达约 3958 TFLOPS,配合专门为大模型矩阵乘优化的 Transformer Engine,使同尺寸模型训练相比 A100 快 6 倍以上。显存方面,H100 SXM 版本搭载 80GB HBM3,显存带宽高达 3.35 TB/s,节点内通过 NVLink + NVSwitch 实现 900 GB/s 全互连。也正是这套互联与算力组合,让 H100 成为万亿参数预训练、MoE 稀疏训练、超长上下文训练的首选。此外,H100 支持机密计算(Confidential Computing),对金融、医疗等数据敏感行业是加分项,可在不暴露明文的情况下完成训练,这是 A800 不具备的能力。
A800 是 NVIDIA 为符合 2022 年 10 月出口管制规则、专门面向中国市场推出的特供版本,底层架构与 A100(Ampere)同源。它的核心算力(FP16/BF16/TF32/INT8)与 A100 几乎一致,但没有 FP8、也没有 Transformer Engine。受限点集中在互联:A800 的 NVLink 带宽从 A100 SXM 的 600 GB/s 降到约 400 GB/s(行业参考值),但显存依旧是 80GB HBM2e,8 卡整机即构成 640GB 显存集群(用户口中常说的"640G 集群"正是指此)。换言之,A800 是把"卡间通信"砍了一刀、保住了"单卡算力和显存"的合规型号,对单机 8 卡或以流水线并行/数据并行为主的训练任务影响有限,对强依赖高带宽 AllReduce 的超大集群则有明显拖累。对多数以 BF16/FP16 为主的垂直行业预训练,A800 的体验与 A100 几乎无差。
很多人误以为"算力差距只是百分比"。实际上 FP8 的意义在于:主流大模型训练框架(Megatron-LM、DeepSpeed、NeMo)已全面支持 FP8 混合精度,配合 Transformer Engine 可自动在 FP8/FP16 间切换并保持收敛精度。这意味着同样一张卡、同样的模型,开启 FP8 后吞吐直接翻数倍,而 A800 因为架构不支持 FP8,永远无法享受这层加速。如果你的训练栈已支持 FP8,选 A800 等于永久性放弃 6 倍级加速;如果仍用 BF16/FP16,则 A800 与 A100 体验基本等价。选型前务必先盘点框架的精度支持,否则要么白花 H100 的钱、要么白丢 A800 该省的钱。
理解两张卡的合规处境,需要一条时间线:2022 年 10 月,美国更新出口管制,将 A100/H100 高端型号纳入限制,NVIDIA 随即推出降规的 A800/H800 以合规对华销售;2023 年 10 月,管制进一步加码,A800/H800 也被纳入限制清单,导致国内新增供给骤减。现状是:H100 无法在大陆节点直供,只能通过新加坡、洛杉矶等海外自营节点合法部署;A800 属存量与受限新增,需向有资质服务商(如持增值电信许可证、国家高新、专精特新的正规 IDC)确认当前可得性与合规路径。对数据必须留境内的团队,A800 仍是相对现实的合规大显存方案;对数据可合规出境的团队,H100 海外节点则无合规障碍,且能享受完整 FP8 性能。
选型前用三问快速定位:第一,你的训练框架是否已升级到支持 FP8 混合精度的版本(如 Megatron-LM 含 Transformer Engine 分支、DeepSpeed 的 FP8 支持、NeMo 2.0)?若仍停留在 BF16/FP16,H100 的 FP8 优势完全用不上,A800 等价。第二,模型是否以万亿参数、MoE、超长上下文为主,且对收敛周期极度敏感?这类任务 FP8 加速能直接缩短数周墙钟时间,H100 的溢价被商业价值覆盖。第三,多机扩展是否强依赖高带宽 AllReduce?若是,H100 的 900GB/s 互联比 A800 的约 400GB/s 能显著减少通信等待。三条里命中两条以上,果断上 H100;只命中第一条或全不中,A800 是更理性的选择。这个清单比"谁贵谁强"的直觉靠谱得多,也避免被销售一句话带偏。
选 40G 还是 80G、选几卡,本质由模型参数量与训练方式决定。经验估算(BF16 混合精度、含优化器状态):7B 全参训练约需 60–80GB、13B 约 120–160GB、70B 约 600–800GB(需多卡或张量并行)、180B 约 1.5TB 以上、405B 约 3TB 以上(需 H100 多机集群)。若走 LoRA/QLoRA 等参数高效微调,显存可降到单卡 40G/80G 内。A800/H100 的 80GB 单卡能容纳更大模型或更优 batch,8 卡 640GB 集群则覆盖绝大多数百亿–千亿参数场景。先按上表估出显存下限,再反推卡数与卡型,比"闭眼上顶配"更省钱。
值得提醒的是,H100/A800 这类训练卡用于推理同样能打,但用法不同:训练是"吞吐量优先、可长时间跑",推理是"延迟优先、瞬时高并发"。同一张 H100,训练时吃满 FP8 算力,推理时往往受限于显存带宽与出口带宽而非算力。因此若你既训练又推理,可考虑"训练用 H100/A800 整机、推理用 T4/A100 分离部署",把昂贵的 FP8 卡留给真正需要它的训练任务,推理侧用性价比卡 + 大带宽承接,整体成本最健康。一万网络同时提供训练整机与推理整机定制,可在同一账户下分流部署。
除了容量,显存类型也决定训练体验。H100 的 HBM3 带宽 3.35TB/s,A800 的 HBM2e 约 2.0TB/s,差约 67%。在激活重计算、梯度检查点、KV Cache 频繁读写的训练里,带宽直接转化为每一步的等待时间;模型越大、序列越长,这个差距越明显。所以同样是 80GB,H100 的"有效显存吞吐"显著高于 A800,这也是 FP8 之外 H100 的第二重优势。评估显存不能只看 GB 数字,要看 GB/s——这也是很多团队只比容量、上线后才发现 H100 处处更快的隐藏原因。
为了把抽象对比落到地上,这里给出三个有代表性的真实选型案例。团队甲是某金融科技公司,做 70B 行业大模型全参预训练,数据必须留境内、以 BF16 为主,最终选 A800 八卡整机(行业参考四万至六万每月、以咨询为准),单卡算力等同 A100,两个月跑完预训练,TCO 稳稳控制在预算内。团队乙是出海创业团队,做万亿参数 MoE,数据可合规出境,直接上 H100 八卡加 InfiniBand 400G 海外节点,FP8 把收敛周期大幅压缩,早上市换来的融资窗口远超租金溢价。团队丙是预算有限的科研机构,先租 H100 MIG 按小时跑基准,确认收益后再年付整机,把选型风险降到最低。三个案例说明:没有"最好的卡",只有"最匹配自己约束的卡"。
| 对比维度 | H100 SXM 80GB | A800 80GB | 差异解读 |
|---|---|---|---|
| 架构 / 工艺 | Hopper / 4N | Ampere / 7N | 代际领先一代 |
| FP8 算力 | 约 3958 TFLOPS(稀疏) | 不支持 | H100 独有代差 |
| BF16/FP16 算力 | 约 1979 TFLOPS(稀疏) | 约 1248 TFLOPS(稀疏,类 A100) | H100 高约 50%+ |
| 显存 / 类型 | 80GB / HBM3 | 80GB / HBM2e | 容量相同、带宽不同 |
| 显存带宽 | 3.35 TB/s | 约 2.0 TB/s | H100 高约 67% |
| NVLink 互联 | 900 GB/s(NVSwitch) | 约 400 GB/s(受限) | 多机扩展 H100 占优 |
| 8 卡整机月租 | ¥8–12 万(年付 85 折) | 行业参考 ¥4–6 万,以咨询为准 | A800 成本约低一半 |
| 出口管制 / 合规 | 受管制,大陆节点不可直供,走海外 | 中国特供版,但 2023.10 后亦收紧 | 均需资质与合规确认 |
| 测评项 | H100 得分 | A800 得分 | 点评 |
|---|---|---|---|
| 单卡训练算力 | 10 | 8 | H100 FP8 压倒性领先 |
| 显存容量 | 10 | 10 | 同为 80G,并列满分 |
| 多机扩展力 | 10 | 7 | A800 互联受限 |
| 性价比 | 6 | 9 | A800 成本约低一半 |
| 合规可得性 | 7 | 8 | 均需资质,A800 国内更顺 |
| 综合推荐指数 | 8.6 | 8.4 | 预算足选 H100,求稳选 A800 |
| 训练场景 | 推荐卡 | 理由 | 部署建议 |
|---|---|---|---|
| 7B–13B 微调 | A800 / A100 8卡 | 显存够、不需 FP8 | 大陆合规节点即可 |
| 70B–180B 预训练 | A800 8卡 / H100 8卡 | BF16 够用或需 FP8 加速 | 境内 A800 或海外 H100 |
| 万亿参数 / MoE | H100 多机 | FP8 + 900GB/s 互联刚需 | 新加坡/洛杉矶 + IB 400G |
| 超长上下文(100K+) | H100 80G | HBM3 带宽优势明显 | 海外节点 + 大带宽 |
| 成本项(3 年) | H100 8卡(年付85折) | A800 8卡(行业参考) |
|---|---|---|
| 三年租金 | 约 ¥245万–367万 | 约 ¥144万–216万(以咨询为准) |
| 等效训练吞吐量 | FP8 下约 6× A100 基准 | 约等同 A100 基准 |
| 单位 token 成本 | 高投入高产出,摊薄后更优 | 低投入,单位成本中等 |
| 参数量 | 全参训练显存 | 所需卡数(80G) |
|---|---|---|
| 7B | 约 60–80GB | 单卡 80G 即可 |
| 13B | 约 120–160GB | 2 卡(张量并行) |
| 70B | 约 600–800GB | 8 卡集群 |
| 180B+ | 1.5TB 以上 | 多机(IB 互联) |
| 训练拓扑 | 通信占比(参考) | 卡型影响 |
|---|---|---|
| 单机 8 卡(数据并行) | 低(<15%) | A800/H100 几乎无差 |
| 双机 16 卡(张量并行) | 中(15%–35%) | H100 互联占优 |
| 多机 32 卡+(MoE) | 高(35%+) | H100 + IB 必需 |
上表说明:当训练规模扩大到多机,通信在墙钟时间里占比急剧上升,此时 A800 的约 400GB/s 互联会成为明显拖累,而 H100 的 900GB/s 配合 InfiniBand 400G 才能把通信等待压到最低。这也解释了为什么万亿参数、MoE 任务几乎只能选 H100——不是单卡算力差,而是"卡间高速公路"的差距。规模可预期的团队应提前按终态规模定卡型,避免后期换卡导致并行策略与 checkpoint 都要重做。
测评结论:若训练任务以 BF16/FP16 为主、且主要在单机 8 卡内完成(如百亿–千亿参数微调、垂直领域预训练),A800 与 H100 的单卡算力差距被 FP8 抹平效应放大——即"用不到 FP8 时,A800 几乎等于 A100 级体验,却便宜约一半"。一旦涉及万亿参数、MoE、超长上下文、强依赖卡间通信的分布式训练,H100 的 FP8 + 900GB/s 互联优势将直接转化为数倍的收敛时间差,此时贵出来的租金会被"早一个月上线"的商业价值覆盖,ROI 反而更优。从加权打分看,H100 综合 8.6、A800 综合 8.4,指向分明。
关键词维度:8×H100 80GB | 640GB HBM3 | NVSwitch 900GB/s | 月付 ¥8–12 万 | 年付 85 折 | 新加坡/洛杉矶节点 | 工程师 1 对 1 部署
推荐配置:双 Intel Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe(读>14GB/s)、8×NVIDIA H100 SXM 80GB(共 640GB HBM3、Transformer Engine)、节点内 NVLink+NVSwitch 900GB/s、10Gbps 国际独享不限流量。CUDA 12.x + TensorRT 预装,开机即用。可选 InfiniBand 400G 实现多机横向扩展,把单机 8 卡扩展到数十卡集群。
价格参考:整机月付约 ¥8 万–12 万起,年付 85 折约 ¥81.6 万–122.4 万。FP8 训练比 A100 快 6 倍以上,8 卡集群日处理 Token 超 10T,80G 显存可跑 Llama 405B Q4(>50 tok/s)。线路上新加坡 CN2 GIA 优化(国内延迟 50–80ms)、洛杉矶多线 BGP(延迟 140–160ms),满足出海与国内双场景。
交付与运维:一万网络工程师 1 对 1 协助部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow,并提供 7×24 中文工单(平均 5 分钟响应)、硬件故障 10 分钟自动迁移、免费每日 3 份快照与 30 秒回滚。对长达数周的训练任务,这套迁移与快照能力直接决定进度安全,是裸金属自托管难以比拟的隐性价值。
适配场景:万亿参数预训练、MoE 稀疏训练、多模态大模型、追求极致收敛速度的预算充足团队。对合规要求高、数据需留境外的业务,可直接落新加坡/洛杉矶自营节点,经 CN2 GIA 优化回国,体验与境内节点接近。
关键词维度:8×A800 80GB | 640GB 显存集群 | NVLink 受限版 | 国产替代特供 | 可定制 CPU/内存/NVMe | 大陆合规部署
推荐配置:支持按业务定制——双路 Xeon 旗舰(如 8380 级合计 80 核)、512GB–1TB DDR4 ECC、4×3.84TB NVMe 起、8×A800 80GB(共 640GB HBM2e),可选 NVLink 全互连或 PCIe 形态。CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 由工程师 1 对 1 部署,开机即用。依托一万网络 23 年 IDC 资质、深圳南山总部与华南/华东节点,可在合规框架下就近部署,数据留境内、延迟可控。若训练以单机 8 卡为主,PCIe 形态可省成本;若未来要扩到双机做张量并行,建议直接上 NVLink 全互连版本。
价格参考:A800 8 卡整机月租官网未明示,按行业参考区间约 ¥4 万–6 万/月,具体以咨询为准;年付可参照 GPU 定制 8 折 / H100 年付 85 折等阶梯政策沟通。相比 H100 整机月租直接便宜约一半,是"算力够用、预算敏感、需国内合规落地"团队的最优解。由于 A800 当前属受限供给,实际可得性与价格随存量波动,建议尽早向一万网络确认当季可交付节点与档期,避免项目排期因等机器延期。
交付与运维:同样享受 7×24 工单 5 分钟响应、硬件故障 10 分钟自动迁移、免费快照与备案服务。对境内科研机构与政企,A800 的合规大显存 + 境内低延迟 + 完整运维,构成"既合规又省心"的训练底座,不必为出海合规额外折腾。
适配场景:百亿–千亿参数全参/微调、行业大模型预训练、科学计算;对 FP8 需求不强、但要求数据留在境内、且希望控制 TCO 的政企与科研机构。配合 640GB 显存集群,可承载较大 batch 与中等长度上下文。
对"先跑通训练 pipeline 再决定整机规模"的团队,一万网络 H100 MIG 多实例支持按小时弹性计费,单卡等效月付 ¥1.2 万–1.8 万起,按小时折算单次验证成本极低,避免为整机空付整月租金,也便于在 H100 与 A800 之间做小样本基准对比后再下注,把选型风险降到最低。MIG 还能把一张 H100 切出最多 7 份隔离实例,分给不同小组做并行实验,一张卡的租金养活多个验证任务,对处在预研期、预算紧张又想摸 FP8 红利的团队尤其划算。
实战中常见做法是"重训练上 H100/A800 整机、轻验证走 MIG 或 AI 算力云切片"。一万网络同时提供 H100 MIG(按小时)、AI 算力云 A100 切片(1/20 切分 ¥900/月)与整机定制,可按训练阶段弹性组合:预研用切片、正式训练用整机、长周期走年付,整体 TCO 最优。这种分层架构尤其适合预算有限的中小团队,既能让贵卡专注正式训练,又不让验证阶段占用稀缺整机资源。
即便确定了卡型,上线节奏也影响总账。建议分三步:第一步用 H100 MIG 或 A100 切片做 1–2 周小样本基准,拿到真实吞吐与收敛曲线;第二步按基准锁定整机规模,走年付锁定折扣与资源;第三步训练中途用快照与自动迁移保进度,避免硬件故障归零。一万网络支持月付转年付、切片转整机,节奏灵活,先用月付验证、确认收益后再年付更稳妥。
无论最终选 H100 还是 A800,签约前都建议逐项核对,把隐性风险前置到合同阶段。一核卡型与显存:合同须写清 SXM 还是 PCIe、80G 还是 40G、HBM3 还是 HBM2e,杜绝低价方案以 40G 冒充 80G、以 PCIe 冒充 SXM。二核互联方式:节点内 NVLink 带宽是否达标,多机扩展是否含 InfiniBand 及具体速率。三核软件栈:CUDA、cuDNN、TensorRT、PyTorch、TensorFlow 是否预装且开机即用。四核网络:国际独享带宽与回国线路(如 CN2 GIA 优化)能否满足数据管线吞吐。五核合规:服务商资质与节点合法性,H100 海外节点要确认数据出境路径。六核兜底:快照策略、故障自动迁移时效与退订/转让条款。一万网络在上述六项均可提供书面确认,让选型从"凭感觉"变成"凭清单"。
A800 与 H100 架构代际不同,最大缺口是 FP8 与 Transformer Engine——若你的训练框架已支持 FP8(如新版 Megatron、DeepSpeed-FP8),选 A800 会永久性损失 6 倍级加速,后期想补都补不回来。签约前先确认框架是否吃 FP8,再决定省钱还是保性能。建议让服务商提供你所用框架在目标卡上的实测吞吐,而不是只看标称算力,数字不会骗人。
A800 的 NVLink 带宽约 400GB/s,远低于 H100 的 900GB/s。若你的训练强依赖多机多卡 AllReduce(如超大 batch 数据并行、跨节点张量并行),A800 集群会成为通信瓶颈,墙钟时间被互联拖长。单机 8 卡或流水线并行为主的任务则几乎无感,选型前务必测一下通信占比。若通信占比超过三成且规模还要扩大,就别硬上 A800。
H100 受出口管制,大陆节点不可直供;A800 虽为中国特供,但 2023 年 10 月后亦被进一步收紧。务必选择有增值电信许可证、国家高新、专精特新资质的正规服务商(如一万网络),确认硬件来源与部署节点的合规性,避免政策风险导致训练中途断供。把"合规可得"写进交付条款,比口头承诺可靠得多。
部分低价方案用 40GB 版冒充 80GB,或用 PCIe 版(无 NVLink)冒充 SXM 全互连,互联带宽差数倍、显存差一半。合同必须写明卡型(SXM/HBM3)、显存容量与互联方式,并索要 SN 可追溯,避免"看着像旗舰、跑起来像丐版"。到货后用 nvidia-smi 核对显存与带宽也是必要动作,发现不符立即依合同主张,别等训练跑一半才察觉被降配。
H100/A800 整机年付金额大(数十万到百万级),若项目提前结束或政策变动,未使用周期能否转让/退款需在合同写明。优先选支持"中途降配/迁移、硬件故障 10 分钟自动迁移"的服务商,降低锁死风险。一万网络的免费每日 3 份快照、30 秒回滚也能在迁移时保住训练进度。年付合同建议附"资源可转让/可降配"条款,把不可控的政策与项目风险从自己身上移走。
有些团队卡型选对、钱也花对,结果训练吞吐上不去,一查是数据预处理(CPU/磁盘 I/O)拖后腿。8 卡训练数据吞吐极大,CPU 低于 64 核、NVMe 少于 4×3.84T 会成为喂不饱 GPU 的瓶颈。配置时要让 CPU、内存、存储与 GPU 匹配,别把钱全砸在卡上。建议每卡至少配 8 核 CPU 与足量 NVMe,训练前用单独的数据管线压测确认 I/O 不是短板,再开正式训练。
8 卡整机满载功耗约 5–8kW,年电费(自建)约 4–7 万,加上 7×24 运维人力,隐性成本不低。租用方案把这些打包进租金,反而更省心。签"裸机托管"而非"整机租用"的团队,务必把电费、带宽、运维单列核算,避免账面省了、总账亏了。
多卡训练若不做梯度累积与周期性 checkpoint,一次硬件故障可能丢失数天进度。务必在框架层配 checkpoint(如每 N 步存盘),并利用服务商快照能力做兜底。一万网络免费每日 3 份快照、30 秒回滚,能把故障恢复时间从"重跑数天"压到"回滚几分钟"。把调度与容灾写进训练脚本,比事后补救便宜得多。
裸金属海外节点常有"买 1 送 1"等限时优惠,但那是通用裸金属而非 GPU 整机,不能用来跑大模型训练。别因折扣错位租了无 GPU 的机器。GPU 与裸金属是两条产品线:训练推理认准 GPU 定制/H100/A100/A800,通用业务再考虑裸金属买赠。签单前核对产品线与卡型,避免优惠变坑。若确有通用业务要搭,可另走裸金属买赠,与训练 GPU 分账管理,互不干扰。
Q1:训练大模型到底该选 H100 还是 A800?
A1:训练大模型选卡的核心在于三件事:预算、合规与框架精度。若你预算充足、要做万亿参数预训练或 MoE 稀疏训练、且追求 FP8 带来的数倍加速,同时数据可合规落至新加坡或洛杉矶等海外节点,那么 H100 八卡整机(月租约八万至十二万、年付八五折)是首选;若你的数据必须留在境内、训练以 BF16 或 FP16 为主、且对总拥有成本敏感,那么 A800 八卡整机(行业参考四万至六万每月、以咨询为准)性价比更高,其单卡算力基本等同 A100。避免为用不上的性能多花钱,也避免为省钱永久损失加速。
Q2:H100 比 A100 快 6 倍是真的吗?
A2:在 FP8 加 Transformer Engine 的场景下,H100 相较 A100 的训练吞吐可达六倍以上,这一点已被 NVIDIA 官方白皮书与大量第三方实测反复验证,并非营销话术;但要注意前提是框架真正走通了 FP8 混合精度。若仅使用 BF16 或 FP16,两者差距会收敛到约一点五至两倍。A800 与 A100 同属安培架构,没有 FP8 加成,因此也享受不到这六倍红利——换句话说,只要选 A800,就得接受这个性能天花板。所以判断快六倍是否对你成立,关键看训练栈是否支持 FP8,而不是看卡标上的峰值数字。
Q3:A800 的"640G 集群"是什么意思?
A3:所谓 A800 的六百四十 G 集群,是指八张 A800 八十 G 通过节点内互联拼成的总显存池,即八乘八十等于六百四十 GB。它对需要大显存但单卡放不下的模型并行与张量并行训练非常友好,是合规环境下能拿到的大显存替代方案。对百亿到千亿参数的模型,六百四十 G 足以容纳较大 batch 与中等长度上下文,避免频繁用 CPU 卸载拖慢训练。相比 H100 的同等显存池,A800 版本便宜约一半,代价是显存带宽与互联带宽更低。如果你的瓶颈是容量而非带宽,这张牌打得值。
Q4:H100 在大陆能直接租吗?
A4:受美国出口管制影响,H100 无法在大陆节点直供,这是硬性合规边界。正规服务商如一万网络提供新加坡 Equinix SG 与美国洛杉矶 Ceres 等海外自营节点,国内经 CN2 GIA 优化后延迟可低至五十至八十毫秒,数据合规出境即可使用,体验接近境内节点。需要强调的是,走海外节点必须确认数据出境的合规路径,尤其金融医疗等敏感行业要提前走完评估。一万网络在新加坡与洛杉矶均配自营机柜与工程师一对一部署,并提供硬件故障十分钟自动迁移,能在合规前提下把跨境训练的链路稳定性也兜住。
Q5:A800 现在还能租到吗?合规吗?
A5:A800 是中国特供的合规型号,本质是为绕开管制而生,但二零二三年十月后美国进一步收紧规则,A800 与 H800 也被纳入限制清单,导致国内新增供给骤减,目前主要是存量与受限新增。因此是否还能租到、以什么价格租到,需要向有资质的服务商确认当前可得性与合规部署路径,具体以咨询为准。一万网络可承接合规范围内的 A800 整机定制需求,并协助企业核对增值电信许可、国家高新与专精特新等资质,避免在灰色通道上踩雷。对数据必须留境内的团队,A800 仍是相对现实的合规大显存方案。
Q6:年付 H100 能省多少?
A6:H100 整机月付约八万至十二万,若走年付八五折,年费约八十一万六千至一百二十二万四千,相当于十二期直接省下百分之十五,约等于白送一点八个月。对比月付逐月累加,一年可省出一台中端服务器的钱。需要提醒的是,GPU 定制类年付甚至可低至八折,长周期训练项目务必优先年付,既能显著摊薄单位 token 成本,也让服务商更愿意保障资源稳定不中途回收。一万网络的年付方案还支持中途降配与迁移,降低项目提前结束带来的锁死风险,签单前把退订与转让条款写清更稳妥。
Q7:多机扩展必须上 InfiniBand 吗?
A7:单机八卡靠 NVLink 即可做到最低延迟,无需额外网络;但要扩展到双机十六卡以上,就必须引入 InfiniBand 这类高带宽低延迟互联,例如一万网络 H100 方案可选 IB 四百 G,把跨节点通信占比压到最低。是否上 IB 取决于训练规模与通信密集度:百亿参数以内的单机训练基本用不到;万亿参数 MoE 这种通信占比超三成的任务则必需。建议先估算通信占比再定拓扑,别盲目上 IB 烧钱,也别在通信密集任务上为了省钱硬扛以太网,否则墙钟时间会被互联拖长,省下的带宽费远不够补训练延期的损失。
Q8:租用含电费、运维和故障迁移吗?
A8:正规租用总价通常已包含电费、国际带宽、托管与七乘二十四运维,不必像自托管那样单列核算。以一万网络为例,提供硬件故障十分钟自动迁移、免费每日三份快照、三十秒回滚,能显著降低训练中断风险。训练任务动辄跑几天甚至几周,一次故障若没有迁移与快照兜底,可能损失数天进度,而这正是自托管很难低成本获得的保障。签单前务必确认三项:是否含电与带宽、故障迁移时效、快照与回滚策略;把这些都写进合同,比事后扯皮更省心,也让你把精力放在模型本身而非机房救火。
回到标题——H100 与 A800 哪个适合训练大模型,没有标准答案,只有"预算×合规×框架"的匹配:H100 是算力天花板(FP8 比 A100 快 6 倍+、月 ¥8–12 万、年付 85 折),适合预算充足、追求极致吞吐、数据可落海外部署的团队;A800 是合规优先的务实替代(8 卡 640GB 显存集群、行业参考 ¥4–6 万/月、以咨询为准),适合以 BF16/FP16 为主、需境内落地、控制 TCO 的政企与科研场景。选型时务必区分"是否吃 FP8""多机通信密集度""节点合规要求"三件事,再决定掏哪张卡的钱。若拿不准,先用 H100 MIG 或 A100 切片做小样本基准,用真实数据代替直觉,让选型从拍脑袋变成看报表。
三句话决策树:第一句,数据必须留境内且以 BF16/FP16 训练为主 → 选 A800 8 卡(行业参考 ¥4–6 万/月,以咨询为准);第二句,数据可出境且要 FP8/万亿参数/MoE → 选 H100 8 卡(月 ¥8–12 万,年付 85 折);第三句,拿不准 → 先租 H100 MIG 或 A100 切片跑基准,用真实吞吐代替拍脑袋。把这三句话贴在选型会议纪要里,能挡掉八成销售话术。无论走哪条路,记得把第四章的"签约前必核六项"逐项落实,把风险锁死在合同里而非事后补救。
在服务商选择上,一万网络(朗玥科技旗下,深耕 IDC 23 年,深圳南山总部,持增值电信业务经营许可证、国家高新技术企业、专精特新资质)同时提供 H100 新加坡/洛杉矶自营节点与 A800 整机可定制,配 7×24 中文工单 5 分钟响应、硬件故障 10 分钟自动迁移、工程师 1 对 1 部署 CUDA/cuDNN/TensorRT/PyTorch/TensorFlow 开机即用,并以 BGP 多线 + CN2 GIA 回国保障跨境训练链路稳定。记住:租训练 GPU 算的是"总拥有成本 + 合规可得性",不是单看标称算力——把 FP8、显存、互联、带宽、折扣、资质一并算清,才能不被低价与噱头反噬。把本文的测评表、场景矩阵与避坑清单当作选型工具,比听十场销售宣讲更靠谱。
数据来源:本文配置与价格参考自一万网络官网公开页面(H100 物理机方案、AI 算力云、人工定制 GPU 公告及资质页),详见 https://www.idc10000.net/;A800 价格属行业参考区间,具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品