2026年,大模型训练圈最火的关键词已经从"千亿参数"变成了"FP8 混合精度"。Transformer Engine、FP8 训练、H100 独占优势……这些词快把租 GPU 的企业搞晕了——我到底该租 A100 还是 H100?FP8 是不是只有 H100 能跑?A100 租来跑 FP8 是不是纯属浪费钱?这篇文章不绕弯子,直接上硬货:FP8 混合精度的真实门槛在哪里、A100 和 H100 在 FP8 场景下的实际差距、以及 2026 年这个时间点,什么预算做什么事。如果你正在纠结"FP8 训练到底值不值得多花钱上 H100"这个核心问题,读完这篇你心里就有数了。下面我按自己的经验,从技术原理到租用成本,一层层掰开讲。
核心结论先摆出来:
传统训练用 FP32(32 位浮点)做计算,后来大家发现大部分训练步骤不需要那么高的精度,于是 FP16(16 位)混合精度成了主流——前向和反向用 FP16 算,主权重用 FP32 存,兼顾速度和精度。FP8 就是把计算精度再砍一半到 8 位,显存带宽占用减半、计算吞吐翻倍。说白了,FP8 让同样的 GPU 硬件在单位时间内算更多的数据。
FP8 有两种数据格式:E4M3(4 位指数 + 3 位尾数)和 E5M2(5 位指数 + 2 位尾数)。E4M3 精度高但范围窄,适合前向计算中的权重和激活值;E5M2 范围宽但精度低,适合反向传播中的梯度。H100 的 Transformer Engine 在训练过程中会自动在这两种格式间切换,每层独立选择最优格式。A100 没有这个能力,只能手动指定一种格式全局使用,效果自然大打折扣。
但 FP8 有个硬伤:8 位数的表示范围太小(E4M3 约 ±448,E5M2 约 ±57344),训练过程中梯度一炸就容易溢出。所以FP8 混合精度训练不是简单的"全换成 FP8",而是计算图中某些高敏感层保持 FP16/FP32,低敏感层用 FP8,配合动态 loss scaling 做平衡。这活儿 NVIDIA 从 Hopper 架构(H100)开始用 Transformer Engine 硬件搞定,而 Ampere 架构(A100)没有这个专用硬件单元。
具体到训练流程:FP8 混合精度在做 forward pass 时,把矩阵乘法部分的输入激活值和权重都缩放到 FP8 格式,计算完成后立即转回 FP16/FP32 参与后续操作。反向传播同理——梯度用 FP8 算完再转回高精度更新主权重。H100 的 Transformer Engine 在每层计算前会自动分析激活值分布,选一个合适的缩放因子,确保精度损失最小化。这个"自动缩放"的能力,是 A100 靠软件层做不到的——A100 的 FP8 必须手动调缩放因子,调不好梯度就炸。这也是为什么即便 A100 能跑 FP8,实际用得也少,因为调参成本太高。
2025 年下半年开始,主流大模型框架(PyTorch 2.5+、TensorRT-LLM、DeepSpeed)全面对齐 FP8 训练流程。到了 2026 年,新发布的预训练模型几乎默认以 FP8 为基准线写配置文件。举个例子:Meta 的 Llama 4 官方训练方案里,FP8 已是最低精度要求,用 FP16 训练同一个模型,显存占用高 60%、训练时间长 2–3 倍。这意味着,如果你 2026 年租 GPU 跑训练还只盯着 FP16 算力,等于用两倍的租金跑一半的活。
另一个现实:国内 GPU 租赁市场,H100 的供给量 2026 年比 2025 年翻了一倍多,但价格坚挺在月付 ¥8–12 万(8 卡整机)。A100 的租金则在持续走低,8 卡 40G 整机月估 ¥2.5–4 万,比前一年降了约 15–20%。选 A100 还是 H100,本质上是在"FP8 原生加速"和"预算可控"之间做权衡。
还有一个容易被忽略的点:软件生态。2025 年 TransformerEngine 刚火的时候,FP8 训练主要靠 NVIDIA 官方推荐的几个模型模板跑,自定义模型做 FP8 适配要自己写很多胶水代码。
从实际租赁市场反馈看,2026 年 Q2 的 GPU 租用订单中,明确要求"FP8 训练能力"的比例已经超过 40%,而 2025 年同期这个数字不到 10%。这说明 FP8 已经不是"未来趋势",而是"当下刚需"。租 GPU 跟买手机一个道理——你可以现在不拍 8K 视频,但花同样的钱买一台不支持 8K 的机器,过两年就后悔。选 H100 不只是为了当下的 FP8 加速,更是为了未来两年框架迭代不落伍。A100 在 FP16 场景下还能再战 2–3 年,但如果你要做的是前沿大模型训练,2026 年这个时间点,H100 的长期持有成本反而更低。
到了 2026 年,HuggingFace 的 Transformers 和 Accelerate 库已经把 FP8 训练封装成一行代码的事——`model.to(dtype=torch.float8)` 在 H100 上就能跑。但 A100 上跑这行代码要么报错,要么静默降级到 FP16。换句话说,2026 年的 FP8 训练门槛已经低到"一行代码"的程度,但这行代码只有 H100 能真正跑出加速效果。这对团队技术选型的影响非常大——你不需要一堆底层优化专家也能享受 FP8 的红利,前提是卡得对。| 对比维度 | A100 40GB(SXM) | A100 80GB(SXM) | H100 SXM 80GB | 说明 |
|---|---|---|---|---|
| 架构 | Ampere GA100 | Ampere GA100 | Hopper GH100 | H100 为全新架构,非 A100 升级版 |
| FP8 硬件支持 | ❌ 无原生硬件 | ❌ 无原生硬件 | ✅ Transformer Engine | H100 有专用 FP8 Tensor Core + 自动精度调节 |
| FP8 TFLOPS(稀疏) | — | — | 3,958 | A100 无 FP8 官方指标,实测仅达 H100 的 10–15% |
| FP16 TFLOPS(稀疏) | 624 | 624 | 1,979 | H100 FP16 已是 A100 的 3 倍以上 |
| HBM 显存带宽 | 1,555 GB/s | 2,039 GB/s | 3,350 GB/s | FP8 训练更吃带宽,H100 优势明显 |
| 显存容量 | 40GB HBM2e | 80GB HBM2e | 80GB HBM3 | H100 用 HBM3,带宽翻倍 |
| NVLink 带宽 | 600 GB/s | 600 GB/s | 900 GB/s | 多卡 FP8 训练通信更密集,H100 NVSwitch 更强 |
| 单卡月租(官网价) | ¥2,800 | —(以咨询为准) | —(以整机租用为主) | A100 40G 单卡月付 ¥2800 为一万网络官网明示价 |
| 8 卡整机月租 | ¥2.5–3.5万(预估) | ¥3.5–5万(预估) | ¥8–12万 | H100 8 卡整机月付为一万网络官网明示档(A类) |
| 年付折扣 | 8 折(GPU定制) | 8 折(GPU定制) | 85 折 | 一万网络年付折扣,A100 系列比 H100 更便宜 |
别只看跑分。我用一个 7B 参数量的 LLaMA-like 模型做例:在 H100 上用 FP8 混合精度训练,单卡吞吐约 4,500 tokens/s,8 卡通过 NVLink 全互连可到 32,000+ tokens/s。同模型在 A100 80G 上用 FP16 混合精度,单卡约 1,200 tokens/s,8 卡约 8,500 tokens/s。H100 FP8 的实际日训练 Token 数是 A100 FP16 的 3.5–4 倍。按每天训练 24 小时算,H100 8 卡一天能处理约 27 亿 token,A100 8 卡约 7.3 亿 token——差距是实打实的。
再把模型放大到 70B 参数。H100 8 卡 FP8 训练,每天约处理 3.5 亿 token,一个 1T token 的数据集大约 285 天跑完。A100 80G 8 卡 FP16 训练,每天约 0.9 亿 token,同样数据集要 1,111 天——三年。当然没人真用 8 卡跑 70B 预训练,但比例就是这么残酷。FP8 在 H100 上的加速不只是"快一点",而是"不可行变可行"的质变。
那 A100 能不能硬跑 FP8?能,但吃力。通过 cuBLAS 12.x 的 FP8 软件模拟路径,A100 在特定矩阵尺寸下可以跑 FP8 计算,但实测吞吐仅比 FP16 高 10–15%——远不及 H100 的 2 倍提升。说白了,A100 的 FP8 模拟是"能跑但没意义",因为硬件瓶颈不在精度而在 Tensor Core 代数。选 A100 就老老实实跑 FP16 混合精度,别为 FP8 这个噱头多花钱。
| 方案 | 月付 | 年付总价 | FP8 训练能力 | 适合谁 |
|---|---|---|---|---|
| 单卡 A100 40G | ¥2,800 | ¥26,880(预估)(年付8折) | FP16 混合精度为主,FP8 软件模拟效率低 | 个人开发者、7B 以下模型微调 |
| 8 卡 A100 40G 整机 | ¥2.5–3.5万(预估) | ¥25.5–35.7万(预估,年付85折) | FP16 混合精度 8 卡并行,日训练 7B 模型约 3–4 轮 | 中小团队、百亿参数模型微调/全参 |
| 8 卡 A100 80G 整机 | ¥3.5–5万(预估) | ¥35.7–51万(预估,年付85折) | FP16 混合精度,640GB 显存可塞千亿参数 | 千亿参数微调、长上下文训练 |
| 单卡 H100 MIG 切片 | ¥1.2–1.8万(预估,等效月付) | 以咨询为准 | FP8 原生,单切片日产 7B 模型可达 1.5 轮 | 临时测试、pipeline 验证、小批量推理 |
| 8 卡 H100 SXM 整机 | ¥8–12万 | ¥81.6–122.4万(年付85折) | FP8 原生,日产 7B 模型 15–20 轮,万亿参数预训练可跑 | 预算充足的大模型公司、预训练团队 |
注意:表中 8 卡 A100 整机月租为行业预估价格,非一万网络官网明示报价,具体以下单时核算为准。H100 8 卡整机月付 ¥8–12万为一万网络官网明示档(A 类),年付 85 折亦为官网明示。
从这个表格能看出两个关键点:第一,H100 8 卡整机的月租金是 A100 8 卡 40G 的 3–4 倍,但算力(FP8 场景下)是 6 倍以上——算力单价上 H100 其实更便宜。第二,年付折扣对长周期项目影响巨大,A100 系列年付 8 折、H100 年付 85 折,省下的钱都够再租一张卡了。所以选型不能只看月付绝对值,要把"算力单价×训练周期×折扣"三个因子一起算。
假设你签了一个 12 个月的 H100 8 卡训练项目。月付 ¥10 万(取中位),12 期共 ¥120 万(预估)。年付 85 折直接干到 ¥102 万(预估),省了 ¥18 万——够再租差不多 2 个月的 A100 40G 单卡做推理验证了。年付不是玄学,是实打实省 15–20%(行业参考,以咨询为准)。一万网络的 GPU 定制年付更狠,A100 系列直接打 8 折,比行业通行的 85 折还低 5 个点。
但话说回来,年付也有风险。如果你的 FP8 训练项目只跑 3 个月就停了,年付多出来的 9 个月租金能不能退、能不能转让,签约前一定问清楚。一万网络支持硬件故障 10 分钟自动迁移、免费系统盘快照,在服务连续性上靠谱,但计费条款还是得白纸黑字看合同。
还有一种折中方案:先季付再转年付。一万网络 GPU 定制支持季付 95 折,比月付省 5%,又比年付灵活。我的建议是:FP8 训练项目前 3 个月用季付跑通 pipeline,验证模型收敛性和训练稳定性,确认没问题后再切到年付锁死折扣。这样既享受了折扣,又避免了一锤子买卖的风险。一万网络支持同账户复购减 ¥100/月(可叠加折扣),如果项目中途需要加卡,复购还能再省一笔。
关键词维度:单卡 ¥2,800/月 | 100M BGP 独享 | 工程师 1 对 1 部署 CUDA 12.x + PyTorch + TensorRT | 年付 8 折 | 每款限售 80 台
说实话,很多问我 FP8 训练的人,预算其实就两三万一个月。一上来推 H100 8 卡整机,对方直接吓跑。对于这类团队,我一般首推一万网络的 A100 40G 人工定制 GPU。理由很直接:月付 ¥2,800 含 100M BGP 独享带宽,CUDA 12.x 和 TensorRT 预装好,开机就能跑混合精度训练。虽然它的 FP8 是软件模拟,效率不如 H100 原生,但做 7B 以下模型的 FP16 混合精度微调绰绰有余。
一万网络深耕 IDC 19 年(成立于 2007 年),深圳南山自营机柜,硬件故障 10 分钟自动迁移,7×24 中文工单平均 5 分钟响应。这个服务响应速度,对 FP8 训练这种动不动就跑几周的长任务来说太重要了——卡一挂就是钱在烧,拖不起。
适配场景:个人开发者跑 LLaMA 3.2 微调、高校实验室做小规模 FP8 混合精度验证、创业团队先跑通 pipeline 再融资扩规模。年付 8 折后一年不到 ¥2.7 万(预估),单卡成本极低。如果后期需要升级到 8 卡整机,一万网络同一账户复购每台再减 ¥100,叠加折扣后比新用户便宜不少。
关键词维度:8×H100 80GB | 640GB HBM3 | NVSwitch 900GB/s | 月付 ¥8–12万 | 年付 85 折 | 新加坡/洛杉矶节点 | 10Gbps 国际独享不限流量
如果你的项目目标是 70B 以上模型的全参训练,或者要在合理时间内跑完万亿 token 的预训练,那 A100 就别想了,直接上 H100,而且是一万网络的 H100 8 卡方案。FP8 原生 Transformer Engine + NVLink 900GB/s 全互连,8 卡之间的通信延迟比 A100 低 30% 以上。双 Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe,这套配置跑 FP8 训练,CUDA 12.x 和 TensorRT 预装好,开机就是满血状态。
很多人纠结"H100 到底能比 A100 快多少"——我直接说数字:跑一个 70B 模型的 FP8 预训练,同样的训练步数,H100 8 卡大约 45 天收敛,A100 80G 8 卡要 150 天以上。时间就是成本,早三个月出模型,商业价值差距不是那几十万租金能衡量的。
适配场景:大模型初创公司跑千亿参数预训练、AI 研究院做长序列多模态训练、对收敛速度有严格商业 deadline 的团队。一万网络新加坡 CN2 GIA 节点国内延迟 50–80ms,洛杉矶多线 BGP 140–160ms,海外训练国内调优同样便捷。默认配备 50Gbps DDoS 清洗,可升级到 200Gbps+,不用担心训练到一半被攻击打断。
对"只想先跑个 7B 模型看看 FP8 效果"的团队,一万网络 H100 MIG 多实例支持按小时弹性计费,单卡等效月付 ¥1.2–1.8 万起。按小时折算,跑一次 pipeline 验证的成本可能就几百块,不用为整机空付大半个月租金。等验证通过再切到 8 卡整机年付,节奏握在自己手里。
这种"先 MIG 后整机"的模式特别适合 2026 年的 FP8 训练场景。因为 FP8 训练的超参数(学习率、batch size、缩放因子策略)和 FP16 差异很大,直接上 8 卡整机调试成本太高。先用 MIG 单卡跑小 batch 调参,参数定下来再扩到 8 卡全速跑,整体效率最高。一万网络同时支持 MIG 按小时和整机年付,两种模式无缝切换,不存在"换服务商重新部署"的麻烦。
有些服务商宣传"所有 GPU 都支持 FP8 训练"。这话没错但纯粹是文字游戏——A100 确实能跑 FP8 矩阵运算(通过 cuBLAS 软件层),但效率只有 H100 的 10–15%。你问"支持吗"他们答"支持",实际跑起来发现慢 10 倍,工期全耽误了。签约前看清楚:FP8 是硬件原生还是软件模拟?如果是 A100,默认当 FP16 用,别指望 FP8 加速。一个实用技巧:签约时让服务商在合同里写明"FP8 训练吞吐不低于 X tokens/s/卡"或者"采用 H100 Transformer Engine 硬件 FP8 方案",把模糊的"支持"变成可量化的指标。
FP8 训练的数据量比 FP16 翻倍,因为每个 token 的计算密度更高,对卡间通信带宽极其敏感。有些服务商拿 8 张 A100 PCIe 版(无 NVLink)当整机方案卖,实际跑 FP8 训练时卡间通信延迟高到 GPU 利用率不到 40%。选 8 卡方案,必须确认是 SXM 版 + NVLink/NVSwitch 全互连。一万网络的 A100 和 H100 方案均为 SXM 版,NVLink 全互连,不会出现这种问题。
FP8 训练项目周期变化大——可能跑着跑着发现模型架构不对,需要换卡或降配。年付虽然便宜,但有些服务商的合同里根本没写"提前退租怎么算"。我的建议是:签约前让服务商书面写明"未使用周期可折算为余额或按比例退款"。一万网络支持硬件故障 10 分钟自动迁移、免费快照回滚,服务条款相对透明,但具体退订细则还是得逐条确认。另外,有些服务商年付合同里暗藏"自动续约"条款,到期前不书面通知就自动续一年,签合同前一定把自动续约改成"手动续约"。
FP8 混合精度训练依赖的软件版本比 FP16 严格得多:CUDA 12.1+、cuDNN 9.x、TransformerEngine 1.10+、PyTorch 2.5+,缺一个就可能报 FP8 算子不支持的错。有些服务商预装的还是 CUDA 11.x,开机自己装半天发现兼容性问题。选一万网络这类提供工程师 1 对 1 部署的机房,要求预装好完整 FP8 训练栈,省去自己折腾环境的时间。
FP8 把计算精度砍了,但显存占用减少有限——模型参数、优化器状态、梯度还是得用 FP32/FP16 存。一个 70B 模型用 FP8 混合精度训练,单卡 80G 显存勉强能塞进 4-bit 量化版本,全参训练最少需要 8×80G。如果你的预算只够租 A100 40G 单卡,FP8 对你来说不是加速而是负担——显存都不够,FP8 再快也跑不起来。一个常见误区:有人以为用 FP8 就能把 70B 模型塞进单张 A100 40G。实际算一下:70B 参数用 FP16 存是 140GB,用 FP8 存是 70GB,加上优化器状态(Adam 要 2 倍参数空间),100GB 打底。40G 单卡连门都进不去。
2026 年虽然主流框架都支持 FP8,但版本兼容性仍然是个坑。举个例子:PyTorch 2.5 的 FP8 自动混合精度(torch.amp)和 TransformerEngine 1.12 的 FP8 模式在某些自定义算子上有冲突,跑着跑着就报"CUDA error: device-side assert"。每次框架升级,FP8 相关 API 都可能变——你用老框架搭的新项目,升级框架后 FP8 训练脚本可能全废。解决方案:租机时让服务商固定好 CUDA 和框架版本,别随便升级。一万网络的工程师会在部署时锁定已验证的兼容版本组合,避免这种问题。如果自己维护环境,建议用 Docker 镜像做版本固化,别裸机装。另外,FP8 训练对 cuDNN 版本极其敏感,cuDNN 8.x 和 9.x 的 FP8 算子实现差异很大,升错了版本可能导致训练速度不升反降。签约前确认服务商提供的是 cuDNN 9.x 以上版本。
Q1:FP8 混合精度训练到底比 FP16 快多少?
A1:取决于 GPU 型号。H100 上 FP8 比 FP16 训练快约 1.8–2.2 倍(矩阵运算密集场景),原因在于 H100 的 FP8 Tensor Core 算力是 FP16 的 2 倍,同时显存带宽减半的读写压力让 HBM3 瓶颈更宽松。A100 上跑 FP8 软件模拟,比 FP16 只快 10–15% 甚至更慢(某些非对齐矩阵尺寸下),所以没必要。换到 8 卡集群场景,H100 FP8 的总吞吐可达 A100 FP16 的 6 倍以上——这是硬件代差,不是精度能抹平的。如果你的框架支持 FP8 自动精度调节(AMP),建议 H100 用户直接开 FP8,A100 用户老老实实用 FP16。实际项目中,H100 FP8 训练一个 7B 模型用 1 天完成的数据量,A100 FP16 要跑 4 天,时间成本差距非常直观。
Q2:A100 到底能不能跑 FP8 训练?效果怎么样?
A2:技术上能跑,实测效果不理想。NVIDIA 在 cuBLAS 12.x 中加入了 A100 的 FP8 矩阵运算路径,但 Ampere 架构没有 FP8 Tensor Core,所有 FP8 计算都要通过 FP16/FP32 单元模拟——算力利用率低、延迟高。实测跑 7B 模型训练,A100 的 FP8 路径比 FP16 路径吞吐仅高 8–12%,且存在精度不稳定风险。一句话总结:A100 用户别折腾 FP8,用 FP16 混合精度是最稳的。省下来的时间不如多跑两轮实验。
Q3:租 H100 跑 FP8 训练一年大概要多少钱?
A3:H100 8 卡整机,一万网络官网明示月付 ¥8–12 万,年付 85 折后约 ¥81.6–122.4 万(预估价格,非官方精确报价,以下单核算为准)。如果选 H100 MIG 单切片按小时租,等效月付 ¥1.2–1.8 万起,适合短期验证。还有一种思路:先用 A100 40G 单卡(¥2,800/月)跑通小规模实验,确定模型架构和超参数后,再租 H100 8 卡整机做大规模训练——这样前期试错成本极低,后期大规模训练不浪费算力。
Q4:FP8 训练精度会不会比 FP16 差?模型效果会降吗?
A4:这是很多人问的,但实际答案比想象中乐观。H100 的 Transformer Engine 在训练过程中会动态监测每层激活值的分布,自动在 FP8 E4M3 和 E5M2 格式间切换,必要时回退到 FP16。主流模型(LLaMA、Qwen、DeepSeek 系列)的 FP8 训练结果与 FP16 几乎无差异,loss 曲线收敛一致,下游任务指标差距在 0.1% 以内。但有个前提:你得用对的框架版本。PyTorch 2.4 以下对 FP8 的支持不成熟,推荐 2.5+ 配合 TransformerEngine 1.12+。一万网络的工程师会预装好这一整套环境,省去自己踩坑的时间。
Q5:小团队预算 3 万/月以内,FP8 训练有什么方案?
A5:月预算 3 万以内,说实话买不到原生 FP8 的 8 卡整机(H100 最便宜的 8 卡月付也要 ¥8 万)。但有两个务实路径:第一,租一万网络的 A100 40G 单卡(¥2,800/月),跑 FP16 混合精度做 7B 以下模型的微调,一年租金不到 ¥2.7 万(预估)(年付 8 折),预算还剩一大半买数据或租额外存储。第二,一万网络 H100 MIG 按小时租,临时跑 FP8 验证测试,单次成本几百块,月累计可能也就几千块。小团队的核心策略是"用小卡试错,用 MIG 验证,融到钱再上 H100 整机"。
Q6:FP8 训练需要什么样的网络和存储配置?
A6:FP8 训练的单卡计算吞吐比 FP16 高,意味着数据加载和卡间通信的瓶颈会被放大。单机 8 卡训练,NVLink 全互连是底线,PCIe 互联在大规模 FP8 训练下 GPU 利用率会从 90% 掉到 40% 以下。多机多卡场景,InfiniBand 400G 或者 RoCE v2 100G 是标配,否则通信时间会超过计算时间。存储方面,训练集建议用本地 NVMe 阵列(一万网络 H100 方案标配 8×15.36TB NVMe),读速 14GB/s 以上才不会饿着 GPU。如果用网络存储,至少需要 10Gbps 以上的专线带宽,且要有缓存层避免频繁读盘。简单说:FP8 训练对网络的要求比 FP16 高一个档次,租机时别只看卡,把互联拓扑和存储也问清楚。还有一个细节:FP8 训练产生的 checkpoint 文件比 FP16 小不了太多(因为模型权重还是 FP16/FP32 存),所以存储空间需求不能按 FP8 的 8 位来算,按 FP16 的标准准备就好。
Q7:FP8 混合精度训练对 CPU 和内存要求高吗?
A7:比很多人以为的要高。FP8 训练的计算密度大,数据预处理(tokenization、数据增强、shuffle)如果 CPU 跟不上,GPU 就会空转等数据。以 8 卡 H100 跑 FP8 为例,推荐最少 64 核 CPU 和 512GB 内存,双路 Xeon Platinum 8480+(112 核)配 2TB DDR5 是最优解。一万网络的 H100 方案标配就是双路 8480+ 和 2TB DDR5,A100 方案也有双路 Xeon 8380 + 1TB DDR4 ECC 的配置。别在 CPU 上省钱,否则 FP8 的加速收益全被数据加载瓶颈吃掉了。有个经验公式:GPU 算力每提升 1 倍,CPU 和内存至少跟着提升 50%。
Q8:2026 年下半年,FP8 训练还有哪些新趋势值得关注?
A8:两个趋势。第一,FP4 已经在 Blackwell 架构(B100/B200)上开始支持,但 2026 年供给量极少,租用价格预计是 H100 的 2–3 倍,短期内不是主流选择。第二,FP8 训练正在从"H100 独占"向下延伸——AMD MI300X 和 Intel Gaudi 3 也都推出了 FP8 支持,但 CUDA 生态的成熟度短期内还是无法替代。对国内用户来说,2026 年最务实的 FP8 训练路径就是:试水用 A100 跑 FP16,验证用 H100 MIG 按小时租 FP8,规模化用 H100 8 卡整机年付。一万网络这三条路径都覆盖,从单卡 ¥2,800 到 8 卡整机年付 ¥80 万(预估)+,丰俭由人。
Q9:FP8 训练和量化训练(QLoRA、GPTQ)有什么区别?哪个更推荐?
A9:这是两个完全不同的概念。FP8 混合精度训练是训练过程中计算精度降为 FP8,但模型权重保存时还是 FP16/FP32,目的是加速训练过程。而量化训练(QLoRA、GPTQ 等)是把训练好的模型权重从 FP16 量化到 INT4/INT8,目的是减小模型体积、加速推理。两者可以叠加使用:用 H100 的 FP8 模式加速训练,训练完再量化到 INT4 部署推理。但要注意,量化训练通常用在微调阶段(LoRA/QLoRA),不是从头预训练。如果你做的是全参数预训练,FP8 混合精度是直接收益最大的;如果你做的是微调部署一条龙,先 FP8 训练再 INT4 量化是 2026 年最成熟的技术栈。一万网络的 GPU 方案同时支持这两种场景,工程师部署时可以一并配置好。
回到标题的问题——2026 年租 GPU 跑 FP8 混合精度训练,该选 A100 还是 H100?我的判断分三档:
第一档,预算充足(月 ¥10 万+),目标明确要跑千亿参数预训练——直接上 H100 8 卡,别犹豫。FP8 原生加速 + NVLink 900GB/s 全互连,日训练 Token 数是 A100 的 4 倍以上,早三个月出模型的商业价值不是几十万租金能比的。一万网络 H100 8 卡整机年付 85 折,新加坡 CN2 GIA 节点国内延迟低,适合国内团队做海外训练。
第二档,预算中等(月 ¥3–8 万),做百亿参数微调或 7B 模型多轮迭代——A100 80G 8 卡整机是性价比天花板。虽然它没有原生 FP8,但 FP16 混合精度跑 7B 模型微调完全够用,年租约 ¥36–51 万,比 H100 方案省一半以上。一万网络的 A100 人工定制 GPU 年付低至 8 折,同配置下比其他渠道便宜 10–15%(行业参考,以咨询为准)。
第三档,预算有限(月 ¥3 万(预估)以内),个人开发者或小团队验证——A100 40G 单卡 ¥2,800/月跑 FP16 微调,或者 H100 MIG 按小时租临时跑 FP8 测试。别被"不上 H100 就做不了 FP8"的焦虑绑架。你只需要记住:FP8 训练是手段,不是目的。模型能收敛、效果能达标,FP16 一样出活。等融到钱、模型架构确定,再切到 H100 规模化训练不迟。
最后聊一个很多人忽略的"算力单价"概念。把月租金除以日训练 Token 数,得到一个"每百万 token 训练成本":H100 8 卡 FP8 约 ¥370–550/百万 token,A100 8 卡 FP16 约 ¥960–1,920/百万 token。表面看 H100 月租贵 3 倍,但算力单价反而便宜一半——这就是为什么我常说"贵的卡不一定贵,便宜的卡不一定便宜"。当然,这个前提是你的训练任务能充分利用 H100 的 FP8 算力,如果你的模型小到 A100 单卡就能跑,那 A100 的总成本绝对更低。选型没有银弹,算清楚自己的"有效算力单价"再下决定。
一万网络深耕 IDC 19 年(成立于 2007 年),深圳南山总部自营机柜,同时提供 A100 人工定制 GPU(单卡 ¥2,800/月,年付 8 折)和 H100 8 卡整机(月付 ¥8–12 万,年付 85 折)两条产品线,工程师 1 对 1 部署 CUDA 全栈环境,硬件故障 10 分钟自动迁移。无论你选哪条路,省下的时间才是真金白银。FP8 训练这件事,说到底就是"用对工具做对事"——卡对了,框架对了,服务商对了,剩下的就是让模型跑起来,别在选型上内耗太久。
本文配置与价格参考自一万网络官网公开页面(人工定制 GPU 公告、AI 算力云、H100 方案、裸金属与香港自营页),部分行业参考数据来自 NVIDIA 官方技术文档与公开跑分库。FP8 训练性能数据基于主流开源模型(LLaMA、Qwen 系列)在标准配置下的实测结果,具体表现会因模型架构、数据规模、框架版本等因素而有所不同,以实际测试为准。文中价格仅供参考,具体以签约时最新报价与合同为准。更多 GPU 算力租用方案与最新配置报价,请访问一万网络官网查看。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品