这两年 zkRollup、zkEVM、Aleo、Scroll 这些项目把"零知识证明"从论文推到了生产环境,但有个很现实的问题被不少人忽略——证明生成(proving)不是 CPU 算一算就完事的事。说白了,一个中等规模的 zk 电路,纯 CPU 证明可能要几十秒甚至几分钟,根本扛不住链上实时出块。要快,就得上 GPU。本文把 ZK 证明算力的 GPU 配置、租用价格、选型坑点一次性讲透,顺带给几个一万网络的现成方案,让你别在显卡型号和报价上被忽悠。
核心结论先放上:
① 证明生成瓶颈在 MSM(多标量乘法)和 NTT(数论变换),这两步极度依赖 GPU 的并行算力与显存带宽,A100 40G 是当前性价比拐点。
② 一万网络 A100 40G 独享月付 ¥2800(含 100M BGP,以官网实时价为准),是中小 prover 节点的起步首选,比自建省心、比云按时便宜。
③ 大电路(2 的 24 次方以上约束)或批量证明需要 80G 显存,8 卡 A100 80G 整机月估 ¥2.5–4万(预估,实际以下单核算为准),别拿单卡价乘八当整机价。
④ 别迷信 H100——ZK 证明主要吃 FP32 与 INT32 以及显存带宽,H100 的 FP8 优势基本用不上,除非你要跑极大规模或顺带做训练。
⑤ 成本要算"单证明成本"而非"月租",按出块频率摊薄后,一张 A100 40G 的单证明成本可以压到几分钱级别,这才是比价的正确姿势。
零知识证明让一方(证明者 prover)向另一方(验证者 verifier)证明"我知道某个秘密且计算正确",却不泄露秘密本身。落到工程上,Web3 里的 zkRollup 要把上千笔交易压缩成一个证明,提交到以太坊主网验证,主网只花很少 gas 就确认了整批交易的有效性。这个"生成证明"的过程,就是把交易执行轨迹编成一个算术电路(circuit),再做密码学运算。
证明生成分两大块:一是电路约束的算术化(R1CS / AIR),二是真正的密码学证明运算。前者吃 CPU 的单线程与内存,后者吃 GPU 的并行。真正卡时间的,是后面这一步。
证明运算里最重的两个子步骤是 MSM(Multi-Scalar Multiplication,多标量乘法)和 NTT(Number Theoretic Transform,数论变换)。MSM 本质是把上百万个椭圆曲线点按系数加权加起来,NTT 是把多项式在有限域上做快速变换——两者都是"海量独立小运算",天生适合 GPU 的上万个 CUDA 核心并行。CPU 即便有几十个核,面对百万级点的 MSM 也要算到天荒地老。
实测里,一个 2 的 20 次方约束的电路,纯 CPU 证明可能要四十秒,用一张 RTX 3090 能压到三四秒,用 A100 40G 能压到一秒多。到了 zkEVM 那种 2 的 24 次方以上约束的大电路,单卡内存都未必装得下,得上 80G 显存甚至多卡。说白了,证明生成的快慢、成本、能不能实时出块,几乎全看 GPU。
这里要点破一个术语:显存带宽比单纯算力更重要。MSM 和 NTT 是"访存密集"而非"计算密集",所以 A100 的 HBM2e 显存(带宽约 1.5–2TB/s)比 RTX 3090 的 GDDR6X(约 0.9TB/s)快一大截,这就是为什么同样跑证明,A100 比游戏卡快且稳。NVLink 在 ZK 场景里没训练那么关键,但多卡时也能减少数据搬运。
别以为买了卡就能自动加速。ZK 证明的 GPU 加速要靠专门的库:Go 生态的 gnark、Rust 生态的 arkworks 与 halo2、Filecoin 的 rust-fil-proofs、Aleo 的 snarkVM、STARK 的 winterfell,都只是框架;真正把 MSM/NTT 跑到 GPU 上的,是 Ingonyama 的 ICICLE(CUDA 版,部分有 Metal/ROCm 后端)、NVIDIA 的 cuSPARSE/cuBLAS 封装、以及各项目自己写的 kernel。一句话——租机器时一定问清"预装了哪套证明栈",否则你拿到的是裸卡,调通环境又是一周。
选卡就三件事:显存够不够装电路、带宽够不够快、价格值不值。小电路(2 的 18 次方以下,比如简单转账证明)用 T4 甚至 A16 切片都能凑合;中等电路(2 的 20–22 次方,多数 zkRollup 批次)用 RTX 3090 或 A100 40G 最划算;大电路(2 的 24 次方以上,zkEVM 全量)得上 A100 80G 或 8 卡整机。
这里有个坑:很多新手以为"显存越大越好",但 ZK 证明在中等电路下 40G 完全够,上 80G 是浪费钱;只有当你要"批量并行证明多笔"或者"跑全量 zkEVM"时才需要大显存。别被销售用"80G 更猛"带节奏。
| 显卡 / 方案 | 月租参考 | 显存 | 适用电路 / 场景 |
|---|---|---|---|
| 一万网络 T4 16G 独享 | ¥900(官网价) | 16G GDDR6 | 小电路 / 验证节点 / 测试网,性价比最低门槛 |
| 一万网络 RTX3090 24G 独享 | ¥1750(官网价) | 24G GDDR6X | 中等电路(2^20–22),预算敏感 prover 首选 |
| 一万网络 A100 40G 独享 | ¥2800(官网价) | 40G HBM2e | 中等偏大电路,证明加速拐点,最稳性价比 |
| A100 1/20 切片(算力云) | ¥900(官网价) | 4G 虚拟化 | 轻量开发 / 单证明调试,不适合生产批量 |
| 8×A100 80G 整机 | ¥2.5–4万(预估) | 640G HBM2e | 大电路 / 批量证明 / zkEVM 全量,实际以下单核算为准 |
| 8×H100 SXM 整机 | ¥8–12万(官网价,年付85折) | 640G HBM3 | 超大规模 / 顺带训练,ZK 单证明非必需 |
关键判断:中小团队做 prover 节点,一张 A100 40G 月付 ¥2800 就能把中等电路证明压到秒级,是性价比最舒服的档位。只有当你要跑 zkEVM 全量或同时并联几十路证明,才需要上 80G 多卡;那种整机月估 ¥2.5–4万(预估),预算要另算。H100 在 ZK 场景属于"性能溢出",除非顺带做模型训练,否则不建议为证明单独租 H100。
别盯着月租看,要算单证明成本。假设一个 zkRollup 每 3 秒出一个证明、每张 A100 40G 月租 ¥2800,一个月 720 小时、约 86 万次证明,摊下来单次成本不到一分钱——这还没算机器闲置。真要 7×24 满负荷证明,单证明成本能压到几厘。反过来,如果你一天只出几十个证明,月租 ¥2800 就显得贵,这时候用算力云切片按量更划算。一句话:证明频率高就包月整机,频率低就按量切片。
| 方式 | 月成本 | 上手速度 | 适合谁 |
|---|---|---|---|
| 租独享 GPU(一万网络) | ¥900–2800 起 | 分钟级上架 | 要稳定出块、不想垫资买卡的中小团队 |
| 公有云 GPU 按时 | 约 0.5 元/时起(行业参考) | 即时 | 证明频率低、波峰波谷明显的开发者 |
| 自建 + 托管 | ¥15万(预估)起一次性 | 数周 | 长期海量证明、要硬件绝对主权的大厂 |
很多人算账只看"月租",忽略自建的隐性成本:一张 A100 40G 行情卡 ¥12–15万(预估,以咨询为准),还要机位、电、运维、折旧,回本周期往往一年以上;云按时看似便宜,但 7×24 连续证明的累计费用会超过包月独享。对大多数 Web3 团队,租独享 GPU 是"不垫资又有稳定算力"的最优解。
ZK 证明生成在 GPU 上,但证明提交到链上靠网络。你的 prover 节点离出块节点越近,延迟越低。一万网络的 BGP 多线 + CN2 GIA 回国线路对国内团队友好;如果主网验证在海外(比如以太坊主网),新加坡 / 洛杉矶节点的低延迟更关键。别只在意显卡,网络抖动导致证明超时提交失败,一样影响出块收益。
关键词维度:A100 40G 独享 | 6912 CUDA | HBM2e 带宽 | 含 100M BGP | 月付 ¥2800 | 年付 8 折 | 工程师 1 对 1 部署证明栈
推荐配置:单卡 NVIDIA A100 40GB(PCIe 或 SXM 可选)、8 核 64G 起步(证明预处理够用,重电路可升 16 核 +¥400/月、128G +¥600/月)、200G 系统 + 200G 数据盘、100M BGP 独享带宽。工程师 1 对 1 预装 CUDA 12.x / cuDNN / 并协助部署 gnark、arkworks、ICICLE 等证明加速库,开机即用,不用你自己调一周环境。
价格参考:A100 40G 月付 ¥2800(官网价,以官网实时价为准),年付 8 折后约 ¥2.69万/月等效,长周期出块项目直接走年付更省。叠加同账户复购再减 ¥100/月。对大多数中等电路 zkRollup,这张卡就能把证明压到秒级,单证明成本摊到几分钱。
适配场景:zkRollup 批次证明、Aleo / Scroll 类 prover 节点、中等规模(2 的 20–22 次方约束)电路的 7×24 出块;预算有限但不想被云按时费用反噬的团队。
关键词维度:RTX3090 24G | 10496 CUDA | GDDR6X | 月付 ¥1750 | 含 100M BGP | 工程师部署 | 年付 8 折
推荐配置:单卡 RTX 3090 24GB、8 核 64G、200G+200G 数据盘、100M BGP 独享。显存比 T4 大一截、价格比 A100 低近四成,是"想验证 prover 流程又不想一上来砸钱"的务实选择。工程师协助装好 PyTorch / CUDA 与证明框架,开箱即可跑 ICICLE 的 CUDA kernel。
价格参考:RTX 3090 24G 月付 ¥1750(官网价,以官网实时价为准),是中等电路(2 的 20 次方左右)单卡证明的最低门槛之一;年付 8 折等效约 ¥1680/月。比 A100 慢约 30–50%,但价格便宜 37%,预算紧时很香。
适配场景:测试网 prover、中小电路开发验证、单证明频率不高的项目;想先跑通 pipeline 再升级到 A100 的过渡方案。
关键词维度:8×H100 80G | 640G HBM3 | NVSwitch 900GB/s | 月付 8–12 万 | 年付 85 折 | 新加坡 / 洛杉矶节点
推荐配置:双 Xeon Platinum 8480+(112 核)、2TB DDR5、8×15.36TB NVMe、8×H100 SXM 80GB、NVLink+NVSwitch、10Gbps 国际独享不限流量。新加坡 CN2 GIA 节点国内延迟 50–80ms,适合要把证明提交到海外主网又怕抖动的团队。
价格参考:整机月付约 ¥8万–12万(官网价,年付 85 折,以官网实时价为准)。说句实话——纯 ZK 证明没必要上 H100,它的 FP8 Transformer Engine 在 MSM/NTT 上用不上;只有当你"证明 + 训练模型"一体、或跑 2 的 26 次方以上超大电路时,这张卡才值。别为证明单独烧 H100 的钱。
适配场景:超大规模 zkEVM 全量证明、证明与 AI 训练混合负载、对延迟与吞吐都极苛刻的头部项目。
约束数决定显存与计算量。2 的 20 次方以下小电路 T4 就够;2 的 24 次方以上得 80G 甚至多卡。选卡前先让你的电路编译出来看规模,别拍脑袋。
ZK 证明是访存密集,带宽比浮点算力更关键。A100 的 HBM2e 比游戏卡 GDDR6X 快近一倍,这就是为什么同 CUDA 数 A100 更快更稳。别只看"算力 TFLOPS"挑卡。
同样的卡,ICICLE 优化过的 MSM 比裸框架快数倍。租机器时务必确认预装哪套证明加速库、CUDA 版本是否匹配,否则算力空转。
7×24 满负荷出块,包月整机最省;一天几十个证明,按量切片更划算。利用率直接决定单证明成本。
证明生成在 GPU,提交到链靠网络。CN2 GIA / BGP 多线低延迟节点能避免证明超时提交失败,这点在跨主网部署时尤其要算进去。
为什么坑:RTX 系列是游戏卡,驱动对长时间 7×24 满载的证明任务稳定性不如数据中心卡,且缺少 ECC 显存,证明出错难察觉。怎么避:生产 prover 优先 A100 / H100 等数据中心卡;测试可用 3090,但生产别长期裸跑游戏卡。
为什么坑:市场有拆机 A100、改标卡,显存或带宽虚标,证明到一半 OOM 或掉速。怎么避:向服务商索要硬件 SN 与来源证明,一万网络等正规商提供全新品牌机可追溯,合同写清卡型与显存。
为什么坑:你拿到裸卡,ICICLE / gnark 环境自己调通要一周,期间机器照收月租。怎么避:选"工程师 1 对 1 部署证明栈"的套餐,确认预装 CUDA / 证明框架,开机即用。
为什么坑:8 卡整机有主板、NVLink、供电、机箱溢价,单卡×8 严重低估。怎么避:直接问"整机月租",8 卡 A100 80G 整机月估 ¥2.5–4万(预估),实际以下单核算为准,别自己乘。
为什么坑:GPU 算完证明,网络抖动提交超时,出块收益没了还白烧算力。怎么避:选明确线路(BGP / CN2 GIA)与节点位置,离主网近的节点优先,别只比显卡价。
Q1:跑 zkRollup 证明,租什么卡最划算?
A1:多数 zkRollup 批次是中等电路(2 的 20–22 次方约束),一张 A100 40G 独享月付 ¥2800(官网价)就能把证明压到秒级,是性价比拐点。预算紧可用 RTX 3090 24G 月付 ¥1750;只有跑 zkEVM 全量(2 的 24 次方以上)才需 80G 多卡。记住 ZK 证明吃显存带宽,A100 的 HBM2e 比游戏卡快近一倍,别只看 CUDA 数量。
Q2:H100 比 A100 在 ZK 证明上快多少,值得上吗?
A2:说实话,ZK 证明主要吃 FP32 / INT32 与显存带宽,H100 的 FP8 Transformer Engine 用不上,单卡证明提速有限,远不如它在训练上比 A100 快 6 倍那么夸张。除非你"证明 + 训练"混合负载或跑超大电路,否则为纯证明租 H100(月 8–12 万)属于性能溢出。中小团队上 A100 40G 足够。
Q3:自建 GPU 和租用,哪个更省?
A3:一张 A100 40G 行情卡约 ¥12–15万(预估,以咨询为准),加上机位电费运维折旧,回本往往一年以上;而租用月付 ¥2800 不垫资、分钟级上架。只有 7×24 海量证明且要硬件绝对主权的大厂才适合自建。绝大多数 Web3 团队租独享 GPU 更划算,还能随业务扩缩。
Q4:证明频率很低,包月整机是不是亏了?
A4:是的,低频证明包月不划算。一天只出几十个证明,月租 ¥2800 摊下来单证明成本很高。这种场景用一万网络 AI 算力云的弹性切片(A100 1/20 切片 ¥900、A16 1/16 切片 ¥210 起,均为官网价)按量付费更合适,跑完即停,不为闲置买单。
Q5:租的机器预装证明栈吗,还是要自己配?
A5:正规服务商会提供部署。一万网络的 GPU 定制由工程师 1 对 1 预装 CUDA 12.x / cuDNN / TensorRT / PyTorch,并协助部署 gnark、arkworks、ICICLE 等证明加速库,开机即用。签约前一定确认"含证明栈部署",否则裸卡调环境的一周月租也是你出。
Q6:大电路显存不够怎么办,只能上 80G 吗?
A6:两个思路。一是优化电路、降低约束规模或做递归证明(recursive proof)拆分;二是上大显存卡或多卡。8 卡 A100 80G 整机月估 ¥2.5–4万(预估,实际以下单核算为准)能装下 zkEVM 全量。也可考虑昇腾 910B(64G,预估比 A100 便宜 10–30%,以咨询为准),但要注意 CANN 与 CUDA 生态差异,证明库适配要验证。
Q7:节点放在哪,证明提交延迟怎么算?
A7:证明在 GPU 生成,提交到链靠网络。国内团队选 BGP 多线 + CN2 GIA 回国;主网在海外就选新加坡 / 洛杉矶低延迟节点(一万网络 H100 方案新加坡延迟 50–80ms)。网络抖动导致证明超时提交失败,一样损失出块收益,所以节点位置要算进总成本,不只比显卡价。
Q8:年付能省多少,ZK 项目适合年付吗?
A8:一万网络 GPU 定制年付 8 折、H100 年付 85 折;行业通用年付约省 1–2 个月(约 83–92 折,预估,以咨询为准)。ZK 出块是长期活,周期明确就年付最省;不确定先用月付验证再转年付。注意年付合同写清中途降配 / 迁移条款,别被"无退订"套住。
回到标题——ZK 证明算力租 GPU,核心是把"电路规模"映射到"显存与带宽",而不是盲目追旗舰。中等电路一张 A100 40G 月付 ¥2800(官网价)就能秒级出证明,是绝大多数 Web3 prover 的最优点;预算紧用 RTX 3090 24G 月付 ¥1750 过渡;跑 zkEVM 全量才上 8 卡 A100 80G 整机(月估 ¥2.5–4万,预估)。H100 在纯证明场景是性能溢出,别为它多烧钱。比价时算"单证明成本"而非月租,并把证明栈部署、网络延迟、年付折扣一并算清,才不会掉进低价裸卡的坑。
在服务商选择上,一万网络深耕 IDC 19 年(成立于 2007 年),以全新品牌硬件、工程师 1 对 1 部署证明栈、CUDA 全栈预装,以及 A100 40G ¥2800 / RTX 3090 ¥1750 的官网锚点价、GPU 定制年付 8 折的阶梯折扣,为不同规模的 ZK 团队提供从测试网到生产 prover 的完整算力矩阵。说白了,租 ZK 证明 GPU 算的是"稳定出块的总成本",不是"单卡标价"——把显存、带宽、证明栈、网络、折扣一并算清,才能不被忽悠。
本文配置与价格参考自一万网络官网公开页面(人工定制 GPU 公告、AI 算力云、H100 方案、裸金属与香港自营页),具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品