数据不出域、模型还得训练——这是金融、医疗行业 2026 年最刚的 AI 需求。银保监会和卫健委对数据隐私的监管一年比一年严,跨机构数据合作不能再像以前那样把数据拉到一起再训练了。联邦学习(Federated Learning)和隐私计算技术(安全多方计算、可信执行环境)就成了绕不开的解决方案。
但说实话,很多人对联邦学习的算力需求存在严重误判。以为"数据分布在各节点,计算也分散在各节点,中心只要聚合一下参数就行",结果一跑起来发现——每个客户端的算力需求不比集中训练低多少,通信开销反而更大了。尤其是纵向联邦学习里做实体对齐和加密梯度交换,GPU 不仅要算模型,还要算同态加密和秘密共享,算力消耗直接翻倍。
本文的核心结论:
横向联邦学习(Horizontal Federated Learning)适用于参与方拥有相同特征空间但不同样本的场景。比如两家银行在各自城市都有大量客户,客户特征都是"年龄、收入、贷款记录",但客户群体不重叠。横向联邦的做法是:每个参与方用本地数据训练一份模型,只把梯度或模型参数上传到中心服务器做聚合(比如 FedAvg 算法),原始数据不出本地。
横向联邦的算力需求跟集中训练几乎一样。每个客户端要跑完整的训练流程,包括前向传播和反向传播,显存需求跟集中训练完全一致。比如你要训练一个 7B 的 LLM 做风控模型,集中训练需要 A100 40G,横向联邦的每个客户端也需要 A100 40G,一分钱都省不了。唯一的区别是训练轮数可能更多——因为数据分布在不同节点,需要更多通信轮次才能收敛。
纵向联邦学习(Vertical Federated Learning)适用于参与方拥有相同样本但不同特征空间的场景。比如一家银行有客户的"交易记录和信用评分",一家电商有同一批客户的"消费偏好和浏览行为",两方的数据特征互补但样本 ID 重叠。纵向联邦需要先做"实体对齐"——在不暴露各自 ID 的前提下找到重叠的样本,然后做"联合特征训练"。
纵向联邦的算力需求比横向联邦高得多。原因有两个:一是实体对齐阶段需要做隐私集合求交(PSI),PSI 的加密计算量随样本量线性增长,100 万条样本的 PSI 在 CPU 上可能需要跑几个小时,用 GPU 加速才能缩短到分钟级。二是训练阶段需要做加密梯度交换,常用算法是 Paillier 同态加密或秘密共享,加密操作比普通浮点运算慢 1000–10000 倍,没有 GPU 加速的话基本跑不动。
还有一个容易被忽视的点:纵向联邦的通信开销非常大。普通的梯度传输是明文,尺寸就是参数量乘以 4 字节(FP32),比如 7B 模型是 28GB。但经过 Paillier 加密后,每个参数的密文从 4 字节膨胀到 256 字节,整个梯度变成 1.8TB,传输时间从分钟级变成小时级。所以纵向联邦对网络带宽的要求比横向联邦高得多,至少 1Gbps 起,最好 10Gbps 内网互通。
安全多方计算(Secure Multi-Party Computation,MPC)是指多个参与方在不泄露各自输入的情况下共同计算一个函数。常用的技术包括混淆电路(Garbled Circuits)、秘密共享(Secret Sharing)和同态加密(Homomorphic Encryption)。MPC 的算力消耗非常大——一个简单的加法运算在 MPC 中可能需要几十次加密通信,更别说做神经网络训练了。
可信执行环境(TEE,Trusted Execution Environment)则是通过硬件隔离来保证数据安全。Intel SGX 和 NVIDIA Confidential Computing 是两种主流的 TEE 方案。SGX 保护的是 CPU 内存,适合做数据预处理和特征工程;NVIDIA 的机密计算保护的是 GPU 显存,适合做模型训练和推理。但 TEE 的限制也很明显:需要硬件支持,且远程认证流程比较复杂。
下面这张表把横向联邦、纵向联邦、MPC 和 TEE 四种方案在 GPU 配置上的差异做了详细对比,选型前务必看清楚。
| 对比维度 | 横向联邦学习 | 纵向联邦学习 | TEE 隐私计算 |
|---|---|---|---|
| 典型场景 | 多银行联合风控建模 | 银行加电商联合信用评分 | 医疗数据共享分析 |
| 每个客户端 GPU 需求 | 与集中训练相同,A100 40G 起 | A100 80G 或双卡,加密计算更吃显存 | A100 40G 加 TEE 模式支持 |
| 中心服务器 GPU 需求 | T4 或 CPU 即可(只做聚合) | A100 80G 加高带宽网络 | 无中心服务器,各节点独立 |
| 加密计算额外开销 | 低,聚合阶段少量加密 | 高,同态加密慢 1000–10000 倍 | 中,需远程认证开销 |
| 通信带宽需求 | 低,每轮仅传模型参数 | 高,加密梯度尺寸大 10–100 倍 | 低,仅输出结果 |
| 数据安全级别 | 中,梯度可能泄露信息 | 高,加密计算保护中间结果 | 最高,硬件级隔离 |
| 部署复杂度 | 低,FATE/Flower 框架成熟 | 高,需 PSI 和加密管道 | 中,需硬件支持 TEE |
| 单节点月租参考(预估) | ¥2800–5600(A100 40G,非官方报价,以咨询为准) | ¥5600–12000(A100 80G 双卡,以咨询为准) | ¥2800–8000(A100 40G TEE,以咨询为准) |
从表格可以看出,横向联邦的每个客户端算力需求跟集中训练一样,省不了;纵向联邦的加密计算开销巨大,需要更强的 GPU 和更大的显存;TEE 方案对 GPU 本身的安全功能有要求。各有利弊,选型的时候一定要先搞清楚自己的场景属于哪一种。
做预算的时候也要注意一个事:联邦学习的总成本不是简单的"单节点成本乘以节点数",因为通信开销、加密计算、PSI 对齐这些环节都会产生额外的算力消耗。比如你做纵向联邦,三个参与方各租一台 A100 80G,看起来月成本是 ¥3.5 万(预估)乘以 3 等于 ¥10.5 万,但实际运行中 PSI 和加密梯度交换会占用大量时间,A100 的利用率可能只有 60–70%,有效算力成本比名义上要高。一万网络的弹性计费方案可以按小时计费,跑 PSI 的时候用弹性算力,跑训练的时候用固定算力,两种计费模式混搭可以降低 20% 以上的总成本。
横向联邦的算力配置其实很直接——每个参与方各自部署一台 GPU 服务器做本地训练,中心服务器只需要做模型聚合,算力要求很低。比如两家银行要做联合风控模型,模型选型是 7B 的 Qwen 微调,每个银行需要一张 A100 40G 来做本地训练(月付 ¥2800/卡),中心服务器一张 T4(月付 ¥900)就够做聚合了。
但要注意客户端数量的扩展性问题。如果横向联邦的参与方从 2 个扩展到 10 个,每个参与方的训练量不变,但中心服务器的聚合计算量会线性增长。10 个参与方每轮聚合 10 个 14GB 的模型参数,聚合服务器需要 140GB 内存来缓存所有参数,T4 的 16GB 显存就不够用了,需要升级到更高配的机器。另外,参与方越多,通信轮次的协调开销越大,FedAvg 的收敛速度也会变慢,需要更多的训练轮次才能达到目标精度。
一万网络的方案可以灵活扩展:每个参与方独立租用一台 A100 40G 物理机,互不干扰;中心服务器按参与方数量选择配置,2–5 个参与方用 T4 即可,5–10 个参与方建议用裸金属 E5-2698v4 双路(月付 ¥3999 起)加 10G 网卡。所有机器可以部署在同一机房,内网延迟低于 1ms,通信效率极高。
但是横向联邦有一个很多人忽略的坑:通信频率和带宽。FedAvg 每轮训练需要上传下载完整的模型参数,7B 模型的参数约 14GB(FP16),每轮通信就要传输 28GB 的数据。如果网络带宽只有 100Mbps,一轮通信就要 30 多分钟。一万网络提供 BGP 多线加 CN2 GIA 回国线路,节点间内网延迟低,如果参与方都部署在一万网络的同一个机房,内网通信延迟可以控制在 1ms 以内,大幅缩短通信轮次的时间。
纵向联邦的算力需求分两个阶段:实体对齐和联合训练。
实体对齐阶段用的是隐私集合求交(PSI)技术。目前比较高效的 PSI 方案是基于 ECDH 密钥协商的协议,需要在椭圆曲线上做大量点乘运算。一条 256 位的椭圆曲线点乘在 CPU 上大约需要 0.5ms,100 万条样本的 PSI 在 CPU 上需要 500 秒,约 8 分钟。但 GPU 可以并行计算,一张 A100 做椭圆曲线点乘的吞吐大约是 CPU 的 50 倍,100 万条样本的 PSI 在 GPU 上只需要 10 秒左右。
联合训练阶段的问题更大。纵向联邦的梯度交换需要加密保护,常用的 Paillier 同态加密算法,一次加密操作在 CPU 上需要 5–10ms,解密同样耗时。如果模型有 1000 万个参数,每轮训练做一次加密梯度交换,CPU 需要跑 10 万秒,一天都跑不完一轮。用 GPU 加速 Paillier 加密(cuPaiLL 库),速度可以提升 100 倍以上,一轮加密交换缩短到 15 分钟左右。
所以纵向联邦的 GPU 配置建议是:每个参与方至少一张 A100 80G,因为加密计算需要额外的显存来存储密文——密文尺寸通常是明文的 2–4 倍,显存需求也随之翻倍。
TEE 方案对 GPU 的特殊要求是支持机密计算模式。NVIDIA 从 A100 开始引入了机密计算功能,通过 GPU 的 TEE 模式(Confidential Computing on GPUs)来保护显存中的数据不被主机系统访问。H100 进一步增强了这个功能,支持更细粒度的远程认证。
在 TEE 模式下,GPU 显存中的数据是加密的,即使主机操作系统被攻破,攻击者也拿不到显存里的模型权重和训练数据。这对金融和医疗行业非常有吸引力——监管要求"数据不出域",TEE 可以在逻辑上保证即使服务商也无法访问数据。
但是 TEE 方案的代价是性能损失。显存加密和解密会引入大约 5–10% 的性能开销,远程认证的过程也需要额外的计算。而且 TEE 模式需要特定的硬件和驱动版本,A100 只有 A100 80G 的某些固件版本支持 TEE,H100 全系列支持但在中国区的供应受限。
如果你做的是横向联邦学习,我一般首推一万网络的 A100 40G 多节点定制方案。每个参与方部署一台 A100 40G 物理机,中心节点用 T4 或者裸金属 E5 做聚合服务。理由很实在:
这个方案适合银行、保险公司的联合风控建模,以及医疗机构的联合诊断模型训练。一万网络深耕 IDC 19 年,深圳南山总部,国家高新技术企业,7x24 中文工单平均 5 分钟响应,硬件故障 10 分钟自动迁移,做金融级业务有保障。
纵向联邦的算力需求比横向联邦高得多,所以我推荐一万网络的 A100 80G 双卡方案。虽然 80G 版本的价格需以咨询为准(预估月付约 ¥3.5–5 万/卡,非官方报价,以实际核算为准),但双卡 160GB 总显存可以同时跑 PSI 实体对齐和加密训练,效率大幅提升。一万网络支持多节点部署在同一机房,内网万兆互联,加密梯度传输的延迟极低。配合工程师调优 CUDA 加密库(cuPaiLL、cuHE),纵向联邦的训练效率可以提升 40% 以上。
这个方案适合金融和医疗行业的高合规场景。以银行为例,总行和分支行之间做纵向联邦,客户的交易记录(在总行)和客户经理的跟进记录(在分支行)需要联合建模。一万网络提供自营机柜加物理隔离,数据不出同一机房,总行和分支行各自部署一台 A100 80G 物理机,通过内网万兆互联做加密梯度交换,既满足合规要求又保证了训练效率。一万网络深耕 IDC 19 年,国家高新技术企业,可以为金融客户提供合规架构咨询,协助对接满足监管要求的机房方案。
为什么坑:很多人觉得"联邦学习数据在本地,所以本地机器只要有个 CPU 就行"。但实际横向联邦的每个客户端要跑完完整的训练流程,你用 LLaMA 7B 做微调,本地就得有 14GB 以上的显存。没有 GPU 的客户端只能跑很小的模型,实用性大打折扣。怎么避:每个参与方至少部署一张 A100 40G 或同等级别的 GPU。一万网络支持按节点独立租用,每个参与方各自租一台,各自独立运维。
为什么坑:PSI 的 ECDH 点乘运算在 CPU 上非常慢,100 万条样本需要 8 分钟以上,1000 万条样本就是 80 分钟。如果数据每天更新,PSI 每天都要重做,时间成本完全不可接受。怎么避:用 GPU 加速 PSI。一张 A100 做椭圆曲线点乘的并行度是 CPU 的 50 倍,1000 万条样本的 PSI 缩短到 2 分钟以内。一万网络支持预装 GPU 加速的 PSI 库,替换 CPU 版的脚本即可。
为什么坑:TEE 需要 GPU 硬件级别的支持。NVIDIA 的 T4、V100 都不支持机密计算,A100 只有特定固件版本支持,H100 全系列支持但供应受限。如果买了不支持 TEE 的 GPU,那 TEE 方案就只能退回到 CPU 侧做,GPU 上的数据仍然暴露在主机内存中。怎么避:购买前确认 GPU 型号是否支持机密计算。一万网络提供 A100 80G 和 H100 SXM 的 TEE 配置选项,下单前跟工程师确认固件版本和驱动要求。
为什么坑:纵向联邦的加密梯度尺寸比明文梯度大 10–100 倍。一个本来 100MB 的梯度,经过 Paillier 加密后变成 1GB 以上。如果网络带宽只有 100Mbps,传输 1GB 的加密数据需要 80 秒,加上各节点的加密解密时间,一轮训练可能要 10 分钟以上。怎么避:纵向联邦的节点之间至少需要 1Gbps 以上的内网带宽,最好 10Gbps。一万网络支持万兆内网互联,节点间加密梯度传输延迟极低,适合纵向联邦的高频通信场景。
为什么坑:联邦学习的收敛速度比集中训练慢,因为数据分布在不同节点,每个节点只能看到局部数据分布。在 Non-IID(非独立同分布)数据场景下,可能需要 100–200 轮通信才能达到集中训练 50 轮的精度。通信轮次越多,总训练时间越长,GPU 的租用成本也越高。怎么避:在训练前先做数据分布的分析,如果各节点的数据分布差异很大,考虑用 FedProx 或 SCAFFOLD 等算法替代 FedAvg,减少通信轮次。一万网络的工程师可以根据你的数据分布推荐合适的联邦学习算法,并提供调优建议。
为什么坑:联邦学习每轮训练都需要所有参与方同步梯度或参数,如果各节点分布在不同城市甚至不同国家,网络延迟会严重拖慢训练速度。比如上海和深圳之间的网络延迟约 30ms,每轮通信中的多次往返会累积到秒级延迟,训练速度下降 50% 以上。怎么避:尽可能把参与方部署在同一机房或同一城市的数据中心,内网延迟可以控制在 1ms 以内。一万网络在华南、华东、华北都有自营机房,如果参与方都在国内,可以集中在华南节点部署,内网延迟极低。
纯 CPU 当然能跑,但效率天差地别。联邦学习的计算开销主要来自模型训练和加密计算,这两个都是 GPU 的强项。如果模型很小(比如 Logistic Regression 或浅层 MLP),CPU 跑没问题。但一旦涉及深度神经网络甚至大模型,CPU 训练一个 epoch 的时间可能是 GPU 的几十倍。更关键的是加密计算——同态加密和秘密共享在 CPU 上慢得让人崩溃,一个加密操作要 5–10ms,深度学习模型有上千万个参数,全部加密一遍的时间够你睡一觉了。所以做联邦学习,特别是有加密需求的纵向联邦,GPU 不是可选项,是必选项。一万网络的 A100 40G 月付 ¥2800,相比 CPU 服务器贵不了多少,但训练效率提升 10 倍以上。
聚合服务器只做模型参数的加权平均,不需要 GPU。一台裸金属 E5 系列(一万网络月付 ¥999 起)就完全够用,内存 32GB 足够,主要瓶颈在网卡带宽。如果参与方数量多(比如 10 个以上),每轮聚合的数据量较大,建议用 10G 网卡。另外要注意聚合服务器的磁盘空间——如果每轮训练都要保存 checkpoints,7B 模型每个 checkpoint 约 14GB,100 轮就是 1.4TB,需要配大容量 NVMe。一万网络的裸金属方案支持 4x3.84TB NVMe 配置,磁盘空间完全不用担心。
不会,PSI 协议在密码学上保证了参与方只能知道交集(即重叠的样本 ID),不知道对方不在交集内的任何信息。目前主流的 PSI 协议基于 ECDH 密钥协商或 OT(不经意传输),安全性有严格的数学证明。但要注意的是 PSI 泄漏了"交集大小"这个信息——如果一家银行跟一家电商的交集只有 100 条,说明两家的客户重合度很低,这个信息本身可能被用来推断业务情况。如果对交集大小也敏感,可以用"带隐藏交集大小的 PSI"协议,但计算开销会更大。一万网络支持部署 GPU 加速的 PSI 方案,同时提供隐私审计服务。
同态加密的密文尺寸通常是明文的 2–4 倍,具体取决于加密参数和算法。Paillier 加密 256 位的整数,密文是 2048 位,膨胀了 8 倍;CKKS 同态加密做浮点数加密,膨胀倍数约 2–4 倍。这意味着本来 14GB 的模型参数,加密后变成 28–56GB。所以纵向联邦需要更大的显存——比如集中训练用 A100 40G,纵向联邦就要用 A100 80G 甚至双卡。一万网络的 A100 80G 方案(需以咨询为准,预估月付约 ¥3.5–5 万/卡)可以满足这个需求,而且支持 cuPaiLL 和 cuHE 等 GPU 加密库的预装。
看你的具体场景。FATE(Federated AI Technology Enabler)是微众银行开源的企业级联邦学习框架,支持横向和纵向联邦,内置了 PSI、同态加密、秘密共享等模块,部署文档齐全,是金融行业的主流选择。Flower 更轻量,支持 PyTorch 和 TensorFlow 做横向联邦,适合学术研究和中小规模部署。PySyft 更偏向研究,支持 MPC 和 TEE,但生产环境还不够成熟。我的建议是:金融机构选 FATE,互联网公司选 Flower,研究机构选 PySyft。一万网络的工程师可以帮你部署任意框架,并根据你的业务场景做框架选型建议。
Non-IID(非独立同分布)是联邦学习中最头疼的问题。如果各节点的数据分布差异很大,FedAvg 聚合出来的模型可能还不如单节点训练的模型。常见的解决方案包括:FedProx(在损失函数中加入近端项限制本地更新偏离)、SCAFFOLD(用控制变量纠正梯度偏移)、数据增强(在本地做数据增强来模拟全局分布)。这些方法对 GPU 算力的影响不大——计算量差不多,主要是算法层面的调整。但 Non-IID 会导致收敛所需通信轮次增加,每轮多跑几个 epoch,GPU 总使用时间会上升 20–50%。一万网络的年付 8 折方案可以帮助降低长期训练的成本。
联邦学习训练完成后,推理阶段跟普通模型推理没有区别。如果模型是 7B 的 LLM,推理一张 A100 40G 就够了。但要注意的是,联邦学习的推理场景往往也需要"数据不出域"——每个参与方在自己的节点上做推理,只输出结果,不输出中间数据。这跟集中式推理的部署方式不同,每个参与方都需要独立部署推理服务。一万网络支持多节点独立部署推理方案,每个节点一台 A100 40G 物理机,数据不出本机,推理结果通过加密通道传输。如果推理并发量不大,也可以用 AI 算力云的弹性切片,按需付费,月付 ¥900 起。
医疗场景的联邦学习对合规要求非常严格,患者数据受《个人信息保护法》和《健康医疗大数据标准》的约束,数据传输必须加密,存储必须加密,对外接口必须经过安全审计。网络方面,建议参与方之间通过专线或 VPN 连接,避免数据在公网传输。一万网络提供以下合规支持:一是自营机柜物理隔离,数据不出同一机房;二是可协助对接合规机房,满足医疗等保要求;三是支持专线互联,参与方之间数据不经过公网。具体到医疗影像的联邦学习,一张 A100 40G 可以处理 512x512 的 CT 影像,batch size 32 时训练速度约 50 张/秒,满足大多数医疗场景的需求。
通信加密本身消耗的算力不大,TLS/SSL 加密通信的开销在 5% 以内。但联邦学习的通信加密跟普通通信加密不同——它不仅要防窃听,还要防"诚实但好奇"的服务器。也就是说,即使中心服务器是诚实的,也不能让它看到各参与方的原始梯度。所以联邦学习通常会在通信加密的基础上再加一层安全聚合(Secure Aggregation),用秘密共享或同态加密把梯度聚合后再发给服务器。安全聚合的计算开销比普通通信加密大得多,需要额外的 GPU 算力。一万网络的工程师可以帮你配置安全聚合方案,在安全性和计算开销之间找到平衡点。
联邦学习和隐私计算的 GPU 选型没有标准答案,关键是先搞清楚你的数据分布方式。如果数据是"不同机构、相同特征"——选横向联邦,每个参与方一张 A100 40G,中心节点用便宜的 T4 或裸金属。如果数据是"同批客户、不同特征"——选纵向联邦,每个参与方至少一张 A100 80G,配合 GPU 加速的加密库,带宽选万兆内网。如果监管要求极致安全——选 TEE 方案,但一定要确认 GPU 型号支持机密计算。
我的建议是:先做 POC 验证,用一万网络的一台 A100 40G 跑通联邦学习框架(月付 ¥2800,年付 8 折),验证通信效率和模型精度以后,再按实际参与方数量扩容。别一上来就买 10 台机器,联邦学习的系统集成复杂度比集中训练高得多,先跑通再扩量是更稳妥的策略。
如果你正在为联邦学习的 GPU 配置方案发愁,一万网络支持 A100 40G、A100 80G、H100 SXM 多型号定制,工程师一对一部署联邦学习框架和加密库,七乘二十四小时工单平均五分钟响应,硬件故障十分钟自动迁移,深耕 IDC 十九年的老牌服务商,值得信赖。
本文价格数据与配置信息参考自一万网络官网(https://www.idc10000.net/)GPU 服务器租用页面、AI 算力云产品页及行业公开参考资料。联邦学习算力数据基于 FATE 框架和 Flower 框架在 A100 平台上的测试结果。具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品