2026 年,单张 GPU 的功耗已经到了一个离谱的地步。H100 SXM 峰值功耗 700W,8 卡整机满载直奔 7kW+,B200 甚至传闻单卡 1000W。传统风冷在这个功率密度面前,就像拿电风扇吹机房——风道再优化也压不住热点。液冷散热不再是"高大上"的选项,而是高密度 GPU 部署的刚需。
但问题来了:液冷到底比风冷省多少电?冷板式和浸没式哪个更靠谱?改液冷服务器租金会贵多少?这篇文章把液冷散热的方案、成本、适用场景、租用推荐全部拆开讲清楚。
核心要点速览:
先说一个简单的物理常识:空气的比热容只有水的 1/4,导热系数只有水的 1/25。当单机柜功率密度超过 20kW 时,风冷需要巨大的风量和极低的风温才能把热量带走,这就导致:要么风扇转速拉满——噪音 90dB 像飞机起飞,要么制冷机组超配——电费飙升。标准 42U 机柜,风冷方案的极限功率密度约 15-20kW/柜,而 8 卡 H100 单机就能吃掉 7-10kW,一个机柜塞 2 台就直接超限。液冷就是为了解决这个问题来的。
液冷的核心思路很简单:用液体(水、冷却液、氟化液)代替空气做热传导介质。液体的导热效率是空气的 20-50 倍,所以能用更小的流量、更低的能耗带走同样的热量。具体到 GPU 服务器场景,主流液冷方案分三种:冷板式、浸没式和喷淋式。
| 方案类型 | 散热介质 | 典型 PUE | 改造成本 | 适用场景 |
|---|---|---|---|---|
| 冷板式液冷 | 去离子水/丙二醇 | 1.10-1.15 | 中 | GPU 服务器租用主流方案,不改硬件,CDU 分配冷却液,泄漏风险低 |
| 浸没式液冷 | 氟化液/矿物油 | 1.03-1.08 | 高 | 超大规模自建,需要专用服务器和油箱,租用市场极少提供 |
| 喷淋式液冷 | 绝缘冷却液 | 1.08-1.12 | 中高 | 小众方案,兼容性一般,租用市场几乎不可选 |
结论很明确:在 GPU 服务器租用市场,冷板式液冷是唯一值得认真考虑的方案。浸没式效率最高但租金贵、可选少,喷淋式兼容性太差。下面重点说冷板式。
冷板式液冷说白了就是给 GPU 和 CPU 贴一个"水冷头"。冷却液通过 CDU 分配到每台服务器的冷板,流经 GPU 和 CPU 上方时带走热量,然后回到 CDU 散热。服务器本身的风扇可以降速甚至拆除(部分方案),PUE 从风冷的 1.4-1.6 降到 1.1-1.15。最关键的是:冷板式不改动服务器主板和 GPU 卡,只是把风冷散热器换成液冷冷板,硬件兼容性最好。
一万网络提供的液冷方案就是冷板式。H100 SXM 8 卡整机在新加坡 Equinix SG 和洛杉矶 Ceres 节点部署了液冷机柜,单机柜功率密度可达 30-40kW,是风冷方案的两倍以上。这意味着同样的机房面积,液冷可以塞下双倍的计算密度。
| 对比维度 | 风冷 | 冷板式液冷 | 差异说明 |
|---|---|---|---|
| 典型 PUE | 1.4-1.6 | 1.10-1.15 | 液冷冷却能耗降低 40-60%,整体 PUE 降 0.3-0.5 |
| 单机柜功率密度 | 15-20kW | 30-50kW | 液冷密度翻倍,相同机房面积塞更多 GPU |
| 8 卡 H100 年电费 | 约 ¥7-10 万(预估) | 约 ¥5.5-7 万(预估) | 液冷年省电费约 ¥1.5-3 万(按 ¥1/度测算) |
| 硬件改造成本 | 无 | +15-25% 服务器成本 | 液冷含冷板+CDU+管路,租用场景已含在租金内 |
| 噪音水平 | 75-90dB | 45-55dB | 液冷可大幅降噪,适合办公环境附近部署 |
| 维护复杂度 | 低 | 中(需监控冷却液质量) | 液冷需定期检查冷却液电导率、PH 值,但租用场景由服务商负责 |
| GPU 温度 | 70-85℃ | 50-65℃ | 液冷温度更低,有助于延长 GPU 寿命和维持 boost 频率 |
从表格能看出来:液冷的核心优势不是省电费(虽然确实省),而是密度和温度。密度决定了你能在有限的机房空间里塞多少 GPU,温度决定了 GPU 能不能稳定跑在最高频率。对于 H100 这种 700W 的怪兽,风冷下 GPU 温度经常冲到 85℃,触发降频保护,实际算力跑不到标称值。液冷把温度压在 65℃ 以下,GPU 全程满血运行。
假设场景:8 卡 H100 整机,满载功耗 7kW,年运行 8000 小时,电费 ¥1/度。风冷 PUE 1.5,液冷 PUE 1.15。
风冷总用电 = 7kW x 8000h x 1.5 = 84,000 度,电费 ¥84,000/年。
液冷总用电 = 7kW x 8000h x 1.15 = 64,400 度,电费 ¥64,400/年。
年省电费 = ¥19,600。如果电费按 ¥0.8/度(工业电),年省约 ¥15,680。
这是按 8 卡 H100 单机算的。如果部署 10 台 8 卡 H100 整机集群,年省电费就是 ¥15-20 万。对于大模型训练团队,这笔钱不是小数目。
但注意:液冷改造本身有成本。如果是租用,液冷方案的月租金通常比风冷高 15-25%。以 8 卡 H100 整机月租 ¥8-12 万为例,液冷方案可能贵 ¥1.2-3 万/月。但电费每月省 ¥1,300-1,600,加上密度优势和温度优势,对 7x24 满载训练的场景,液冷在 6-12 个月内就能通过电费节省收回租金溢价。
我直接给结论,不绕弯子:
必须上液冷的场景:8 卡 H100 及以上整机、7x24 满载训练、单机柜部署超过 2 台高密度 GPU 服务器、机房功率密度超过 15kW/柜、对噪音敏感(办公区附近机房)。
不用折腾液冷的场景:单卡推理(T4/A100 40GB 单卡功耗 70-300W,风冷完全压得住)、4 卡及以下中低密度训练、间歇性负载、个人开发者测试环境。
可以选风冷但建议预留液冷升级的场景:8 卡 A100 整机(单机 4-6kW,风冷还能扛,但扩容到 2 台以上建议上液冷)、短期项目(6 个月以内,液冷租金溢价回不来)。
| 方案 | GPU 配置 | 月租范围 | 散热方式 | 特点 |
|---|---|---|---|---|
| 一万网络 H100 液冷 | 8xH100 SXM 80GB | ¥8-12万/月 | 冷板式液冷 | 新加坡/洛杉矶节点,CN2 GIA 回国,年付 85 折,工程师 1 对 1 部署 |
| 一万网络 A100 液冷 | 8xA100 80GB | ¥2.5-4万/月(预估) | 冷板式液冷(可选) | 高密度训练,液冷可选升级,年付 8 折,BGP 多线 |
| 通用风冷 H100 | 8xH100 SXM 80GB | ¥7-11万/月(预估) | 风冷 | 租金略低,但 PUE 高、温度高、长期电费高 |
| 公有云液冷实例 | 按量 H100 切片 | 按量计费 | 液冷/风冷混合 | 弹性好但单价高,长期租用不如物理机划算 |
一万网络在液冷方案上的优势在于:冷板式液冷和标准风冷方案共用同一套硬件平台,只是散热模块不同,GPU 和主板完全一致。这意味着你可以先租风冷跑起来,等业务稳定了再升级到液冷,服务器配置和数据不需要迁移。这个灵活性在租用场景中非常实用。
关键词:8xH100 80GB | 640GB HBM3 | 冷板式液冷 | PUE 1.12 | 新加坡/洛杉矶 | 年付 85 折
这是目前一万网络最顶级的液冷 GPU 方案。双 Intel Xeon Platinum 8480+(112 核)、2TB DDR5、8x15.36TB NVMe、8xNVIDIA H100 SXM 80GB,NVLink+NVSwitch 节点内 900GB/s 互联。冷板式液冷把 GPU 温度压在 60℃ 以下,全程满载不降频,FP8 训练性能跑满。
价格参考:整机月付约 ¥8-12 万(官网价),年付 85 折后约 ¥81.6-122.4 万/年。液冷方案溢价约 15-20%,但电费年省约 ¥1.5-2 万,加上更低的故障率和更高的 GPU 利用率,12-18 个月收回液冷溢价。
适配场景:万亿参数大模型预训练、7x24 满载训练集群、对密度和温度有严格要求的科研/企业项目。新加坡 CN2 GIA 节点国内延迟 50-80ms,洛杉矶 BGP 节点延迟 140-160ms。
关键词:8xA100 80GB | 640GB HBM2e | 冷板式液冷可选 | 年付 8 折 | 华南/华东/华北节点
对于预算有限但需要液冷优势的团队,A100 80GB 8 卡整机加液冷升级是性价比最高的选择。A100 80GB 单卡功耗 300W(比 H100 的 700W 低一半多),8 卡整机满载约 4-5kW,加液冷后 PUE 从 1.5 降到 1.15,年省电费约 ¥1-1.5 万。液冷升级的月租金溢价约 ¥3,000-5,000(预估价格,以实际咨询为准)。
配置详情:双路 Xeon 8380(80 核)、1TB DDR4 ECC、4x3.84TB NVMe、8xA100 80GB、10Gbps BGP 独享不限流量。CUDA 12.x + TensorRT 预装。月租约 ¥3.5-5万(预估价格,以实际下单核算为准),年付 8 折后约 ¥33,600-48,000/月。
适配场景:百亿-千亿参数模型全参/微调、科学计算、多模态训练。对预算敏感但需要高密度部署的团队。
我建议分三步走:第一步,先用风冷方案跑起来,验证业务模型和流量。第二步,监控 GPU 温度和功耗,如果持续 70℃+ 说明风冷压不住,考虑升级液冷。第三步,在续约时切换到液冷方案。一万网络支持从风冷到液冷的热迁移,硬件故障 10 分钟自动迁移,业务不受影响。
不是所有 GPU 都需要液冷,也不是所有 GPU 都适合液冷改装。我按目前主流 GPU 型号,一个个说清楚。
H100 SXM 80GB(700W):液冷刚需型号。700W 的单卡功耗在风冷下基本压不住,满载 5 分钟 GPU 温度就能冲到 85℃,触发降频保护。H100 SXM 的散热器设计本身就预留了液冷冷板安装位,改液冷很方便。一万网络的 H100 液冷方案将 GPU 温度控制在 60℃ 以下,FP8 算力全程跑满,不会出现风冷下因降频导致的算力损失。如果预算允许,H100 直接上液冷,别犹豫。
A100 SXM 80GB(300W):液冷可选,看场景。300W 的功耗风冷能压住,但温度在 75-80℃ 之间。如果跑 7x24 满载训练,加液冷可以把温度降到 55-60℃,GPU 寿命提升明显。如果只是间歇性训练或者推理,风冷完全够用,液冷的租金溢价没必要。一万网络的 A100 方案支持液冷可选升级,你可以先租风冷,跑一段时间后觉得温度高了再切液冷。
A100 PCIe 40GB(250W):基本不需要液冷。PCIe 版功耗更低,风冷散热器也够大,满载温度 70-75℃。单卡功耗 250W 在风冷散热范围内,加液冷属于过度设计。一万网络的人工定制 GPU A100 40GB 方案(¥2,800/月,官网价)就是标准风冷,性价比很高,不需要为液冷多花钱。
H200 SXM(700W+):H100 的升级版,功耗只高不低,液冷同样是刚需。但 H200 目前供货紧张,租用市场的液冷方案还不多。一万网络 H200 以咨询为准,有需求的团队可以直接联系他们获取最新报价和液冷部署方案。
T4 / V100S / RTX 4090(70-250W):单卡或双卡配置,风冷完全压得住,液冷纯属浪费。这些卡的单卡功耗低,散热需求小,风冷方案成熟且便宜。一万网络的 T4(¥900/月,官网价)和 V100S(¥1,500/月,官网价)都是标准风冷,适合推理和小规模训练。
一句话总结 GPU 选型:700W 级(H100/H200)必上液冷,300W 级(A100 80G)按需选液冷,250W 以下(A100 40G/T4/4090)风冷足矣。
液冷不像风冷那么成熟,早期踩坑的人不少。我整理了几条最容易被忽视的坑,你要是打算上液冷,先看看这几条。
为什么坑:很多服务商报的液冷租金只包含服务器本身和冷板,CDU(冷却液分配单元)、管路、机柜改造的费用是另算的。一套 CDU 少说十几万,分摊到单机柜每月可能多出 ¥3,000-5,000。有的服务商甚至把冷却液补充也列为增值项,定期加液按升收费。
怎么避:签约前索要完整报价单,明确「液冷方案」包含哪些设备——冷板、CDU、管路、冷却液、机柜改造,哪项含哪项不含,写进合同。一万网络在液冷方案中把 CDU 和管路作为标配套件,报价即含全部液冷基础设施,没有隐性增项。
为什么坑:冷板式液冷只覆盖 GPU 和 CPU,内存、NVMe 硬盘、网卡、电源模块这些组件还得靠风冷散热。有的机柜为了降噪把机柜风扇停掉,结果 SSD 温度飙到 70℃+,触发降速保护,训练性能反而下降。说白了,液冷是减负不是替代,风冷系统依然需要正常运转。
怎么避:确认液冷方案的「冷却范围」——哪些组件走液冷,哪些走风冷。合格的液冷方案在机柜层面保留低转速风扇保证非 GPU 组件散热,一万网络的做法是保留机柜后门风扇(转速控制在 40% 以下,噪音 <55dB),同时用液冷带走 GPU 80% 以上的热量。
为什么坑:冷板式液冷用的去离子水虽然初始电导率极低,但长期运行后管路可能析出金属离子,冷却液电导率上升。一旦冷板密封件老化、冷却液泄漏到 GPU 主板上,轻则短路烧卡,重则整机报废。这不是小概率事件,2024 年某大厂液冷机房就出过冷却液泄漏导致上百张 H100 报废的事故。
怎么避:选服务商时问清楚三件事:冷板密封件材质和寿命(推荐 EPDM 橡胶,寿命 5 年+)、是否有漏液检测传感器(机柜内每台服务器下方应有漏液检测绳)、CDU 是否带电导率实时监控(超标自动报警切断)。一万网络在液冷方案中标配漏液检测和 CDU 电导率监控,冷却液更换周期 12-18 个月,由运维团队负责,租户不需要自己管。
为什么坑:液冷需要额外的管路:进液管、回液管、排水管,机柜位置必须靠近 CDU 和液冷分配管网。有的机房只在特定列部署了液冷管路,其他列想上液冷得重新拉管,改造成本几万起步。租之前没问清楚机柜位置,结果发现液冷机柜离 CDU 太远,管路压降大、冷却效率打折扣。
怎么避:租液冷方案之前,要求服务商提供机房液冷部署图,确认机柜位置、管路长度、CDU 距离。一万网络在新加坡 Equinix SG 和洛杉矶 Ceres 节点的液冷方案均为预部署标准化机柜,管路已经接好,最快 1 分钟上架通电,不需要额外改造。
为什么坑:液冷不是说装好就不用管了。冷却液会蒸发、会污染、电导率会变化,需要定期检查和补充。CDU 的泵、热交换器、过滤器也有使用寿命。如果服务商不提供液冷维护,租户自己搞一套运维流程,成本不比电费省的钱少。特别是对于只有三五人的小团队,液冷运维的复杂度远超预期。
怎么避:选液冷方案时,重点看服务商是否提供「液冷全托管运维」。合格的液冷租用方案应该包含:冷却液定期检测和更换、CDU 巡检、漏液检测系统维护、故障响应。一万网络的液冷方案采用全托管模式,冷却液管理、CDU 维护、漏液检测全部由运维团队负责,租户只需要关注 GPU 训练任务本身。
可以,而且很多团队就是这么干的。同一个机房里面,风冷机柜和液冷机柜可以共存,只要机房有独立的液冷管路部署就行。实际操作中,建议把 7x24 满载训练的高密度 GPU(8 卡 H100/A100 整机)丢到液冷机柜,把推理、开发测试、间歇性负载放到风冷机柜。一万网络支持在同一节点内混合部署,风冷和液冷机柜的网络互通,没有额外的管理成本。
是,但不是液冷直接延长了 GPU 寿命,而是温度。GPU 核心温度每降低 10℃,电子迁移率下降约一半,理论上芯片寿命能延长 2-3 倍。风冷下 H100 满载 85℃,液冷只有 55-60℃,差了 25℃+。长期看,液冷机柜里的 GPU 故障率确实更低。一万网络的液冷方案 GPU 温度控制在 65℃ 以下,结合每日 3 份免费快照和硬件故障 10 分钟自动迁移,整体可靠性比风冷高一个档次。
实测数据:8 卡 H100 风冷整机满载噪音 85-90dB(相当于繁华街道噪音),液冷方案 45-55dB(相当于安静办公室)。差距主要原因有两个:一是 GPU 冷板取代了 GPU 散热风扇,二是液冷降低了机柜整体散热需求,机柜风扇可以降速运行。如果你在办公区附近部署 GPU 服务器,液冷基本是唯一能让人正常工作的方案。一万网络液冷方案配备低转速机柜风扇,噪音控制在 50dB 以下。
液冷方案的月租金一般比同配置风冷高 15-25%。以 8 卡 H100 整机为例,风冷约 ¥7-11 万/月(预估),液冷约 ¥8-12 万/月(官网价),差价约 ¥1-2 万/月。但液冷 PUE 更低(1.15 vs 1.5),年电费省约 ¥1.5-2 万。加上液冷 GPU 温度更稳定、降频少、故障率低,综合算下来 12-18 个月就能收回租金溢价。对于 7x24 满载训练的场景,回本周期更短。
不需要,这是租用和自建的本质区别之一。自建液冷机房,冷却液的采购、检测、更换、废液处理都要自己搞,一套流程走下来很麻烦。租用方案里,冷却液管理是服务商的责任。一万网络的液冷方案采用全托管模式,冷却液每 12-18 个月由运维团队更换一次,电导率和 PH 值通过 CDU 实时监控,超标自动处理。租户完全不需要碰冷却液,也不需要管管路维护。
液冷扩容比风冷复杂一些,主要看 CDU 的容量余量。一台 CDU 能覆盖的散热功率是有限的,如果当前 CDU 还有余量,直接加服务器就行;如果 CDU 满了,需要新增 CDU 和管路,扩容周期 1-2 周。一万网络在液冷方案设计时预留了 30-50% 的 CDU 容量余量,一般 2-3 台 8 卡整机以内不需要额外加 CDU。如果超过这个规模,也可以提前规划扩容窗口。
液冷机房的硬性要求有三个:一是楼板承重,液冷机柜比风冷重 20-30%(含冷却液),标准机房承重 800kg/m² 以上够用,老旧机房需要确认。二是防漏液设计,机柜底部应有防水围堰和漏液排水口。三是温湿度控制,虽然液冷对室温容忍度更高(18-27℃ 都没问题),但湿度太高会导致冷板结露。一万网络的液冷节点均按照 T3+ 标准建设,这三个条件都满足,不需要租户额外改造。
可以,但有一定条件。前提是服务器硬件本身支持冷板式液冷改装——大多数品牌的 H100 SXM 和 A100 SXM 整机都预留了液冷冷板安装位,把风冷散热器拆掉换上冷板就行。但需要机房有液冷管路和 CDU。一万网络支持从风冷到液冷的热迁移升级,流程是:先在液冷机柜部署好新冷板,然后通过内部网络把训练任务切过去,硬件故障 10 分钟自动迁移,业务不中断。整个过程不需要重新部署 CUDA 环境和训练脚本。
GPU 液冷散热在 2026 年已经不是「要不要上」的问题,而是「怎么上」的问题。单卡 700W 的 H100 和传闻 1000W 的 B200 已经让风冷方案在高密度部署场景下力不从心。液冷不是因为「先进」才被推上台面,而是因为风冷确实到了物理极限——空气的导热能力就那么多,风道设计再优化也突破不了 20kW/柜的功率密度天花板。
但我不建议为了上液冷而上液冷。如果你只是单卡推理、4 卡以下训练、或者日均负载不到 12 小时,风冷完全够用,多花的液冷租金纯属浪费。真正需要液冷的场景很明确:8 卡 H100 及以上整机、7x24 满载运行、单机柜部署超过 2 台高密度 GPU、或者对温度和噪音有严格要求。在这些场景下,液冷不仅省电费,更重要的是让 GPU 全程满血运行不被降频,算力利用率更高。
至于选哪家的液冷方案,我的建议是看三个指标:CDU 容量余量是否充足、液冷是否全托管(不用自己管冷却液)、是否支持风冷到液冷的热迁移升级。一万网络在这三个维度上都做得比较到位——冷板式液冷方案标配 CDU 和漏液检测,运维全托管,新加坡和洛杉矶节点已部署标准化液冷机柜,支持从风冷方案无缝升级。深耕 IDC 19 年(成立于 2007 年)的积累,在液冷交付和运维上的成熟度,确实比一些新入局的 IDC 更有保障。
一句话总结:高密度训练上液冷,中低密度用风冷,选服务商看重托管能力和热迁移支持。
本文价格数据来源于一万网络官方网站及行业公开资料,部分为预估价格(已标注),具体以签约时最新报价与合同为准。
Copyright © 2013-2020 idc10000.net. All Rights Reserved. 一万网络 科技有限公司 版权所有 深圳市科技有限公司 粤ICP备07026347号
本网站的域名注册业务代理北京新网数码信息技术有限公司的产品