过去几十年,数据中心的散热逻辑非常简单:服务器产生热量,空调系统输送冷空气,风扇带走热量。空气是数据中心最熟悉的冷却介质,但随着大模型训练和推理需求爆发,GPU功耗持续攀升,传统风冷正在逼近物理极限。

一台高性能AI服务器机柜的功率密度从过去的10-20kW,快速迈向100kW甚至更高,数据中心正在从“风冷时代”进入“液冷时代”。

然而,就在液冷成为AI基础设施共识的同时,一个长期被行业回避的话题正在浮出水面:液冷真的安全吗?

支持者认为,液冷是解决AI算力增长的必经之路,没有液冷,未来百万卡级AI集群可能无法稳定运行;

质疑者则指出,数据中心过去最大的风险来自电力和网络,而液冷正在引入一个新的变量——大量液体进入IT设备附近。

一旦发生泄漏、腐蚀、污染或者运维失误,过去“一台服务器损坏”的问题,就可能扩大为“机柜、局部集群或机房级故障”。

因此,“液冷不安全”的争议,本质上并不是液冷技术是否可靠,而是AI时代的数据中心,是否已经准备好管理一种更加复杂的基础设施系统。

这场争论背后,是数据中心产业从规模扩张走向系统工程时代的一次转折。

1

 01 

第一个风险:漏液危机 

在液冷讨论中,“泄漏”永远是最敏感的话题。

传统数据中心也存在水系统,例如冷冻水空调、机房空调等。但这些系统通常位于机房外围,与服务器保持距离。而液冷时代,冷却液距离GPU芯片可能只有几厘米。这意味着,风险发生的位置发生了变化。

如果空调管路出现问题,可能影响的是机房环境;而如果服务器内部快速接头失效,冷却液可能直接接触价值数万美元甚至更高的GPU设备。

尤其是在AI服务器中,单个机柜价值正在快速提升。一些高端AI机柜集成大量GPU、网络设备和电源系统,整体价值远高于传统服务器机柜。一旦液冷系统出现问题,损失可能不仅是硬件成本,还包括训练任务中断、模型重新训练以及业务损失。

行业中已经出现过由于冷却系统故障导致数据中心中断的案例。2023年,谷歌欧洲一个云区域曾因法国巴黎数据中心发生冷却系统相关事故受到影响。谷歌指出,数据中心冷却系统水管泄漏,水进入UPS房间并引发火灾,随后整个建筑被断电,集群停机,受影响设备还需要拆解和清洁。

需要强调的是,这不是直连芯片液冷事故,而是传统冷却水系统事故。它说明了液体风险的真正危险之处,故障未必发生在服务器上,却可能沿着空间、供电和设备链路形成级联。

Vertiv指出,当液体、电力和高密度IT必须在更小空间共同存在时,安全需要同时考虑电气、流体质量、防漏和运维准备。

对于高密数据中心而言,“有没有漏”只是第一问,“在哪里漏、多久发现、能不能快速隔离”才真正决定事故后果。

液冷也不是一根管子,而是一整条回路:冷板带走芯片热量,歧管分配流量,快接承担维护,软管连接机架,CDU负责换热、泵压和控制,冷却液还要持续满足温度、压力、洁净度和材料兼容性要求。

中国移动通信集团设计院有限公司发表的《一种适用于数据中心液冷系统的新型兼容性流体连接器》中指出,流体连接器在兼容性、泄漏、压力和抗腐蚀性方面的性能在系统安装和芯片维护场景中至关重要。

这意味着,当系统越大,接口越多,可靠性就越依赖这些“小件”长期保持一致性。

2

 02 

 第二个风险:液体变质 

如果说泄漏是液冷最直观的风险,那么液体变质则是更深层的问题。

液冷最棘手的地方,是很多问题不会在系统刚上线时立刻暴露。比如,软管会老化,密封件会受到温度、压力和介质影响,快接会经历反复插拔,管路还可能受到腐蚀。

风冷时代,数据中心运维经验主要围绕温度、电力、网络展开。而液冷时代,运维人员需要理解流量、压力、液体化学性质、材料兼容性以及微生物控制。

例如,在冷板式液冷系统中,冷却液需要长期保持稳定。如果液体中出现杂质、腐蚀产物或者微生物繁殖,可能造成过滤器堵塞、流量下降,甚至影响芯片散热。

对于AI服务器而言,这种风险更加突出。因为GPU冷板内部的流道非常精密,任何污染都可能影响散热效率。业内专家指出,高性能液冷系统需要严格控制冷却液质量,包括腐蚀控制、颗粒污染以及化学稳定性,否则长期运行可能导致性能下降。

也就是说,液冷安全不能只问“会不会漏”,还要问“液体变质以后会发生什么”。当污染物进入微通道,问题可能从漏液迅速转化为结垢、腐蚀、堵塞和换热能力下降。

这一点已经有研究支持。2025年发表于ASME《Journal of Electronic Packaging》的研究指出,单相液冷系统冲洗后仍可能残留旧介质,新旧冷却液交叉混合后可能诱发微生物繁殖,带来结垢、腐蚀和换热能力下降。

ASHRAE在AI数据中心调试框架提醒,液冷部署依赖施工启动阶段的清洗、冲洗与钝化,洁净度不足可能造成冷板堵塞,也会提高IT设备暴露于液体泄漏的风险。液冷安全因此进入化学和水质管理。

ASHRAE‑PNNL‑NEMA发布的《AI Data Center Energy Performance Framework》指出,AI 算力工厂液冷项目在施工及启动阶段,若洁净度与系统准备工作不到位,极易发生设备结垢污染。

水力系统(特别是技术冷却系统TCS)的清洗、冲洗与钝化流程,绝不能为追求工期进度而妥协。如果流体洁净度得不到保障,部署阶段IT设备冷板会出现结垢堵塞,或因调试环节管控不严导致IT设备面临漏液暴露风险,进而造成严重项目延期。

3

 03 

第三个风险:检测盲区 

当漏液被发现之后,才是安全的第二场考试。传统漏水检测围绕地面、吊顶、空调和机房管路布置,而直连芯片液冷把更多潜在漏点带到了机架内部。

行业分析指出,直接液冷可能让部分泄漏点位于传统地面漏水绳之外。OCP最新规范也建议根据风险在CDU、机架、机箱、快接和计算节点附近设置检测,并结合压力、流量等间接信号。

问题在于,传感器越多,系统越复杂;真正困难的不是“装传感器”,而是确定哪些位置必须被覆盖,以及怎样避免误报与漏报。

更重要的是,检测到了,也不等于安全。真正决定事故会不会扩大的,是告警之后能否自动干预。如果报警只是出现在DCIM屏幕上,再等待人员到场确认、关阀、断电、排液,液冷事故仍然存在明显的人因风险。

OCP已经把泄漏干预和泵故障策略写入风险管理;行业真正需要的,是让流量、压力、液位、温度、漏液、泵状态和IT健康状态共同参与故障判断,并在必要时自动隔离故障回路。否则,监测系统反而可能成为新的复杂性来源。

这里最容易出现一个认知误区:把“有漏液检测”直接等同于“液冷安全”。实际上,检测只是第一步,后面还有定位、隔离、断液、排液、清洁、复检和恢复。

假如一个泄漏报警无法对应到准确的机柜、回路和阀门,或者自动隔离会误伤大量正常算力,那么系统即便检测到了故障,也可能付出过高的业务代价。液冷时代真正需要建立的,不是单一报警机制,而是围绕故障域设计完整的响应链路。

这意味着,液冷项目验收也不能只盯着“正常运行温度是多少”。更重要的是,要验证异常状态下系统怎么工作:一个快接失效怎么办,一个CDU停泵怎么办,一个回路堵塞怎么办,一个传感器失灵怎么办,一个区域发生漏液怎么办。

对传统数据中心而言,很多测试是在验证设备“能不能运行”;对AI液冷数据中心而言,更关键的是验证系统“出了问题还能不能把问题关在一个局部”。这实际上是在给液冷项目争取故障隔离时间。

4

04 

第四个风险:责任模糊

液冷还带来了新的责任划分问题,液冷安全究竟由谁负责?

芯片厂商定义冷板参数,服务器厂商设计冷板和内部管路,CDU厂商负责泵、换热和控制,液冷集成商负责系统连接,机房建设方负责一次侧设施,运维团队负责冲洗、加液、排液和维护。

每一家都可能说“我的设备符合要求”,但当多个品牌、多个回路和多个施工团队拼成完整系统后,真正的系统可靠性却没有天然的单一责任人。液冷因此正在从设备采购逻辑,转向系统集成和全生命周期责任逻辑。

如果GPU因为温度异常损坏,到底应该由服务器厂商负责,还是液冷系统供应商负责?如果冷却液品质下降导致芯片故障,责任又如何划分?这些问题,目前行业仍在探索。

施耐德电气(Schneider Electric)白皮书《Direct Liquid Cooling System Challenges in Data Centers》提出,液冷部署中 IT 设备与冷却基础设施深度耦合,给规格设计、材料选型、维护权责划分以及质保边界界定带来显著复杂性。

这意味着,液冷最大的挑战,不只是技术问题,而是产业体系的问题。

AI数据中心未来面对的,不再是一台台独立服务器,而是一套高度耦合的“算力工厂”。液冷,就是连接这座工厂的重要血管,而血管越复杂,对设计、制造和运维能力的要求越高。

所以,“液冷不安全”真正刺中的,是AI数据中心过去那套工程思维正在失效。对液冷而言,“上线”不是工程结束,而是可靠性验证的开始。

当AI集群进一步走向更高功率和更大规模,液冷的风险也会被数量放大。机柜越多,CDU越多,管路越长,连接器、阀门和传感器越多,潜在失效点就越密集。单点故障不一定造成灾难,但在高度耦合的系统中,故障可能沿着冷却、供电、控制和IT链路扩散。

因此,数据中心真正应该计算的,不只是PUE和散热效率,还包括故障域多大、隔离速度多快、一次泄漏最多影响多少机柜,以及一个冷却回路失效后,其他回路能否承接负载。这也是液冷规模化后最需要重新定义的指标之一。

5

 05 

结语 

回到“液冷不安全”这个争议点。

如果站在产业发展的角度看,液冷并不是一种危险技术,而是一种高复杂度技术。任何基础设施升级都会伴随新的风险。电力系统刚进入数据中心时,人们担心电气事故;云计算兴起时,人们担心数据安全;AI数据中心进入高密度计算阶段,人们开始关注液冷安全。

但技术发展的规律往往是:旧风险消失,新风险出现。

真正的问题,不是是否采用液冷,而是行业是否能够建立匹配液冷时代的安全体系。未来的数据中心,将越来越像一座工业化“算力工厂”。其中不仅有服务器,还有高压供电系统、液冷系统、能源管理系统、智能运维系统。任何一个环节失效,都可能影响整体运行。

液冷安全性的争议,也许只是AI基础设施大变革中的一个缩影。它提醒产业:人工智能时代,算力建设已经进入“精密工程时代”。真正决定未来的,不是谁建了最大的算力中心,而是谁能够让这些算力中心长期、安全、高效地运行。

6

立即扫码,免费申领大会门票

2026年12月10-16日,第二十一届中国IDC产业年度大典(IDCC2026)系列活动将在北京重磅开启,以“智能生长 算电有度——重构IDC产业价值链”为主题,联动三大主论坛,20+主题论坛,超过30场创新应用与企业专场、产业资源对接、DITExpo同期展览、年度评选及全球AI基础设施考察行等活动,邀请产业各方共同探寻下一阶段的产业发展答案。

其中,IDCC2026主题论坛——“COOL-AIDC论坛暨中国智算热管理产业发展论坛将面向AI算力爆发带来的散热挑战,从“极致冷”、“创新冷”到“场景冷”,深入探讨制冷系统、液冷材料、混合冷却、自然冷源,以及海底、太空等场景下的热管理方案。

7

关注中国IDC圈官方微信:idc-quan 我们将定期推送IDC产业最新资讯

查看心情排 行你看到此篇文章的感受是:


  • 支持

  • 高兴

  • 震惊

  • 愤怒

  • 无聊

  • 无奈

  • 谎言

  • 枪稿

  • 不解

  • 标题党
2026-07-23 15:29:24
2026-05-15 10:58:00
国内资讯 嘉宾征集!液冷、供配电、模块化交付——从“供应商”到“行业话语权参与者”|DIFGC 2026 曼谷
5月27日下午,曼谷香格里拉酒店,DIF Lounge 给你15分钟,把你的实战经验带到全球正在做同样事情的决策者面前。 <详情>
2026-05-08 10:10:36
国内资讯 维谛收购Strategic Thermal Labs,强化液冷系统能力
全球关键数字基础设施及连续性解决方案领导者维谛(Vertiv,NYSE: VRT)近日宣布,已完成对专业液冷技术公司 Strategic Thermal Labs LLC(以下简称“STL”)的收购。通过 <详情>
2026-04-17 10:40:00
国内资讯 算力租赁单笔近30亿、移动集采6208卡昇腾超节点、海光等成国产主力、液冷与变电站成标配……|算力情报局Vol.06
2026年3月至4月中旬,国内算力基础设施建设进入阶段性加速期。中国IDC圈通过对千里马、中国招投标公共服务平台等公开信息梳理发现,期间亿元级以上招标及中标项目至少达41 <详情>