自2023年起,人工智能产业高速发展,智算中心(AIDC)建设迎来爆发期。AI算力高负载、低延迟、高密度的运行特性,彻底改变了传统数据中心的散热逻辑,对液冷CDU(cooling distribution unit)产品提出了更高要求。
一方面,AI芯片功耗持续攀升,叠加智算业务对低延迟的刚性需求,单机柜功率密度跨越式增长,从48kW/Rack快速升级至120kW/Rack,再从120kW/Rack迭代至240kW/Rack。高密度算力场景直接推动CDU向超大冷量方向迭代,2MW及以上大冷量CDU成为高密智算中心的标配设备。
另一方面,智算场景对系统可靠性、控制稳定性、工质洁净度提出全方位升级要求。首先,智算业务连续性要求极高,NVIDIA最新规范明确:水泵故障切换时间需<5s,切换后30s内流量、压力波动≤±5%,温度波动≤±2℃,且电源、水泵、核心传感器等关键器件必须全面冗余配置。其次,AI推理运算负载波动极强,瞬时负载区间可达25%~150%,对CDU动态温控、稳压调流能力提出极大考验。此外,高功率AI芯片普遍采用微通道细密冷板结构,极易被微小杂质堵塞,系统过滤精度由此从50µm/100µm升级至25µm,对液冷系统洁净度管控提出全新挑战。
作为冷板式液冷二次侧的换热与循环中枢,CDU主要承担两大核心作用:为二次侧冷却工质提供循环动力与精准换热冷却能力;对整个二次侧液冷系统实现集中监测与智能调控。面对智算行业的全新场景需求,CDU升级不再是简单的冷量扩容,而是围绕高可靠、高稳定、高精度、高洁净的系统性技术革新。中兴通讯致力于为客户提供完整的智算解决方案,CDU产品通过架构优化、冗余升级、算法迭代、精细化水质管控,全面适配超高密度智算散热场景。
全维度冗余设计,保障业务连续运行
为适配智算中心不间断运行需求,方案采用冗余架构设计,实现任意单点故障不影响核心制冷功能。供电系统设计上,沿用成熟的2N冗余架构,双路电源无缝切换,杜绝供电中断风险。核心部件层面,水泵、过滤器采用N+1冗余配置,单个部件故障不影响整机制冷性能。传感器配置上,将传统1+1传感器冗余升级为2+1冗余架构,可精准甄别异常漂移数据,大幅提升监测可信度。同时新增温湿度、液位传感器冗余配置,为防凝露控制、高低液位告警等关键防护功能增加硬件冗余。控制系统设计上,采用“稳态可控、故障保持”的设计理念,CDU虽只配置了一套控制器,但即使控制器故障或控制信号中断,水泵、电动阀等核心部件仍可保持原状态运行,避免控制失效引发的系统停机,全方位保障算力业务连续稳定。
多泵并联架构,实现参数精确稳定控制
温度、压力、流量的动态稳定控制,是衡量CDU产品核心性能的关键指标。常规稳态工况下,主流CDU产品均可实现较高控制精度(温度波动≤±0.5℃、压力波动≤±0.05bar)。但在水泵故障、机组故障切换等突发工况下,系统参数会出现剧烈波动,这也是长期困扰行业的技术难题。为破解这一痛点,本方案创新性采用多泵并联架构,摒弃传统单泵驱动模式,通过多台小功率水泵并联协同实现系统额定制冷能力,同时,遵循N≥2的水泵N+1冗余配置。该架构最大优势在于容错能力极强,单台水泵突发故障退出运行时,对系统总流量、压力的冲击极小;搭配调优的PID(Proportional-Integral-Derivative)控制逻辑,可有效抑制切换过程中的参数波动,满足智算场景严苛的稳定性要求。
与此同时,多泵并联设计具备加减载响应速度快的特点,可满足负载快速变化的需求。系统设计上配合缓冲罐,可有效抑制推理场景25%~150%的瞬时负载剧烈波动对系统温度的影响,实现温度精确、稳定控制。从工程角度来看,该架构设计存在一定取舍,多泵并联可提升部分负载工况下运行效率,但在满载工况下多泵并联会产生轻微的水力损耗,导致机组运行效率略有下降,但综合故障容错、动态调控等优点,多泵并联架构的优势远大于劣势,是适配高密智算场景的最优工程方案。多泵并联架构CDU结构示意见图1。

精细化水质管控,守护系统长效运行
高密微通道冷板对冷却液洁净度、水质稳定性高度敏感,水质管控已成为智算液冷系统长效稳定运行的核心关键。针对25μm超高过滤精度要求,考虑与多泵并联架构适配,本方案采用多组过滤器并联的设计,在实现高精度过滤的同时,提升滤芯过流面积,降低系统流阻,兼顾过滤性能与设备能效,同时优化设备内部空间结构。
在水质智能运维层面,新一代CDU标配多种水质监测传感器,可实现电导率、PH值、浊度等关键指标的实时监测,直观反映系统腐蚀、脏堵风险以及工质寿命,有效降低金属材料腐蚀、工质劣化、细菌滋生等问题的风险,全方位保障高密智算液冷系统长期高效、安全、稳定运行。
中兴通讯高密智算CDU解决方案,通过全维度冗余防护、多泵并联精准控参、智能化水质管控三大核心设计对传统CDU进行了全面升级,彻底解决高密度算力场景下功耗高、负载波动大、洁净度要求高、可靠性要求高等行业痛点。方案全面保障算力业务不间断运行,降低设备故障率与运维成本,支撑超高密智算集群规模化高效部署,显著提升智算中心运行容错能力与综合效益。