搜索历史清除全部记录
最多显示8条历史搜索记录噢~
全部
  • 全部
  • 产品管理
  • 新闻资讯
  • 介绍内容
  • 企业网点
  • 常见问题
  • 企业视频
  • 企业图册

机柜式CDU 与机架内 CDU:全面分析 | 2026

2026年05月18日

现代数据中心的技术发展轨迹日益受到热危机的影响,而传统的冷却方法根本无法应对这一危机。随着人工智能 (AI)、高性能计算 (HPC) 和复杂的机器学习集群成为企业和超大规模运营的标配,由此产生的功率密度已经远远超过了 20 kW 至 30 kW 的阈值,而空气冷却在经济和物理上仍然可行。冷却液分配单元 (CDU) 是向液冷散热管理转型过程中的核心,它是一个精密的机械接口,也是液冷生态系统的核心。

 

对于数据中心架构师而言,行内 CDU 架构和机架内 CDU 架构之间的选择是一个关键的决策点,它不仅影响即时的散热性能,还影响长期可扩展性、维护成本和总体拥有成本。

 

 

 

液冷技术的必要性

从空气冷却到液体冷却的转变是由冷却介质的基本物理特性驱动的。空气本身导热性差,体积热容低,需要大量的空气和高速流动才能散发现代700W至1000W处理器产生的热量。相比之下,液体冷却剂的传热效率比空气高出3000倍,从而可以大幅减少管理同等热负荷所需的基础设施。随着机架密度逼近100kW,预计到2027年负荷将达到600kW,冷却分配单元(CDU)将成为将敏感的IT环境与设施级冷却基础设施解耦的关键机制。


冷却分配单元 (CDU) 的主要作用是管理两个独立的冷却回路:设施水系统 (FWS) 和技术冷却系统 (TCS)。FWS 通常是一个覆盖整栋楼的循环回路,将热量输送到外部冷水机组、冷却塔或干式冷却器。TCS 是一个闭环系统,将经过高度控制和处理的冷却液(通常是去离子水和丙二醇 (PG25) 的混合物)直接循环输送到 IT 机架内的热源,例如冷板或浸没式冷却槽。通过保持这种分离,CDU 可以保护高价值的 IT 设备免受设施用水中潜在的污染物、矿物质沉积物和腐蚀性物质的侵害。

 

 

 

架构基础:机架内配置与机柜式配置
机架式CDU和机柜式CDU 的区别在于部署策略以及它们旨在支持的计算集群规模。机架内 CDU 是一种本地化解决方案,通常集成到服务器机柜中;而行内 CDU 则是一个独立的机箱,放置在一排机架中,为多个单元提供服务。


机架式CDU:精度和定位

机架式冷媒分配单元 (CDU) 专为空间有限或需要逐步部署液冷系统的高密度环境而设计。这些单元通常采用标准的 4U 至 10U 机架式安装尺寸,可安装在服务器机架的底部、顶部或侧面。这种靠近 IT 设备的安装方式最大限度地缩短了二次流体回路的长度,从而显著降低了泵的扬程要求,并降低了整个系统中压力下降的风险。

 

机架式冷配电单元 (CDU) 的局部化特性造就了一个独立的故障域。在这种架构中,单个 CDU 的机械故障或泄漏只会影响其所服务的机架,而不会危及整排服务器。这使得机架内解决方案对于边缘计算站点、实验室环境以及需要将数量有限的高密度机架与传统风冷设备共存的传统数据中心而言尤为具有吸引力。此外,机架内系统通常具备“即插即用”的特性,简化了液冷基础设施的部署,无需对设施的集中式管道系统进行大规模改造。

 

 

 

 

机柜式CDU:集中式可扩展性

机柜式冷却分配单元 (CDU) 代表了工业级的热管理方案。这些单元以独立机柜的形式安装在 IT 机架之间或机架末端,旨在支持巨大的热负荷,通常范围在 1 MW 到 2.5 MW 之间。单个行内式 CDU 可为多达 10 个高功率机架提供冷却液分配,作为大型计算单元或整个数据中心机房的集中式枢纽。

 

机柜式CDU的主要优势在于其规模化效率。通过集中冷却基础设施,运营商可以减少所需的冷却单元 (CDU) 总数,从而简化整个设施的监控和维护流程。行内单元不占用服务器机架内宝贵的垂直“U”空间,因此每个机柜可以实现更高的计算密度。然而,这种集中化也带来了更广泛的故障范围;行内单元的故障可能会同时影响多个机架,因此需要在单元级别采用更强大的冗余策略。

规格机架内 CDU(L2L)行内 CDU(L2L)
典型制冷能力15千瓦 – 300千瓦550千瓦 – 2.5兆瓦
外形尺寸4U – 10U 机架式独立式柜体
典型部署单层/边缘集群/行/超大规模
故障域隔离于一个机架一排多个货架
楼层空间影响低(机架内部)高(需要占用行空间)
流体循环管理最短路径广泛的流形网络

 

 

常压蒸馏装置性能指标的技术分析

无论外形尺寸如何,任何常温冷凝器单元 (CDU) 的性能都取决于几个关键的技术参数:热容量、流量、进水温度和压力控制。这些因素决定了该单元将热量从硅片传递到设施水系统中的效率。

 

热容量和传热

热容量(以千瓦 (kW) 或兆瓦 (MW) 为单位)是选择冷散热单元 (CDU) 的最基本指标。工程师必须根据回路中所有组件(包括 CPU、GPU 和高速网络交换机)的最大热设计功耗 (TDP) 来选择合适的 CDU。对于人工智能 (AI) 和高性能计算 (HPC) 集群,热负荷通常高度集中,现代 GPU 需要每千瓦热量每分钟 1.5 至 2 升的流量。

 

常冷装置 (CDU) 内的热传递过程通常由高效板式换热器 (PHE) 完成。换热效率通过“温差”来衡量,温差是指进入 CDU 的设施用水温度与输送至 IT 设备的冷却剂温度之间的差值。温差越小(例如 3°C 至 5°C),表明换热器效率越高,系统可以使用温度更高的设施用水。这种能力对于实施“自然冷却”策略至关重要,在这种策略下,设施可以绕过机械式冷水机组,仅依靠干式冷却器或冷却塔将热量散发到周围环境中,从而显著降低电源使用效率 (PUE)。

 

流量和压力管理:泵送技术是恒流装置 (CDU) 的核心运行机制。为了使冷却剂能够流经冷板复杂的微通道和歧管系统的各种弯管,CDU 必须产生足够的“扬程压力”。例如,伊顿博伊德 ROL4000 等行内式 CDU 可提供高达 80 PSI 的压力,以驱动冷却剂流经高性能冷板回路和跨多个机架的控制阀。精确的流量控制对于维持稳定的运行温度至关重要。


现代冷驱动单元 (CDU) 利用变频驱动器 (VFD) 根据计算负载实时调节泵速。当服务器从空闲状态切换到峰值处理状态时,CDU 会提高流量以应对突发的温度峰值,确保硅芯片保持在规定的“外壳温度”范围内。这种动态响应对于人工智能工作负载尤为重要,因为其负载可以在几毫秒内从 4 MW 飙升至 130 MW。

模型应用容量泵冗余关键技术指标
Supermicro LCS-SCDU-250机架内250千瓦2N / N+1支持45°C温水
Supermicro LCS-SCDU-1K3排1.8兆瓦N+11200 升/分钟流量
DCX HYDRO CDU1机架内150千瓦双冗余回水温度 60°C
DeepCoolAI DCAI-IWL排2.5兆瓦N+1341 加仑/分钟容量
伊顿博伊德 ROL4000排2.0兆瓦N+180 PSI 水头压力
LiquidStack CDU-1MW画廊/排1.35兆瓦N+1总体拥有成本降低 25%。
ACT 机架内机架内15千瓦多变的双相介质

 

 

液液CDU与风液CDU

部署环境通常决定了液液或风液型恒流装置 (CDU) 哪种更为合适。这两种类型代表了最终散热方式的根本不同。


液液CDU
冷却单元是高密度冷却效率的黄金标准。它们需要直接连接到设施的冷冻水系统,通过热交换器将热量从 IT 冷却液传递到设施用水。这种架构提供最高的冷却性能,能够支持超大规模和人工智能环境中功率密度最高的机架。L2L 冷却单元对于实现超低 PUE 至关重要,因为它们能够利用温水进行冷却,这些温水可以重复用于区域供热或其他工业流程。


液冷式灵活型
芯片冷却单元 (CDU),通常被称为“机架式”或“独立式”(机架内安装),通过热交换盘管和风扇系统散发热量。这种配置专为缺乏液冷管道基础设施以支持 L2L 系统的设施而设计。CDU 利用现有的空气冷却基础设施简化了安装并降低了初始成本,但其性能本质上受限于设施空气的热容量。它们有效地将服务器芯片的热负荷传递到机房空气中,而这些空气必须由传统的机房空调 (CRAC) 机组进行处理,非常适合快速部署、混合环境数据中心或边缘站点,在这些场景中,需要液冷式芯片冷却但无法实现全设施范围的管道系统。

 

 

 

冗余和关键任务可靠性

在数据中心环境中,停机造成的损失以每分钟数千美元计算,因此CDU的可靠性至关重要。机架式和行内式CDU均采用多层冗余设计,以确保持续运行。

 

组件级冗余:
高端 CDU 的所有关键运动部件和电子控制器均采用冗余设计。这通常包括:
泵:大多数企业级 CDU 采用 N+1 或 2N 冗余泵架构。在 N+1 系统中,额外的泵保持待机状态或以低速运行,以便在另一台泵发生故障时接管全部负载。

电源(PSU):采用冗余电源的双电源输入可确保一个电路发生故障不会中断冷却系统。

微控制单元(MCU):冗余控制器可防止软件或逻辑故障导致热管理系统关闭。

 

运营连续性和维护

CDU 的设计必须具备“并行维护性”,这意味着技术人员可以在设备满负荷运行时对其进行维护。例如,像 Supermicro 1.8 MW CDU 这样的行内式机组集成了电源自动转换开关 (ATS) 和可热插拔的泵组件,从而确保在维护期间电源和冷却液流量保持正常。同样,过滤系统通常设计有双过滤器旁路,允许在不停止二级循环的情况下清洗或更换过滤器。

 

 

风险缓解:泄漏检测和流体完整性

高价值IT设备附近存在液体会带来一系列独特的风险,主要包括泄漏和液体污染。CDU通过先进的传感技术和严格的过滤措施来降低这些风险。

 

先进的泄漏检测策略
强大的泄漏检测系统是一种多层防御机制。

 

传感电缆:导电传感电缆通常沿服务器机架、歧管连接处和CDU本身下方铺设。当液体渗入电缆的导电线时,系统会精确定位泄漏位置并触发警报。

点式传感器:点式传感器或“传感器块”放置在高风险位置,例如快速断开接头、阀门或冷凝水泵的正下方,即使是微小的滴漏也必须立即检测到。

机械监测:CDU 的内部逻辑会监测压力下降和流量异常。TCS 回路中压力的突然下降可能表明发生了重大破裂,系统将自动关闭隔离阀并停止泵,从而限制冷却剂的释放总量。

 

流体质量和过滤

冷却液回路的完整性对于服务器冷板的使用寿命至关重要。冷却液分配单元 (CDU) 配备高效过滤器(通常为 50 微米),以确保二级回路畅通无阻,避免杂质和污染物进入。操作人员必须仔细平衡过滤精度;虽然更精细的过滤器(例如,<25 微米)可以提供更高的纯度,但它们会增加压降,并可能从冷却液中去除必要的化学添加剂。维持适当的化学平衡,例如丙二醇和缓蚀剂的浓度,对于防止液体冷板微通道内生物滋生和电偶腐蚀至关重要。

 

 

运营整合与机械管理

除了散热性能之外,机架内或机架中 CDU 的成功部署还取决于机架环境的物理管理,特别是电缆和软管的布线。

 

运营整合与机械管理

除了散热性能之外,机架内或机架中 CDU 的成功部署还取决于机架环境的物理管理,特别是电缆和软管的布线。


软管管理和连接

引入液冷歧管和软管会使机架内部空间更加拥挤。妥善管理软管至关重要,以避免阻碍非液冷组件的气流,并防止连接点承受机械应力。

 

通用快速接头 (UQD):业界已开始采用标准化的 UQD 接口,用于歧管和服务器之间的二次回路连接。这些接头设计用于承受数千次的插拔循环,并将流体损失降至最低,从而确保服务器维护的安全高效。

弯曲半径和拉伸载荷:软管的布线必须保持规定的弯曲半径;过度弯曲会导致材料疲劳或限制冷却液流动。夹紧策略必须考虑“软管蠕变”,即材料由于热循环而随时间推移发生松弛,如果固定不当,可能会导致倒钩接口处泄漏。

 

线缆管理最佳实践

高效的线缆管理有助于提高散热效率,确保电源线和数据线不会阻碍风冷组件的排气。在液冷机架中,由于软管和线缆会争夺垂直布线区域的空间,因此这项工作尤其具有挑战性。最佳实践包括:

隔离:电源线和数据线应分别位于机架的两侧,以减少电磁干扰 (EMI) 和信号串扰。

标签和颜色编码:清晰的标签以及对供气管和回气管使用红/蓝颜色编码对于减少技术人员在快速故障排除过程中的错误至关重要。

应力消除:将电缆和软管固定到机架结构上,可以消除敏感连接器和收发器的张力,防止意外断开连接。

 

 

 

经济分析:总拥有成本和投资回报率

虽然液冷架构通常需要比传统风冷系统更高的初始资本投资(Capex),但其长期运营支出(Opex)提供了令人瞩目的投资回报率(ROI)。


资本支出与运营支出动态:
风冷式机房前期建设更简单、成本更低,但随着机架密度超过 20 kW,运营成本会呈指数级增长。液冷系统,无论是机架内冷却还是行内冷却,都能通过以下方式显著降低长期能源成本:

降低风扇功率:与房间式冷却相比,行内冷却可节省 50% 以上的风扇功率消耗。

优化冷水机使用:通过支持更高的设施水温(W3/W4 标准),液体冷却使得高效干式冷却器能够在一年中更长的时间内使用。

最大限度地利用空间:机架内 CDU 可以在相同的物理占地面积内实现更高的计算密度,从而有可能推迟昂贵的设施扩建需求。

指标空气冷却行内液冷机架内液冷
前期成本(资本支出)最低中等偏高单价最高
能源成本(运营成本)密度最高低的在极高密度下最低
风扇节能基线减少超过50%减少超过50%
维护费用低的中等(集中式)高(分布式)
扩展灵活性低的高(集群级别)最高(机架级)

 

 

战略决策矩阵:选择最优架构

机柜式CDU 和机架内 CDU 之间的选择,并非取决于哪一个本质上更优越;而是取决于是否符合具体的运营目标和设施限制。

 

机架式 CDU 的应用案例:

机架式 CDU 是以下情况的首选:

边缘计算和远程节点:空间有限且冷却必须独立运行。异构

数据中心:液冷式 AI 机房必须与传统的风冷式机架并存。

模块化增长:适用于希望随着计算需求的增长而逐架扩展投资的组织。

改造方案:在物理上不可能或成本过高的情况下,增加集中式排级管道。

 

 

机柜式CDU 的应用案例:

机柜式CDU 是以下情况的最佳选择:

超大规模和大规模 AI 集群:其中数千个 GPU 以一致的高密度块部署。

新建数据中心:从零开始设计液态就绪的基础设施,以支持集中式分发。

高效运营:以最大限度地减少管理单元总数和最大限度地实现规模经济为主要目标。

极高密度(每个集群 >300 kW):单个机架单元不足以满足需求,或者会占用过多的内部机架空间。

 

 

技术前沿:两相冷却及其未来发展

随着行业展望 2027 年以及 600 kW 机架的现实,CDU 的下一个发展阶段已经出现:两相液冷。


两相系统的工作原理
与传统的单相系统(冷却剂保持液态)不同,两相冷却系统采用特殊的介电流体,这些流体在热源处沸腾并汽化。这种相变吸收的能量远高于简单的温度升高。产生的蒸汽进入常冷装置 (CDU),在那里冷凝成液体并循环利用。两相常冷装置(例如 ACT 的产品)具有以下几个优点:

较低的泵送功率:与单相水-乙二醇系统相比,汽化潜热允许质量流量大大降低。

均匀的热性能:相变发生在恒定的温度下,确保密集集群中的所有芯片都保持在完全相同的温度。

安全性提升:使用绝缘液体可确保即使发生泄漏,也不会造成电路短路。

 

 

 

 

提示:

链力生产机柜式CDU和机架式CDU,提供风冷和液冷两种散热解决方案。这些产品兼容NVIDIA、AMD和Intel的服务器,包括NVIDIA的GB200/GB300和B200/B300系列,所有产品均通过RoHS、CE和UL认证。

 

 

结论:统筹热能未来

选择机柜式还是机架式冷配单元 (CDU) 是决定现代数据中心弹性、效率和可扩展性的基础性决策。机架式架构能够提供边缘站点、模块化扩展和多样化 IT 环境所需的精准度和局部风险管理。它们提供无与伦比的“按需付费”灵活性,这对于正在经历液冷转型初期阶段的企业极具吸引力。

 

相反,机柜架构能够提供支持当前计算时代所需的庞大人工智能和高性能计算集群所需的原始容量和集中式管理效率。通过利用规模经济和工业级冗余,机柜式CDU使超大规模运营商能够在严格控制PUE和运维复杂性的同时,突破计算密度的极限。

 

随着热负荷持续攀升,冷配液分配单元(CDU)仍将是连接数字世界和物理世界的关键接口。架构师必须超越眼前的冷却需求,从总体拥有成本、风险缓解和未来技术兼容性等角度评估这些系统。无论是在边缘部署单个机架,还是在集中式机房部署兆瓦级集群,掌握冷配电单元架构都是释放高性能计算全部潜能的关键。

 

 

常问问题 :

机架内CDU和机柜式CDU的主要区别是什么?
主要区别在于它们的安装尺寸和结构容量。机柜式CDU是落地式独立单元,设计用于直接放置在服务器机架排内,为多个高密度机架同时提供集中式液冷回路。而机架内CDU则是一个紧凑的模块化机箱,直接集成在单个19英寸服务器机架内,其全部冷却功能专门用于该特定机架的组件。

 

数据中心运营商何时应该选择机架内CDU而非机柜式冷却方案?
当改造传统的风冷机房或选择性地部署独立的高性能计算 (HPC) 和人工智能 (AI) 集群时,机架内CDU是理想之选。由于它完全位于服务器机柜内部,因此无需占用数据中心机房的专用空间。这使得设施管理人员能够在机架层面试点直接芯片冷却架构,而无需对整个行式布局或设施级流体网络进行彻底改造。

 

冷却分配单元 ( CDU) 如何提升人工智能工作负载下数据中心的整体冷却效率?
现代数据中心冷却策略高度依赖冷却分配单元 (CDU) 将辅助技术冷却回路与主设施水系统隔离,从而在应对极端高温的同时保护敏感电子设备。随着人工智能硬件的芯片功率密度不断突破传统空调的极限,CDU 可直接向冷板或后门换热器提供精确的流量、压力和温度控制。这种精准的液体输送方式显著降低了对高能耗冷却器的依赖,从而大幅提升了设施的电源使用效率 (PUE)。


推荐新闻

深圳链力将亮相2026新加坡Tech Week及Data Centre World Asia,聚焦AI高密度数据中心液冷、CDU及下一代散热基础设施,与亚太行业客户共同探索高效、可靠的AI数据中心液冷解决方案。