AI算力升级背景下的冷却系统效率瓶颈该从哪里突破,技术演进正在寻找中?
液冷技术已成为突破AI算力冷却瓶颈的核心方向,其中冷板式液冷当前最成熟,而浸没式液冷、新材料散热和芯内微流体冷却则代表了更高密度场景的未来演进路径。
一、瓶颈根源:传统风冷触及物理极限
传统风冷散热效率仅约0.024 W/mK,单机柜热密度上限约20kW,而现代AI芯片单机柜功率已突破100kW,英伟达B200单机架可达600kW。
风冷PUE约1.5,液冷可将PUE降至1.1-1.2,能效差距悬殊。
传统风冷在机架密度超过50kW后基本失效,而AI集群普遍进入100-200kW区间,散热已成算力释放的直接瓶颈。
二、液冷技术路线:从冷板式到浸没式
冷板式液冷(间接接触):通过铜/铝冷板紧贴芯片,冷却液循环吸热,改造成本低、兼容性强,单机柜功率密度可达33-50kW。
浸没式液冷:将芯片完全浸入不导电冷却液,支持100kW以上超高密度,节水效果显著,在超算和高端智算中心加速落地。
喷淋式液冷:定向喷洒冷却液至发热点,适用于异构场景,但当前市场占比较小。
截至2026年,国内AI训练场景液冷渗透率已达74%,整体数据中心渗透率约28%,冷板式为主流,浸没式在高端场景放量。
三、新材料突破:金刚石-铜与碲化铋
金刚石-铜复合材料:热导率超过1000 W/m·K,是传统铜材(约400 W/m·K)的2.5倍,可在AI计算节点中提升芯片性能约10%,整体散热效率最高提升80%。
碲化铋微型制冷片(Micro TEC):用于光模块激光器单点精密控温,精度达±0.01℃,是800G/1.6T光模块不可或缺的组件,随着速率提升用量翻倍增长。
冷却液国产替代:巨化股份、新宙邦等填补3M退出后的氟化液市场缺口,国产化率快速提升。
四、芯内微流体与AI精准温控
微软研发的芯内微流体冷却系统,让冷却液直接接触硅芯片表面,结合AI分析芯片热分布,精准引导冷却液流向热点,GPU芯片最高温升降低65%,散热效率达传统冷板的三倍。
曙光数创的相变间接液冷技术,通过优化冷板设计和环保冷媒,降低换热热阻15%,配合智能运维平台实现从人控到智控的升级。
英伟达Rubin平台采用的45℃温水液冷方案,通过干式冷却器实现近乎零水耗,同时将制冷能耗降低约4%每升温。
五、系统级整合:电力-冷却-选址协同
数据中心冷却正与电力系统深度融合:每一瓦特输入电力最终都转化为热量,冷却与配电必须统一设计。
水资源约束成为选址红线:传统蒸发冷却每MW年耗水180-450万加仑,液冷+干冷器方案可减少95%-98%用水,PUE控制在1.15-1.25。
技术演进方向包括废热回收、闭式循环系统和零水冷却,微软闭环系统WUE已达0.27,秦淮数据怀来项目WUE接近0。