新浪新闻

为什么超大规模AI集群的GPU利用率普遍低于行业平均水平?

BigNews 05.06 15:39

超大规模AI集群的GPU利用率普遍低于行业平均水平(如40%-50%),本质是硬件规模扩张速度远超软件调度与基础设施协同能力的极限,导致大量算力在通信等待、任务调度间隙和人为策略中被闲置。

一、核心瓶颈:规模扩大加剧系统性效率衰减

通信墙与数据瓶颈

当GPU数量达数十万级别时,跨服务器数据传输成为关键制约:

高带宽内存(HBM)读写速度、网络传输延迟(微秒级)远落后于GPU计算速度(纳秒级),轻微拥塞即导致整个集群等待数据,形成“通信墙”;

阿里平头哥实测显示,70%的算力浪费源于此。

任务间歇性空转

AI训练并非持续计算:研究人员调整参数、分析结果或处理数据管道时,GPU被迫闲置。集群规模越大,这类碎片化空闲时间累积效应越显著。

人为资源占用策略

为保住所分配的GPU配额,部分团队会重复运行低效训练任务“刷利用率”,避免资源被回收。这种策略进一步拉低真实利用率。

二、软件与架构的成熟度差距

分布式系统优化不足

Meta、谷歌通过多年积累的软件栈优化(如网络协议、任务调度器)将利用率提升至43%-46%,而新兴集群(如xAI)的软件层尚未成熟,难以协调超大规模硬件;

资源调度需覆盖虚拟化分片(如MPS技术)、优先级抢占(如Volcano调度器)、碎片整理等全链路,工程复杂度极高。

传统架构的扩展局限

万卡级集群若沿用松耦合的Scale-Out架构(多服务器网络互联),通信路径长(GPU→CPU→网卡→网络),带宽受制于PCIe和以太网。而Scale-Up超节点(如华为昇腾集群)通过芯片直连将带宽提升至400GB/s以上,延迟降至纳秒级,利用率可达45%-70%。

三、基础设施与负载演进的隐性制约

电力供给追不上算力膨胀

30万卡集群日耗电量超千万度,需匹配特高压输电或核电站级稳定供电,但电网改造周期(3-5年)远慢于GPU迭代速度(18个月);

微软等企业因缺电导致大量GPU无法启用。

智能体AI加剧CPU短板

传统训练任务GPU:CPU配比约1:8,但智能体AI需高频调度工具链,CPU耗时占比超50%,配比需升至1:1或1:2。而先进制程产能被GPU挤占,CPU短缺进一步拖累GPU利用率。

四、行业趋势:从硬件堆砌转向全栈优化

头部企业正通过三类策略破局:

- 架构重构:采用超节点紧耦合设计(如华为)、智能网卡(如阿里磐脉920)缩短数据路径;

- 负载精细化调度:AI预测资源需求+动态超卖(如细粒度vGPU划分),将利用率从50%向90%提升;

- 商业模式创新:算力租赁转向按Token消耗分成,激励真实负载(如协创数据)。


结语:GPU利用率本质是系统协同能力的“温度计”。当行业从训练转向推理(占日均Token调用140万亿+),优化目标正从“绝对算力”转为“单位Token成本”,全栈效率的竞争刚刚开始。 (以上内容均由AI生成)

加载中...