新浪新闻

全国40个算力集群闲置率超60%,国产芯片为何陷入能跑不愿用的怪圈?

BigNews 07.24 07:42

一、供需结构性错配:通用算力过剩、智能算力短缺并存

市场存在“通用算力相对过剩,智能算力相对短缺”的显著矛盾。

传统行业通用算力需求增速仅15%至20%,部分区域通用算力利用率不足50%。

自动驾驶、生物制药、科学计算等领域对智能算力需求激增,但标准化通用算力服务难以满足定制化需求。

东部核心城市实时性算力本地供给不足,西部数据中心因网络带宽限制难以承载高时效业务,跨区调度未贯通。

二、软件生态断层:CUDA依赖导致国产芯片“可用但不好用”

国产硬件配套的算子库、编译器、运行时优化工具,相较英伟达CUDA生态成熟度差距明显。

即使代码移植到国产平台,因缺乏针对国产芯片指令集的深度优化,实际计算效率仅为国外同级别平台的1.5至3倍。

不同国产芯片厂商各有编程模型和工具链,适配了A厂商的代码在B厂商集群上可能无法运行,重复适配成本高昂。

DeepSeek创始人梁文锋指出,华为昇腾虽能完成主流模型推理,但训练侧产能不足,且单卡性能落后英伟达约两年、需要四张华为卡顶一张英伟达卡。

存量代码迁移成本极高,科研团队积累数十年的代码和商用仿真软件没有原生国产适配版本,手动迁移需数月甚至半年以上。

三、地方盲目建设与同质化竞争

多地积极投建智算中心,但存在分散建设、缺乏差异化定位的问题,同类中心功能高度重叠,导致同质化竞争。

部分地方政府以土地、电价优势吸引算力中心落地,但缺乏产业支撑,实际需求远低于规划算力。例如中部某省规划1200PFLOPS,但当地数字经济企业不足百家,实际需求不足200PFLOPS。

有项目等数年无人使用,建成时技术已落后,属于“建成即落后”。

四、建设逻辑偏差:重建设轻应用、重算力轻实效

许多智算中心仅提供了放置计算主机的物理场地和基础配套设施,未真正构建高效、智能化的算力服务体系。

算力中心并非一次性投入,上架后电费、运维费、折旧费持续消耗现金流,部分千卡规模中心年运营成本超3000万元,上架率却不足50%。

市场重心从模型训练转向推理,已建成智算中心在算力软硬件结构上难以适配新需求。

五、核心数据:闲置程度的具体表征

腾讯云解决方案总经理张晋指出,国内智算中心GPU平均利用率不足30%,部分企业级中心低于10%。

西部千卡规模智算中心上架率不足50%,已上架服务器实际利用率不足30%。

新建国产算力集群在三四线城市平均利用率仅10%至22%,省会城市中型公共集群利用率25%至40%。

中国信通院数据显示,2025年国内智算共算量约38亿卡时,同期用算量仅14亿卡时,用算占比36.8%。

六、破解方向:系统性升级与生态补齐

国内厂商已转向“超节点”集群方案,将数百上千张芯片整合为逻辑整体,提升算力利用率至80%以上。

异算方舟等全栈计算平台开始补齐软件底座,通过代码转换大模型和算法库降低迁移门槛,目标将集群利用率提升至50%以上。

产业链从“铺摊子”转向“上笼子”,国家枢纽节点外原则上不新建大型数据中心,避免区域盲目无序竞争。 (以上内容均由AI生成)

加载中...