新浪新闻

AI推理成本暴降52%,CXL内存池化真能终结天价GPU账单吗?

BigNews 07.26 18:56

CXL内存池化等技术确实能显著降低AI推理成本(如Meta Vistara方案减少25%服务器需求),但无法完全终结天价GPU账单,因为成本下降会刺激需求激增(杰文斯悖论),且高端HBM、训练算力等核心瓶颈仍依赖专用硬件。

一、CXL内存池化的降本逻辑与效果

Meta Vistara方案:通过自研CXL ASIC芯片将旧DDR4内存接入新服务器统一调度,在部分AI推理负载下减少25%物理服务器需求,内存溢出崩溃下降三分之一。

成本牺牲:存在带宽变窄、延迟翻倍的缺陷,但用慢内存承载冷数据,性价比远超直接堆新料。

硬件升级逻辑转变:从整机淘汰转向资源解耦与循环利用,CXL协议推广后有望进一步降低成本。

二、其他并行降本路径

算法与框架优化:DeepSeek DSpark推理框架通过半自回归架构与置信度动态调度,同等配置下生成速度提升60%-85%,算力浪费大幅减少。

硬件软件协同:NVIDIA推理软件优化使DeepSeek V4在Blackwell平台上性能提升5倍,Token成本降至原先约五分之一。

国产替代与端侧推理:国产AI芯片(如昇腾)适配推理场景,端侧推理成本已降至云端的1/30,进一步分流GPU需求。

三、“终结GPU账单”为何难以实现?

杰文斯悖论:AI推理成本两年跌99.7%,但总调用量指数级增长(2030年预计增长24-1000倍),算力需求不降反升。

高端存储刚需:HBM与训练算力仍是稀缺资源,三星、SK海力士等持续倾斜产能,高端存储长协订单锁定数年需求。

GPU用途分化:推理成本下降释放的是冷数据存储与简化计算需求,而复杂推理、训练、前沿模型仍依赖大量高端GPU(如OpenAI优化后仍需数百颗GPU)。

四、实际影响:成本下降≠GPU消亡

短期扰动:部分市场担忧GPU需求减少,但头部云厂商(如Meta、腾讯)仍大规模扩建算力集群。

长期再平衡:算力产业链从“单一堆硬件”转向“软硬协同优化”,HBM/NPU/CXL混合架构成为主流,GPU账单结构改变而非消失。 (以上内容均由AI生成)

加载中...