新浪新闻

当存算一体芯片使延迟降75%,算力革命真能兑现‘东方诺言’吗?

BigNews 06.19 18:52

当存算一体芯片使延迟降75%,算力革命兑现“东方诺言”已具备坚实的技术基础与产业共识,但能否全面落地仍取决于软件生态成熟度、存储容量瓶颈及大规模量产能力等关键挑战的攻克进度。

一、技术破局:延迟降75%背后的核心突破

1. 存算一体如何实现延迟骤降

存算一体芯片将计算单元直接集成在存储阵列内,数据无需在处理器与存储器之间频繁搬运,从而彻底消除“存储墙”瓶颈。传统冯·诺依曼架构数据搬运功耗占总功耗的60%-80%,而存算一体架构可降低数据搬运功耗至10%以下。在AI推理场景中,首Token响应时延可降低90%,硬件写延迟低至5微秒。

2. 多维能效跃升

清华大学忆阻器芯片:全球首颗全系统集成、支持片上学习的忆阻器存算一体芯片,能效较先进ASIC系统提升75倍,相同任务下能耗仅为其3%。

华中科技大学MRAM芯片:功耗仅0.1瓦,相同能耗下计算量多1000倍,相同计算量能耗少1000倍。

北京大学RRAM芯片:计算速度提升约12倍,能效比提升超过228倍。 清华大学重磅消息:全球首颗!忆阻器芯片领域取得重大突破

3. 中国技术路线全景

中国存算一体企业已形成数字存算一体与模拟存算一体两大流派,覆盖SRAM、DRAM、Flash、ReRAM、MRAM等多种存储介质,布局从大算力数据中心到端侧AI的全场景。

二、算力革命的“东方诺言”有何依据

1. 国家战略与政策驱动

湖北正打造世界级存算一体化产业基地,争创世界存储之都,已建成超15000P算力,智算比例超七成。

工信部发布AI+通信三年规划,明确2028年城域算力1毫秒时延圈覆盖率≥75%。

“十五五”规划纲要明确推动存算一体、三维集成等技术突破应用。

2. 产业生态加速成型

清华、北大、华中科大等高校持续产出全球领先成果,形成从器件到系统的完整技术闭环。

后摩智能、亿铸科技、芯方舟等企业进入量产或流片阶段,产品覆盖智驾芯片、大算力推理芯片、带算力的标准内存条。

长三角下一代新算力与存储芯片中试示范基地在绍兴破土动工,打通实验室到量产关键环节。

华为启动第六届奥林帕斯奖,聚焦存算一体新范式。

3. 市场规模高速增长

2025年全球存算一体芯片市场规模预计突破120亿美元,中国占比达30%;国内市场规模预计2025年达125亿元,2030年达1136亿元。

三、兑现之路:仍需跨越的关键挑战

1. 存储容量瓶颈

SRAM单颗存储容量仅几百兆字节,MRAM更小,部署70B参数大模型时,多芯片拼接导致成本反超GPU达10-15倍,无法形成成本优势。

2. 软件生态短板

存算一体软件栈仍处于实验室阶段,缺乏成熟的编译器、编程模型和标准化接口。英伟达CUDA生态拥有500万+开发者、4万家公司,从CUDA迁移成本高、适配周期长。

3. 模拟计算精度难题

模拟存算一体受电路噪声、温度变化和工艺偏差干扰,高精度RRAM芯片需将误差控制在0.155%以内,实际制造难度极大。

4. 量产一致性与良率

新型存储器ReRAM、MRAM依赖特殊材料和定制产线,材料成本占比超过40%。

HBM通过3D堆叠实现近存计算,封装成本占芯片总成本30%以上,良率要求超过98%。

5. 巨头生态护城河

英伟达垄断全球高端AI训练芯片市场超90%份额,其“硬件领先+CUDA生态垄断+全栈方案赋能”三重壁垒,使存算一体企业面临强大的生态竞争压力。

四、理性预期:特长生取代全能选手

存算一体芯片的理性发展路径并非全面替代GPU,而是作为特定场景的协处理器:

在边缘计算、智能驾驶、可穿戴设备等低功耗、低延迟场景,存算一体优势不可替代。

在端侧大模型推理场景,存算一体芯片可本地运行7B/13B模型,实现隐私保护与零延迟响应。

通过3D堆叠将算力卸载到标准内存条,存量数据中心仅需更换内存即可获得AI推理能力,降低80%以上硬件成本。

中美国产存算一体芯片研发进度差距不大,预计2026-2027年前后脚落地,时间差不超过半年。 (以上内容均由AI生成)

加载中...