新浪新闻

十万卡级AI集群的实际运行效能有多高?可靠性如何解决大规模功耗与网络瓶颈?

BigNews 07.10 18:52

十万卡级AI集群的实际运行效能已实现大幅提升,在功耗与网络瓶颈方面取得了系统性突破。

一、实际运行效能关键指标

华为云10万卡集群(昇腾950DT)总算力200EFLOPS,千卡规模吞吐达500万Tokens/s,Token生成时延低于10毫秒。

千亿参数大模型训练周期缩短60%,MoE模型算力利用率(MFU)较行业平均高出15个百分点。

中科曙光scaleX万卡超集群网络效率达85%(传统方案约65%),GPU算力利用率提升30%,IO性能提升20倍。

华为昇腾384超节点单卡推理吞吐达2300 Tokens/s,已超越英伟达H100。

中科曙光scaleFabric在3万卡集群中实测端到端时延0.9微秒,交换机转发时延260纳秒,单子网可扩展至11.4万卡。

二、网络瓶颈解决方案

全栈自研InfiniBand(scaleFabric):采用基于信用的流控机制,从硬件层面杜绝丢包,无需复杂调优即可稳定运行。

华为灵衢2.0全光互联协议:单跳通信时延降至200纳秒,跨机柜卡间往返时延压缩至3微秒。

NPO(近封装光学)技术:将光引擎移到ASIC芯片旁,距离缩至5厘米,功耗直接减半,且通过MSA多源协议实现接口标准化。

国产IB方案组网成本降低40%,功耗下降35%,链路故障恢复时间小于1毫秒。

三、大规模功耗解决方案

液冷散热技术助力PUE低至1.08,远优于行业平均水平。

量子真空声子散热芯片(VPC):热流密度处理能力超500W/cm²(传统均温板5倍),纳秒级消除热点,PUE可压至1.1以下。

摩尔线程“花港”架构能效提升10倍,集成全精度端到端加速,支持10万卡以上规模。

紫光51.2T CPO硅光交换机专为万卡/十万卡集群设计,解决传统网络设备“功耗墙”与“密度墙”。

四、可靠性保障措施

InfiniBand原生信用流控实现“先确认后发送”,十万卡集群连续运行超180天无中断,死锁概率降至零。

动态容错路由技术在毫秒级完成链路切换,恢复时间不随规模扩大增加,3万卡集群日均数十次链路故障未引发训练中断。

国产方案(如scaleFabric)已支撑国家超算互联网郑州核心节点3万卡集群稳定运行超10个月,累计服务超万名用户。

大规模训练中通过Checkpoint机制应对硬件故障,但十万卡级别需进一步优化中断频率(如Meta 1.6万卡集群约每3小时故障一次)。 (以上内容均由AI生成)

加载中...