9月21日消息,在2026世界人工智能大会上,华为首次对外展出当前业界最大规模超节点产品——昇腾950超节点真机。

它是华为面向万亿级大模型训练、高并发中心推理打造的液冷AI集群,核心目标是把上千张NPU封装成一台逻辑统一的超级计算机,解决大模型训练时多卡通信延迟瓶颈。

整套超节点以昇腾950DT NPU 芯片作为计算核心,单颗芯片专为大模型训练、解码推理优化,搭载HiZQ 2.0 HBM高带宽内存,单卡HBM容量144GB,带宽4TB/s,支持FP16、BF16、FP8、MXFP4 等多精度AI计算,适配大模型预训练、长上下文推理、MoE 混合专家模型等场景。

架构上采用模块化设计,标准配置为16台计算柜+4台灵衢互联柜,最大支持1024张昇腾950DT NPU,配套256颗鲲鹏950 CPU,最高提供1 EFLOPS FP8算力、2 EFLOPS FP4算力。

依靠自研灵衢2.0全光互联协议,实现跨机柜全光Mesh直连,整套集群总互联带宽1.72PB/s,跨柜往返时延低至3微秒,同时支持256TB全局内存统一编址,上千张NPU可以共享内存空间,不用在多台独立服务器之间来回搬运海量模型数据,大幅降低大模型训练通信损耗。

散热采用全液冷方案,单柜最高支持100kW大功率供电,满足高密度算力持续稳定运行;可靠性层面设计了2+2光路保护,灵衢链路支持闪断自恢复,就算部分链路故障,业务也不会直接中断,满足7*24小时不间断大模型训练需求。

在软件生态上,它依托昇腾CANN全栈软件平台,配套开发工具链,支持模型迁移、分布式训练优化。

传统AI集群里,多台服务器之间数据交换开销巨大,卡数越多,算力利用率越容易下跌,而昇腾超节点的核心创新,就是打破服务器物理边界,让上千颗NPU如同单台设备协同计算,显著提升万亿参数大模型训练效率,适配Agent智能体、超长上下文大模型等高算力需求场景

该产品规划2026年四季度正式上市,未来还可以多套超节点互联,进一步扩展至更大规模算力集群。

1024卡规模当前业界最大!华为发布昇腾950超节点一图看懂

【本文来源:快•科技】