一、案例背景
2026年9月17日,华为全联接大会在上海举行。华为副董事长、轮值董事长汪涛系统阐述了面向智能时代的AI基础设施战略,并集中发布了昇腾960芯片、昇腾960超节点、Hi-ONE NPO光互联、鲲鹏超节点及OceanStor M900等一系列产品与技术进展。
华为将AI战略概括为七个方面:以算力为核心,坚持硬件变现;围绕“超节点+集群”进行系统架构创新;构建开源开放的算力生态;以盘古大模型推动自身产品智能化;通过本地基础设施与云服务提供灵活算力供给;面向端侧提供多样化算力;围绕“用算”构建新一代通信网络。
这一战略的提出有着深刻的产业背景。随着万亿乃至十万亿参数MoE(混合专家)模型的快速迭代,大规模AI集群正迅速扩张。华为判断,10万卡集群已成为训练十万亿级SOTA模型的标配。然而,大规模集群并非简单的服务器数量叠加。华为的仿真数据表明,在传统8卡服务器组成的10万卡集群中,芯片间通信开销可能超过全部训练时间的40%,服务器间通信相比服务器内部会出现数量级的时延增长,严重限制模型浮点算力利用率(MFU)。
正是在这一背景下,华为选择通过超节点架构缩短计算组件之间的通信距离。华为将超节点定义为:多个计算节点通过高效互联紧密连接组成,具备跨物理节点统一内存编址能力,并在逻辑上具备“一台计算机”特征的计算系统。截至目前,昇腾910C超节点已部署超过1000套,昇腾950超节点已实现规模商用。根据华为马尔科夫实验室的仿真结果,由4K规模超节点组成的10万卡集群,相比传统8卡服务器集群,MFU提升2.75倍。
此次发布的昇腾960超节点是业界首个采用NPO(近封装光学)技术的超节点。单个超节点规模达到4096卡,最大提供8E FP8算力,形成高达1PB的HBM容量。在光互联方面,昇腾960超节点使用5500个Hi-ONE,替代传统方案中约4.8万颗800G可插拔光模块,可降低超过550千瓦功耗,系统无故障运行时间提升一倍,系统可用度达到99.8%。按照规划,昇腾960风冷超节点和液冷超节点将分别于2027年第二季度和第三季度上市。
……