首页 行业资讯 华为发布Peerium计算架构:百万处理器协同打造AI时代算力新底座

华为发布Peerium计算架构:百万处理器协同打造AI时代算力新底座

2026年9月17日,华为全联接大会2026在上海正式开幕,会上重磅发布了面向AI时代的全新计算架构——Peerium计算架构。这一发布迅速引发行业广泛关注,相关话题"华为突破冯诺依曼单机架构"一度登上科技领域热搜榜。

作为现代计算机沿用数十年的基础框架,冯·诺依曼架构奠定了数字计算的发展逻辑。然而随着AI大模型向十万亿级参数规模持续演进,传统单机架构与集群堆叠模式的算力瓶颈日益凸显。华为此次推出的Peerium架构,从系统底层重构了计算资源的组织方式,为超大规模算力协同提供了全新的技术路径。

Peerium计算架构示意图

突破冯·诺依曼单机架构的底层革新

传统冯·诺依曼架构采用运算器、控制器、存储器、输入输出系统的主从分层设计,程序指令按顺序执行,单台计算机拥有独立的地址空间与运算边界。当算力需求扩展至集群规模时,多台独立设备通过网络互联,跨节点内存访问延迟高、通信开销大,集群规模越大,性能损耗越显著,难以支撑超大规模AI模型的训练与推理需求。

根据华为官方发布的技术信息,Peerium计算架构以嵌套并行、统一内存寻址、全节点平等互联为核心设计理念,突破了传统冯·诺依曼的单机架构边界,可将百万级独立处理器整合为一台性能统一调度的超级计算机,而非多台设备的简单堆叠。

Peerium架构核心思路

在编程范式层面,该架构创新性提出Nested BSP(嵌套批量同步并行)编程模型,通过分层递归的方式组织并行计算任务,适配超大规模算力的协同调度需求,实现了对传统图灵执行范式的延伸。

需要明确的是,这一创新属于系统级架构革新,单颗处理器芯片内部仍遵循冯·诺依曼体系逻辑,其核心价值在于打破了单机的算力边界,让跨芯片、跨节点、跨机架的计算资源像一台完整的计算机一样统一寻址、协同运行,从根源上降低了大规模集群的通信损耗。

灵衢总线与超节点产品矩阵

Peerium架构的落地,核心支撑是华为自研的灵衢(UnifiedBus)高速互联总线。作为基于开放协议打造的高速互联标准,灵衢总线可无限扩展接入CPU、NPU、内存、SSD、网卡、交换机等各类硬件,实现计算、存储与网络资源的平等互联,从硬件层保障百万级节点的高效协同。

根据华为公布的官方技术参数,灵衢互联协议将传统十余种互联协议统一为单一标准,互联带宽从百GB级提升至TB级,单板内单跳通信时延可低至200纳秒,跨柜往返时延压缩至3微秒;跨柜互联设备支持单端口1.6Tbit/s带宽,单机可实现280Tbit/s全光互联,UBG灵衢网络交换机具备1024的超大扇出能力,可支撑百万卡规模的超节点集群。

产品落地方面,Atlas 950超节点是Peerium架构的首代落地产品,基于昇腾950DT NPU打造,采用灵衢2.0全光互联协议,单集群最大可扩展至8192卡,FP8算力可达8 EFLOPS、FP4算力可达16 EFLOPS,互联带宽达16PB/s。

目前25.6万卡规模的Atlas 950超节点集群已启动部署,客户覆盖互联网、运营商、金融、政务、制造等多个行业。同期发布的Atlas 960(昇腾960)超节点,是全球首个搭载NPO近封装光引擎Hi-ONE的超节点产品,采用正交架构与全液冷设计,基于灵衢协议实现内存统一编址,单集群可扩展至4096卡。

重构AI时代算力底座的产业价值

当前AI产业正处于模型规模快速扩张、Agentic AI等新场景爆发的阶段,算力需求呈现指数级增长,传统算力集群的"堆叠式"扩展模式面临通信墙、内存墙、功耗墙等多重瓶颈。Peerium架构与超节点产品的推出,本质上是从计算架构底层提升算力利用效率,为国内AI产业发展提供更坚实的算力底座支撑。

从应用场景的实际收益来看,统一内存寻址与低时延互联特性,能够大幅提升大模型训练中的数据交互效率,降低跨节点调度的性能损耗。在AI推理场景,依托灵衢大带宽构建的超大KVCache缓存池,可将KVCache命中率提升至99%,1M序列长度下NPU吞吐量最高提升2.6倍。在Agent沙箱场景,可实现10万沙箱10秒极速启动,部署密度提升25%,能够很好地适配智能体时代的批量算力调度需求。

在产业生态层面,华为已开放灵衢协议的技术规范,覆盖超节点参考架构、基础硬件标准、开源操作系统组件等内容,产业伙伴可基于规范自研相关产品与组件,共同推动超节点技术的规模化落地。截至目前,华为昇腾系列超节点已服务370多家企业客户,昇腾910C超节点部署超1000套,是国内唯一支撑SOTA模型训练的国产算力平台。

赞助商