百万卡拧成一台计算机:华为 Peerium 改写算力架构规则

2026年9月19日 · zknr

华为 Peerium 计算架构

配图说明:本文封面为 AI 生成图像。

冯·诺依曼的墙

9 月 17 日,华为在上海发布面向 AI 时代的全新计算架构 Peerium,官方表述相当激进:该架构可实现百万级处理器作为一台计算机协同工作,以满足持续增长的 AI 算力需求。首代产品是 Atlas 950 超节点,25.6 万卡的 Atlas 950 超节点集群已在部署中,基于 NPO 的 Atlas 960 系统正在测试。

要理解 Peerium 在挑战什么,得先看旧架构的形状。冯·诺依曼体系结构下,计算机按程序顺序执行,运算器、控制器、存储器、输入与输出各司其职,主从关系贯穿始终。这套体系撑起了过去八十年的通用计算,但 AI 训练的算力需求把单机扩展推到了极限:处理器再多,互联与内存的墙立在那里,百万级处理器在旧范式下无法真正拧成一台机器。

两大支柱怎么理解

华为给 Peerium 配了三层技术底座:嵌套并行、统一内存寻址和平等互联,以此实现百万级处理器的强扩展。范式层面,架构提出了 Nested BSP,即嵌套批量同步并行,把并行计算任务分层递归组织,官方称其突破了传统图灵范式的限制。

互联层面的关键棋子是灵衢。它基于一个开放协议,可无限扩展地联接 CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储与网络的平等互联,颠覆了长久以来的主从架构。值得一提的细节是,华为把论文挂上了 arXiv,DOI 可查。把架构声明放进学术共同体接受检验,这个姿态比口号更值得认真对待。

从架构宣言到货架还有多远

节奏上,华为的排期已经落定:Atlas 950 超节点在部署,Atlas 960 在测试。轮值董事长徐直军的表态也很明确,围绕 Peerium 持续打造满足客户训练和推理需求的超节点和集群,「让算力无处不在,让智能无所不及」。

真正的考验在架构之外:软件栈的迁移成本、上层框架的适配深度、以及真实训练场景里的集群效率。架构创新从来都是最难的层级,而架构发布与规模商用之间,还隔着整个生态的建设周期。

从云端到边缘的扩展谱系

架构的另一半价值在谱系化。公开信息显示,Atlas 900 A3 SuperPoD 的能力可以下沉到一体机形态,以 CloudMatrix 384 的规模在本地机房落地。超节点由此获得了从云端数据中心到边缘一体机的连续扩展谱系,客户按算力规模各取所需。

这种平台化打法还有一个隐性作用:重新定义评价体系。当竞争从单卡性能转向集群效率,比拼的维度就变成了互联带宽、内存寻址和调度范式,而这些正是 Peerium 声明要做重构的部分。

写在最后

AI 算力竞争正在下沉,从堆芯片数量转向改写计算机的形态。Peerium 的分量不在于发布会上说了什么,而在于 25.6 万卡集群跑起来之后,实际效率能不能兑现「百万卡一台计算机」的承诺。这一点值得持续跟踪,也值得所有做算力的人认真读一遍那篇论文。

参考:IT之家《华为开创 Peerium 计算架构:突破传统图灵范式与冯·诺依曼单机架构的限制》报道,本文为基于公开信息的独立评述。

← 返回首页