拓冰建站拓冰建站
首页 / 资讯中心 / 正文

百万处理器当一台计算机:华为 Peerium 要改的是通信范式,不只是规模

百万处理器当一台计算机华为 Peerium 要改的是通信范式不只是规模TL;DR 速览事件9-17 华为发布面向 AI 时代的Peerium 计算架构官方表述是让百万级处理器成为一台计算机用于满足持续增长的 AI 算力需求三个突破以Nested BSP突破图灵范式、扩展冯·诺依曼单机架构、颠覆长期主从架构技术支点基于嵌套并行、统一内存寻址、平等互联实现百万级强扩展**灵衢UnifiedBus, UB**是关键互联技术一条开放协议总线联接 CPU / NPU / 内存 / SSD / 网卡 / 交换机落地状态要分清首代产品是Atlas 950 超节点25.6 万卡集群已在部署中基于NPO近封装光学的 Atlas 960 系统正在测试中—— 都还不是已上线同日另一条线昇腾 960 芯片将提前至2027 年 Q1发布、官方称性能翻番9 月 17 日华为在上海发布了一个新的计算架构名字叫 Peerium。官方对它的描述是能实现百万级处理器成为一台计算机以满足不断发展的 AI 算力需求。华为轮值董事长徐直军给出的表述是基于 Peerium 架构持续打造满足客户训练和推理需求的超节点和集群。官方稿件里列了三条突破措辞很重突破图灵范式并提出 Nested BSP、突破冯·诺依曼单机架构、颠覆长久以来的主从架构。官方同时公布了实现路径上的三个技术支点——嵌套并行、统一内存寻址、平等互联——以及一个叫灵衢的互联技术。对这类架构级发布比记结论更有用的是拆开看它到底在解决什么物理限制。一、Nested BSP把一次全局同步拆成层级同步BSPBulk Synchronous Parallel整体同步并行是经典的大规模并行计算模型它的结构很简单一个超步由三段组成——各自计算、交换数据、全局屏障同步然后进入下一个超步。它的好处是编程模型清晰、行为可预测。它的代价也来自同一处全局屏障意味着最慢的那个参与者决定整体节奏。参与计算的单元越多等待的方差越大这个模型的扩展性就越差。这正是规模一大就掉效率的根源之一——不是算力不够是同步等待把收益吃掉了。Nested BSP顾名思义是把同步嵌套化同步不再是每次都全局对齐而是分成层级——层内先对齐层间再对齐。这样最慢节点的等待方差不会被无差别地放大到整个系统。这是百万级强扩展能成立的前提因为在这个规模上全局屏障的开销已经无法用多给点算力来抵消。需要说清楚的是嵌套并行本身不是全新的并行计算思想经典并行计算里早有层次化同步的做法。这次的价值在于把它作为百万级处理器的架构基础提出来并且配了对应的互联与内存模型。二、颠覆主从架构针对的是什么成本传统超节点的组织方式是主从master-slaveCPU 或某个主机节点是中心NPU、存储、网卡作为从设备挂在它下面。任何跨设备的访问往往要先经过主机中转。这个结构在小规模时很自然规模一大就暴露两个问题跳数增加延迟随之增加。数据从 A 设备到 B 设备的路径不是直接连线而是要经过中间的调度点。带宽被中心节点限制。中心节点的带宽成为整体带宽的上限堆再多设备也只是让中心更堵。官方用到颠覆这个词对应的就是取消这种中心化路径让计算、存储、网络之间实现平等互联。对上层的影响是跨设备访问和本地访问之间的差距被压缩编程模型才可能从尽量本地化转向不必刻意关心数据在哪。三、统一内存寻址改变的是编程模型这条容易被当成实现细节带过其实它影响最直接。在传统的分层存储模型里存储层级是显式的哪些数据在显存、哪些在主机内存、哪些在远端节点程序必须知道并且要显式搬运。这套模型的成熟表现就是各种offload和prefetch技术——本质上都是在替人工管理数据搬运。统一内存寻址意味着这些层级进入同一个地址空间访问通过地址而不是通过显式的搬运调用完成。对做大规模训练的人来说这减掉的是大量与计算逻辑无关的调度代码。但也要看到它的隐含要求统一寻址必须建立在足够快、足够可靠的互联之上否则地址可达但访问很慢会让性能变得不可预测。所以统一寻址和平等互联这两件事是绑在一起的——这也解释了为什么官方把它们放在同一段里讲。我做技术选型判断时有个习惯凡是架构级宣称先找它对应的物理约束是什么再看它拿什么去换。宣称越大的方案越需要看清被交换掉的是什么。墨衍 里我把这类素材和判断依据一起存档避免过段时间只记得结论、忘了前提。四、灵衢一条协议总线把三种资源接在一起灵衢英文对应 UnifiedBusUB是实现 Peerium 架构的关键互联技术。官方定义是基于一个开放协议、可无限扩展地联接 CPU、NPU、内存、SSD、网卡和交换机的高速总线。有了它可以实现计算、存储和网络的平等互联。三个特点值得单独记一个开放协议是核心表述。官方强调的是单一协议覆盖多类设备而不是为每类设备维护一套专用互联。协议统一的意义在于扩展时不需要为每种新设备重新设计连接方式。可无限扩展是针对规模上限的说法。一个互联方案的扩展性上限通常由拓扑、跳数和协议开销共同决定无限显然是指架构上不设硬性节点数上限而不是工程上真的没有边际成本。把 SSD 和网卡和计算放在同一层。这一点比联接 NPU更值得注意存储和网络不再是挂在外围的设备而是同一互联平面上的对等节点。这与前两节讲的平等互联是同一件事在不同层面的体现。五、落地状态本次公布的两级产品官方给出的产品化路径是清晰的但状态必须分清楚产品状态官方口径Atlas 950 超节点Peerium 首代产品25.6 万卡集群已在部署中Atlas 960 系统基于 NPO近封装光学正在测试中在部署中和已上线是两个不同的状态写选型参考时不能混。同样NPO近封装光学是把光学器件更靠近封装本体的方案主要解决高速信号在长距离传输上的损耗与功耗问题——它是 Atlas 960 的技术标签但系统整体仍在测试阶段。同日还有一条相关但独立的消息华为轮值董事长汪涛表示昇腾 960 芯片将提前至 2027 年 Q1 发布官方称性能翻番。把两条放在一起看架构与芯片是并行推进的两条线芯片决定单点算力互联与同步范式决定这些算力能堆多高、堆上去之后还剩多少效率。六、接下来该观察什么架构级发布最容易被当成愿景看过就算所以给出几个可验证的观察点比记住口号有用第一Nested BSP 的实际效率曲线。关键不是峰值算力而是扩展效率随规模衰减的斜率。如果嵌套同步确实解决了全局屏障问题衰减斜率应该显著优于传统方案——这需要看大规模训练任务上的实测数据而不是 SPEC 类的微基准。第二编程模型的实际改动量。统一内存寻址如果真能减少显式搬运代码那么把现有的大规模训练框架迁移过来需要改多少代码是最实在的验证。第三灵衢生态的开放程度。开放协议的价值取决于有多少第三方设备厂商真的接进来。如果只有自家设备支持那它仍然是一套专有互连。第四25.6 万卡集群的交付进度与稳定性。这个规模的集群稳定性本身就是一个独立难题——单点故障的恢复机制、故障率与有效算力之间的关系都会在真实负载下暴露。对普通开发者的实际意义这些变化短期内不会改变你写代码的方式但会逐步影响你选云和选硬件的逻辑。当堆规模的效率衰减被压平之后可用的算力档位会上一个台阶——那时受影响的是推理成本、长上下文能力以及能不能把更大的模型跑在更小的预算里。这几件事最终都会传导到应用层。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门