
作者 | 陈骏达
编辑 | 漠影
AI 大模型竞赛,正在进入新的量级。海外,十万亿参数的大模型已经逐步变成现实;国内,数万亿参数的大模型也在加速追赶。为了训出真正的 SOTA 模型,算力集群从万卡走向 10 万卡已成为标配。
然而,一个尴尬的现实是:卡越堆越多,真正被利用起来的算力,却没有同步增长。华为的仿真数据显示,在 10 万卡集群中,卡间通信可能消耗了 40% 以上的训练时间,算力利用率(MFU)往往不到 30%。也就是说,大量昂贵的算力,并没有真正用于计算。
对于训练周期以月计算的前沿大模型而言,MFU 每提升几个百分点,都可能意味着数天的训练时间差,以及数千万元甚至上亿元的算力成本变化。
为解决这一挑战,有越来越多的厂商把目光投向一种新的算力组织方式——超节点。与传统集群把计算卡分散在大量服务器中不同,超节点试图通过更紧密的互联、统一的内存空间和更低的通信时延,把数千张卡组织成一个逻辑上的整体。
日前发布的昇腾 960 超节点,正是这样一套面向 10 万卡时代的超节点工程化方案。

从去年开始," 超节点 " 成为 AI 算力领域热度快速攀升的概念。华为昇腾 910C 超节点等方案率先引发行业讨论,此后,国内算力、服务器等厂商也相继推出相关产品。一时间,超节点几乎成了新一代 AI 算力基础设施的代名词。
在上周的 HC2026 大会上,华为副董事长、轮值董事长汪涛更是判断,随着大模型迈向 10T 级参数规模,超节点是 AI 基础设施建设的必然选择。

2026 年 7 月,在世界人工智能大会(WAIC)期间,《超节点定义与实践白皮书》正式发布。这份白皮书由鹏城实验室与全球计算联盟(GCC)联合牵头,38 家单位共同参与制定,从行业层面对超节点进行了明确界定。

以 MoE 等主流模型为例,随着参与计算的计算单元数量不断增加,模型中间结果需要在大量单元间频繁交换。集群规模越大,通信和同步带来的开销也越明显。
此时,如果计算单元然只是分散在不同服务器中,通过网络进行数据交换,那么计算卡数量增加,并不意味着有效算力能够等比例提升。
换句话说,超节点真正改变的,并不是简单地把 8 卡服务器扩展到 64 卡、1024 卡甚至 4096 卡,而是重新组织计算单元间的连接与协作方式,让分散的计算资源在硬件和软件层面更像 " 一台机器 "。
在符合这一架构的系统中,超节点内的算力单元以访问统一的内存共享池,并通过全局地址空间实现跨物理节点访问。相比之下,传统集群中的数据往往需要依赖网络协议,在不同节点之间进行传输。
华为马尔科夫实验室的仿真结果显示,在同样为 10 万卡的集群中,由 4000 卡超节点组成的系统,MFU 可达到传统 8 卡服务器集群的 2.75 倍。
而符合白皮书所定义架构的产品,已经开始进入规模化应用阶段。截至目前,昇腾 910C 超节点已部署超过 1000 套,昇腾 950 超节点也进入规模商用阶段,应用覆盖互联网、运营商、金融、教育、医疗等多个行业。

二、把光引擎,搬到算力身边
目前,大规模 AI 集群内部主要依赖铜缆进行电互联,随着 SerDes 速率达到 224G 及以上,传统电互联方案开始面临越来越大的压力。
速率越高,铜缆中的各类损耗就越明显,信号传输距离也越来越受限;而当数千根高速铜缆被集中在一个高密度系统中,布线、散热和维护也会变得更加复杂。
于是,行业开始把目光投向 " 光 "。在此之前,数据中心的光互连长期依赖传统可插拔光模块方案:光模块作为一个独立器件,插在交换设备或计算节点的面板上,信号先沿电路板走线传送到模块接口,再在模块内完成电光转换、进入光纤。

可插拔设计的好处在于标准化与可维护,模块坏了可以单独更换,这也是它统治数据中心互联二十余年的原因。但可插拔方案也有一个先天弱点:电信号从计算单元到模块,需要经过一段漫长的电路板路径,随着速率的提升,这段电走线带来的问题变得难以忍受。
NPO(Near-Packaged Optics,近封装光学)试图改变这一过程。它的思路很直接:把光引擎放到计算单元边缘,让电信号尽早转换成光信号。
原本需要通过较长距离电连接传输的信号,在距离计算卡更近的位置完成光电转换,再通过光纤完成更远距离的高速传输。
对于超节点而言,这意味着可以在更高带宽下缩短电连接距离,同时降低互联功耗和时延,并缓解高密度系统中的布线与散热压力。
华为 Hi-ONE,就是这一路线的一次工程化尝试。汪涛称,这是业界首个量产的 NPO 产品,是目前行业最大传输能力的 NPO 产品,也是唯一实现内置光源的 NPO 产品。

对于拥有数千个计算单元的超节点而言,互联器件本身就是系统复杂度的重要组成部分。如果可以把互联器件的数量,布线复杂度、功耗和潜在故障点也会随之减少。
现阶段,NPO 技术面临的痛点之一是标准缺位:光引擎贴近计算单元后,封装形式、接口规格、光源方案均无统一约定,各厂商方案互不兼容,产业链难以分工放量,成本居高不下。
在产业标准层面,华为在全球光互联标准组织 OIF 提出了 NPO 标准立项的建议,得到了众多行业伙伴的积极响应,其参与推动的《12.8Tb/s 光电近封装模块》标准提案已在 OIF 立项,未来有望形成 6.4T/12.8T 近封装光学模块的行业标准。
三、昇腾 960 超节点拆解:4096 卡如何像一台计算机工作
如果说超节点定义回答了 " 什么是一台机器 ",NPO 解决了 " 机器内部怎么通信 ",那么昇腾 960 超节点要回答的,就是这两件事能否真正组合成一个大规模计算系统。
昇腾 960 超节点基于 " 灵衢 +Hi-ONE" 打造,采用正交架构和全液冷设计,并通过灵衢实现内存统一编址,将 4096 颗算力卡在逻辑上融合成一台 " 超级计算机 "。

同时,昇腾 960 超节点的正交架构让计算板与交换板垂直正交、直接互联,这种设计让板间互连路径大幅缩短,损耗更低、信号完整性更好,再叠加全液冷设计,使 4096 卡这样的高密度部署成为可能。
从规模来看,昇腾 960 超节点最多可扩展至 4096 卡,提供 8EFLOPS FP8、16EFLOPS FP4 算力,以及最高 1PB 的 HBM 容量,RTT 时延最低可达 2 微秒。相比上一代昇腾 950 超节点的 1024 卡规模,昇腾 960 将单个超节点的计算卡规模提升至 4 倍。
大模型训练时,模型权重、梯度、优化器状态及中间激活值均需加载至显存。昇腾 960 超节点的这些参数,意味着单个超节点能容纳的模型体量直接上了一个台阶,跨节点切分带来的通信开销有望大幅下降。
按照公开数据,昇腾 960 超节点系统功耗降低超过 550 千瓦,系统可用度达到 99.8%,系统无故障运行时间提升 1 倍。对于运行十万卡级集群的企业来说,这些指标最终都会转化为自身业务效率的提升。
到这里,超节点 Scale Up 的问题暂时得到了解答:4096 张计算卡,可以被组织成一个逻辑上的整体。但更大规模的 AI 集群显然不可能只靠一台 4096 卡超级计算机完成,新的问题又来了。
四、4096 卡之后,怎么把 " 超级计算机 " 连起来?
有了 4096 卡超节点,更大规模的集群要解决的是 Scale Out 问题——也就是节点之间的互联。跨过这一步,10 万卡集群才能真正成为现实。

基于灵衢,多个昇腾 960 超节点可以通过灵衢网络或 RoCE 连接在一起,进一步构建超节点集群。通过二层 CLOS 四平面组网,灵衢支持的最大集群规模可达到51.2 万卡;再结合多轨道拓扑技术,最大可支持100 万卡昇腾超节点集群。
但超节点集群的挑战不止于 " 连得更多 "。更大规模的 AI 算力集群,不是某一种算力单元的独角戏,NPU 之外,CPU、内存、存储同样重要。而传统体系里,这些资源各自采用不同的互联协议,规模越大,协议转换与跨节点通信的开销就越突出。
正因如此,灵衢试图进一步打破不同计算资源之间的边界:在这一体系下,昇腾超节点、鲲鹏超节点、KV 缓存集群等不同子系统平等互联,CPU、NPU、内存和存储不再是彼此独立的资源,而是通过统一协议进行通信和协同。
这一需求,在 AI 进入 Agent 时代后变得更加迫切。一个 Agent 在运行中,可能同时需要调用模型、启动沙箱、访问数据库、进行向量检索,在 CPU、NPU、内存和存储之间不断交换数据。
因此,通算与智算的融合,成为超节点向更大规模基础设施演进的另一个方向。全新升级的鲲鹏超节点基于灵衢全光组网,最大支持 4096 节点,形成 256TB 统一内存池;在 Agent 场景中,十万级别沙箱启动相比传统服务器方案提升 30 倍,百亿千维复杂向量检索效率实现倍增。

结语:10 万卡之后,AI 基础设施进入 " 系统工程 " 时代
回到文章开头的问题:为什么 10 万张卡,没有 10 万张卡的算力?
因为当计算规模不断扩大,真正限制有效算力的,已经不只是计算卡本身。数据移动、结果同步、通信、系统散热、故障恢复,集群运转的每一个环节都在影响计算,而其中任何一个环节掉队,都会拖累整台 " 机器 " 的效率。
在 HC2026 大会上,汪涛反复强调,如今的 AI 基础设施竞争已进展到复杂的、多学科的系统工程阶段。在这场较量中,华为 " 计算 + 通信 " 的综合优势得到集中体现:从 NPU 到超节点,从光引擎到统一互联协议,每一层都指向同一个目标,让算力真正被用起来。