
在 WAIC 期间,包括超聚变、中科曙光、中兴通讯等在内的多家服务器厂商都带来了全新的超节点产品,这不是一次普通的产品发布潮。它标志着 AI 算力的竞争逻辑正在从单颗芯片的性能参数,转向整个计算系统的组织效率。
而这其中最令人感到兴奋的是,作为 GPU 芯片厂商的壁仞科技推出了下一代 NPO 光互连、分布式解耦架构超节点方案。据悉,该方案最多支持单个超节点 1024 卡 Scale-up 扩展。
为什么 AIDC 需要超节点?
要理解超节点为什么在 2026 年集中爆发,得先回到一个最基本的事实,随着模型参数越来越大,Agent 应用越来越广泛,单张 GPU 已经不足以支撑企业的 AI 应用了。
对此,壁仞科技 AI 框架架构副总裁丁云帆表示,当前 AI 发展面临主要面临的挑战是,模型参数从千亿迈向数万亿,Agent 等应用场景要求百万级上下文长度,推理和训练都需要成千上万张 GPU 协同工作。仅凭单张 GPU 的算力性能,已难以独立承载这些复杂任务。
这就引出了一个产业共同关注的话题:如何能让大量 GPU 高效协同,像一台超级计算机那样工作。
当前主流的电互连超节点方案正面临规模扩展的物理极限。随着 GPU 算力持续增长,互连带宽需求将超过 1TB/s,端口速率将达到 224Gbps,而铜缆电信号在 3 米内就会严重衰减。现有电互连超节点一般最多支持 128 张 GPU 卡,无论是 Cable Tray 架构的运维难度,还是正交背板架构的扩展瓶颈,都较难满足下一代数万亿参数大模型对数百卡甚至千卡级超节点的需求。
强如英伟达这样的 GPU 绝对领军企业也撞上了同一堵墙。其 GB200 NVL72 机架内,72 颗 GPU 搭配 18 颗 NVSwitch,全部通过铜缆连接,但铜缆传输距离有限,最终限制了单域 Scale-up 的规模上限。2026 年 3 月的 GTC 上,黄仁勋宣布要用光互连把 GPU 系统从 NVL72 扩展到 NVL576(144 张 Rubin Utra GPU,共 576 个 GPU 芯粒 /die)。
这其中的道理并不复杂,电信号在铜缆里跑不了多远,光信号在光纤里能跑几百米。当你要把几百上千张 GPU 连成一个 " 超级计算机 " 时,光的优势是压倒性的。
NPO 是当前最佳选择
在光互连超节点的赛道中,壁仞科技并不是突然出现的玩家。2025 年,壁仞科技就与上海仪电、曦智科技、中兴通讯合作发布了国内首个光互连光交换 GPU 超节点 " 光跃 LightSphere X"。这个基于 dOCS(分布式光交换)的 4 机 32 卡超节点方案,已经部署在上海仪电的国家级算力平台,集群规模达 2048 卡。该项目在 2025 年 WAIC 上获得了最高奖 SAIL 大奖。
而今年进一步升级到 NPO 光互连。当前光互连有四种主要技术路线:传统可插拔光模块(FRO)、线性直驱(LPO)、近封装光学(NPO)和共封装光学(CPO)。传统可插拔光模块有一个叫 DSP 的信号放大器,功耗 5 到 10 瓦,还会带来额外延迟。LPO 把 DSP 去掉了,功耗降低,但信号质量变差,只有能定制交换机和服务器的大厂才玩得转。CPO 把光引擎和 GPU 封装成一个芯片,技术最先进但产业化还太远。
NPO 则是把光引擎直接与 GPU 模组融合,去掉高功耗的 DSP 芯片,传输距离可达数百米,兼具低时延和高带宽密度。"NPO 是在性能、功耗、成本和工程可落地性之间取得最佳平衡的方案 ",丁云帆解释道。
但壁仞科技真正让行业侧目的,不是 NPO 技术本身,而是他们把 NPO 和 " 分布式解耦架构 " 结合在一起的做法。
英伟达 GB200 NVL72 是传统超节点最好的代表,高度定制化的机柜,将 GPU 节点和交换机节点塞在一起,全部通过铜缆连接。国内很多厂商走的也是类似路线。这种方案的麻烦在于机柜是定制的,没法灵活调整;规模受限于机柜物理空间,扩展困难;运维复杂,一根线断了整个柜子可能都得换。
壁仞科技提出的 "NPO 光互连、分布式解耦架构 " 把这件事反过来做。GPU 节点和交换机节点物理分离部署,光纤灵活互连,GPU 节点采用标准机形态。丁云帆打了个比方:这就像 " 从大型机变成小型机 "。以前超节点是一个定制的 " 大铁盒子 ",现在可以像搭乐高一样灵活扩展到 1024 卡。
这个思路的差别很大。对芯片厂商来说,不用为每个客户单独定制一套整机柜方案;对客户来说,可以根据自己的需求灵活选择 16 卡、128 卡还是 1024 卡,不用一上来就买一个 " 大铁盒子 "。壁仞构建了三级超节点产品矩阵:16 卡标准服务器超节点(电互连)、128 卡高密整机柜超节点(电互连)、以及 1024 卡分布式解耦架构超节点(NPO 光互连)。16 卡和 128 卡方案预计 2027 年上半年实现商业化。
在底层,支撑这套方案的是两个核心东西:一是 BR2xx 系列 GPU,沿用壁仞业界首创的 Chiplet(芯粒)架构,把多个计算芯粒像拼积木一样组合成一颗高算力芯片,突破单芯片制造的物理限制;二是自研的 BLink2.0 超节点互连协议,能让最多 1024 张 GPU 共享同一个内存空间,多卡如同一台 " 超级 GPU"。
值得注意的是,丁云帆强调,BLink2.0 具备可编程能力,是开放生态,不依赖封闭生态,超节点交换机支持多种芯片适配。
NPO 光互连超节点还有多远?
虽然壁仞科技将 NPO 光互连超节点解决方案 " 端上桌 " 了,但距离真正的规模商业化还有一定距离。壁仞科技自己给出的时间表是:预计 2027 年 NPO 光互连超节点开始商用落地,届时进入小规模商业化验证阶段;到 2028 年可能实现规模化部署。
放在行业背景下看,这个节奏并不算慢。英伟达的 Rubin Ultra NVL576(同样需要光互连)计划在 2027 下半年推出。国内互联网大厂如腾讯、阿里、字节也都在布局 NPO 光互连超节点,但总体上当前还处于技术攻关和样机开发阶段。换句话说,整个行业的头部玩家都在同一条起跑线上。
但超节点从实验室到数据中心,中间隔着大量工程问题。丁云帆坦言,超节点要做到产业化,最大的问题是稳定性和可靠性。" 这么一个高度复杂的系统,器件太多了,一个链路坏掉,系统还能不能工作?这是非常关键的。"
为此壁仞科技构建了五层的稳定性防护体系,从芯片物理层的自动纠错,到链路层的重传,到链路折叠,到端口隔离,再到软件层的故障容错。" 坏掉一根线,坏掉一个端口,坏掉一个 GPU,这个系统都可以工作。" 丁云帆如是说。
除了可靠性之外,成本也是当前很多企业关注的焦点。丁云帆提到一个公式:用户最终能获得的算力,不是简单地把所有卡的算力加起来,而要乘以软件优化效率。
这也是为什么壁仞科技推出了 "Token 工厂 " 方案。通过五级分层缓存架构实现 95% 以上的缓存命中率,大幅降低重复计算开销。在 Agentic AI 场景中,每次对话都会产生大量 KV Cache,如果每次都重新计算,算力浪费巨大。把缓存命中率做上去,直接省钱。另外壁仞科技首创跨厂商异构混推方案,充分发挥异构算力优势,有效吞吐提升 20%。
而成本、效率的优化也是为什么很多厂商都在密集的布局超节点方案,显然,国产算力的竞争,已经从谁的芯片算力更强转向了谁的集群更有效率。
如果只看单颗芯片,国产芯片受制于制程工艺,与国外顶尖水平至少存在一代的差距。在单卡制程受限的情况下,国内行业正通过超节点这样的系统级创新来弥补差距," 不是单点突破,而是体系化突围 "。
超节点既是技术演进的必然,也是国产算力在制程受限条件下的一条突围路径。至于这条路能不能走通,随着超节点商业化案例的不断涌现,相信在不远的 2027 年产业会给出一个答案。目前至少从 WAIC 2026 的展台来看,光互连超节点已经不再是 PPT 上的概念,而是正在变成真实的、可以触摸的硬件。(本文首发于钛媒体 APP)