关于ZAKER Skills 合作
经济观察报 53分钟前

国产超节点商业化大幕拉开

经济观察报记者 郑晨烨

在 7 月 17 日至 20 日举行的 2026 世界人工智能大会(WAIC)上,超节点成为全场焦点。据记者不完全梳理,超过 20 家企业发布了与超节点相关的产品或方案。

早在 2025 年 9 月的华为全联接大会上,昇腾 Atlas950 超节点首次发布,但当时外界只看到了产品参数和渲染图,真机并未露面。此后近一年,950 超节点的实际性能表现、量产进度是否如期推进等,一直是关注国产算力的投资人和产业人士追问的焦点。

" 贵百分之一百无所谓,贵百分之两百都无所谓。"

今年 7 月,一份 DeepSeek 创始人梁文锋在两个月前举办的投资者交流会上发言的录音文字稿开始在投资圈流传。在这份近四小时的交流记录中,梁文锋谈到华为超节点与英伟达产品的价格差距时作出了上述表态。

梁文锋还就 DeepSeek 的开源策略、AGI(通用人工智能)技术路线图、API(应用程序接口,外部用户调用 AI 模型能力的技术通道)定价逻辑以及中美算力差距和国产芯片替代前景等话题发表了看法,其中关于国产算力的评价在网络上引发了广泛讨论。

一位接近 DeepSeek 投资方的知情人士向经济观察报记者确认了该文字稿的真实性。7 月 24 日,记者亦通过电话和邮件的方式就这份录音文字稿的真实性向 DeepSeek 方面进行求证,但截至发稿未获回应。

按照梁文锋的说法,华为 950 超节点在任务层面可以平替英伟达 GB200NVL72 等同类超节点系统,所有后者能做的任务前者都能做,时延表现一致,代价是 4 张华为卡的算力约相当于 1 张英伟达卡,在芯片迭代节奏上落后约两年。

超节点是近年国产算力领域最受关注的产品方向。它通过专用高速总线将数十颗乃至数千颗、数万颗 AI 芯片连成紧密协同的计算系统,芯片之间的通信带宽可达每秒数百 GB 乃至 TB 级、时延低至纳秒级别,使得整柜甚至多柜机器在软件层面表现得如同一台超级计算机。和传统的服务器集群用网线把多台机器连起来相比,超节点内部芯片之间的通信速度接近芯片内部水平,使众多张卡可像一张卡一样协同工作。

随着大模型参数从千亿走向万亿乃至十万亿,传统 8 卡服务器(一台机器装 8 颗 AI 芯片)已无法满足训练和推理的通信需求,超节点成为各家算力厂商的必选项。

从华为已商用超过 750 套的昇腾 384 超节点,到今年第四季度计划上市的 Atlas950(最大可支持 8192 卡满配),再到中科曙光刚刚落成的十万卡曙光 8000 超集群,国产厂商已经回答了顶尖算力产品有没有国产替代方案的问题。

梁文锋作为国内头部大模型公司创始人公开给出 " 可以平替 " 的评价,也在一定程度上打消了市场对国产超节点实际可用性的疑虑。但国产超节点的商业模式怎么落地,这个问题才刚刚浮出水面。

此前超节点几乎都以整柜硬件的形式交付给客户,一套系统少则数千万元、多则数亿元,客户需要自己建机房、自己运维,只有大型互联网企业、电信运营商和国家级智算中心才部署得起。

但这个局面正在改变。7 月 23 日,阿里云宣布灵骏真武 M890 超节点云上算力单元成功适配 2.4 万亿参数的 Qwen3.8 模型,并上线百炼平台提供推理服务。

由此,M890 成为国内首个在公共云(面向所有用户开放、按需付费的云计算平台,区别于企业自建的私有云)上稳定运行超两万亿参数大模型的超节点产品。用户不用自己购买硬件,在阿里云控制台申请一个 64 卡全互联的云上算力单元,按小时付费,每小时 120 元,用完即释放。

同一时期,中科曙光(603019.SH)自己运营的十万卡集群接入国家超算互联网按使用量向全国用户收费;华为云宣布从卖云服务器全面转向按词元(Token)计费。

记者在采访过程中了解到,国产超节点的技术可行性在过去两年间基本得到了验证,而商业模式的分化才刚刚开始,超节点的交付方式正在从单一的整柜硬件销售裂变为多条路径——卖整柜、卖算力、卖词元,不同体量的客户开始有了不同的选择。

从 " 造出来 " 到 " 用起来 "

WAIC 期间,昇腾 Atlas950 超节点这款备受期待的产品终于以真机形态首次展出,成为全场关注度最高的展品之一。

记者从华为相关负责人处了解到,现场展出的 1024 卡版本以单柜 64 卡为基本单元,可提供 1EFLOPS(每秒百亿亿次浮点运算)的 FP8(一种 AI 计算常用的低精度数据格式)算力,配备 256TB 全局统一内存,芯片之间的往返通信时延低至 3 微秒。华为还为这套系统自研了名为灵衢 2.0 的互联协议,把跨卡通信时延从传统网络的 2 微秒级降至 200 纳秒级,相当于让上千张卡用同一种 " 语言 " 实时对话。另外,满配 8192 卡的版本计划今年四季度批量上市,华为相关负责人称已有多家头部客户完成锁单。

根据华为相关负责人的介绍,昇腾 384 超节点是目前国内唯一训练出 SOTA(当前最优)模型的超节点,目前已在全球商用超过 750 套,覆盖互联网、运营商、金融、教育、医疗等行业。

华为还同期展出了 Atlas850E 风冷超节点,采用自研 VCE(蒸汽腔均热)相变散热技术,可在标准风冷机房里直接部署,无需液冷改造,主要面向推理场景,为没有液冷条件的企业降低了部署门槛。

中科曙光要验证的是另一个维度的问题——当国产芯片的规模从千卡扩展到十万卡,系统还能不能长期稳定运行?

7 月 10 日,曙光 8000(登峰)十万卡超集群在郑州落成运行,同步接入国家超算互联网,成为中国首个全国产十万卡 AI 超集群。这套系统搭载海光信息(688041.SH)的 DCU 芯片,配合曙光自研的高速互连网络。

中科曙光高端计算总工程师卜景德告诉经济观察报记者,从万卡到十万卡不是简单增加机器,十万卡系统瞬间启动时对电网的功耗冲击远超万卡,整个系统有 30 亿个部件,任何一个微小的波动都会影响全局稳定性,网络故障恢复必须做到秒级。

散热同样是工程难题。中科曙光副总裁曹振南介绍,曙光 8000 采用三层循环冷却方案,最内层用特殊液体蒸发带走芯片热量,最外层直接接入郑州当地湖水进行自然散热,整套主机系统不需要传统空调,PUE(一种衡量数据中心能源利用效率的指标,数值越接近 1 说明能源浪费越少)控制在极低水平。

根据中科曙光方面的介绍,上线首周,曙光 8000 即满负载运行,日均处理作业超过 15 万个,峰值突破 50 万个。如果将这些算力全部用于大模型推理,可以同时支撑超过百万人向 AI 提问,并实时获得回复。

在接受记者采访时,中国计算机学会(CCF)高性能计算专委会秘书长谭光明亦提到,曙光 8000 对 AIforSci-ence(用 AI 做科学研究)的价值尤为突出,它为国内的超智融合研究提供了一个此前不具备的大规模真实验证平台。

在华为和曙光两家头部厂商之外,超节点的热度在整个产业链上蔓延。根据记者的不完全统计,本届 WAIC 上超过 20 家企业发布了超节点相关方案。

比如,中兴通讯(000063.SZ)联合壁仞科技、沐曦股份(688802.SH)、燧原科技、天数智芯等多家国产 GPU 厂商推出了支持多芯片混插的 Matrix 超节点;紫光股份(000938.SZ)旗下新华三(主营企业级 IT 基础设施)发布了可从 32 卡灵活扩展至 16384 卡的 UniPoDS80000 系列;沐曦股份则发布了以 64 卡为基本规格的曦景 S600。

综合以上情况可以发现,围绕超节点有三条技术路线正在形成:以华为为代表的全栈自研路线,从芯片到互联协议到软件栈全部基于华为自研;以中兴、新华三为代表的兼容路线,支持多家厂商的 GPU 混插部署;沐曦、燧原等芯片厂商联合整机厂走的联合创新路线。

不只是硬件在推进,软件生态的验证也在同步展开。

摩尔线程(688795.SH)创始人张建中在 WAIC 分论坛上提出了 " 词元时代 " 的概念框架,并将算力基础设施划分为模型训练工厂、词元生产工厂和智能体生产工厂三类。

根据张建中的介绍,摩尔线程已在基于自研 GPU 芯片 MTTS5000 搭建的万卡集群上,从零开始完成了一个 2360 亿参数 MoE(混合专家,一种让大模型只激活部分参数来提升效率的架构)模型的完整训练,训练质量可对标国际主流水平。

这亦是国产 GPU 厂商首次公开展示如此规模的模型训练实践成果,一定程度上回应了市场对国产芯片能否训出大模型的疑虑。

在本届 WAIC 期间,鹏城实验室和全球计算联盟联合发布《超节点定义与实践白皮书》,首次给出了超节点的正式定义,即物理上由多个计算节点通过高效互联协议紧密连接组成,具备跨物理节点的统一内存编址能力,逻辑上具备 " 一台计算机 " 特征的计算系统。

白皮书同时明确了超节点的三大核心技术特征,分别是内存语义互联、统一内存编址、超低时延超大带宽。其中," 统一内存编址 " 被视为判断一个系统是否属于真正超节点的关键门槛——只有所有芯片能像共享同一块内存一样读写数据,才能消除芯片间的通信瓶颈,否则系统规模再大,计算效率也上不去。白皮书提出,未来两到三年,全球 AI 基础设施竞争的主线将从单颗芯片的性能比拼升级为系统级工程能力的竞争。

梁文锋对国产超节点生态的看法比行业共识更为积极。在前述投资者交流会上,他表示,DeepSeek 训练 V3 模型时已几乎不依赖英伟达的软件生态,而是基于自研的 TileLang 高级编译器完成了全部工作。

在他看来,英伟达 CUDA 软件生态的护城河正在被快速瓦解,原因有三个:AI 本身可以写代码来重建生态,TileLang 等高级编译语言大幅降低了开发门槛,GPU 从游戏卡衍生的架构耦合正在被解绑。

" 国产 AI 芯片的硬件和生态都已没有根本性障碍,唯一的瓶颈是产能。" 梁文锋在上述投资者交流会上还透露,华为目前给 DeepSeek 的产能约为 1.6 万张卡,互联网大厂则是十几万张。

梁文锋同时还将中国与美国在 AI 领域的差距概括为 " 落后一到两年,只用它二十分之一的算力 "。在他看来,这个差距主要由算力资源的不对等造成,而非人才或技术路线的差异。

三条路径卖算力

超节点不只是 AI 芯片的简单堆叠,一套完整的系统还包括高速交换网络、液冷散热、高压供电以及将这些部件集成到整柜中的系统工程。

以英伟达为参照,其上一代 GB200NVL72(英伟达 2024 年推出的 72 卡整柜超节点)售价约 300 万美元(约合人民币 2100 万元),今年量产的新一代 VeraRubinNVL72 单柜物料成本进一步攀升至 780 万美元。

国产超节点没有公开的标准售价,但中国移动今年的集采提供了一个参照—— 776 套超节点计算节点设备,5 家厂商的报价均在 20 亿元以上。不过,中国移动采购的是 384 卡规格的计算节点,并非整柜系统,实际部署时还需要配套交换柜、光模块和液冷基础设施,一个完整的 384 卡超节点落地总成本远高于此。

对于电信运营商和互联网大厂来说,这是可以承受的基础设施投入,但 AI 算力的客户远不止这些大买家。高校实验室、AI 创业公司、中小开发团队同样需要顶级算力,只是用量有限,也承担不起高额的一次性投入。

这种需求规模的落差,正在推动超节点的交付方式分化为至少三条路径,既面向不同体量的客户,也对应不同的盈利逻辑。

第一条路径是卖整柜硬件。

华为昇腾超节点目前主要采用这种模式,以整柜形式交付给客户,客户在自己的数据中心部署运营。买家主要是三大电信运营商、大型互联网企业和国家级智算中心。这些机构有机房、有运维团队、有持续的算力需求,买硬件自建是最经济的选择。

比如,中国移动今年 3 月启动的超节点集中采购,是目前公开信息中规模最大的单笔超节点订单,也是三大电信运营商在集团层面首次大规模采购超节点设备。此次集采共涉及 776 套超节点计算节点设备和 6208 张 AI 加速卡,全量锁定华为 CANN(昇腾计算架构)生态。根据中标候选人公示,河南昆仑、长江计算、华鲲振宇、宝德计算机、华启智慧 5 家厂商入围,报价集中在 20.59 亿至 20.70 亿元之间,最高与最低仅差 0.11 亿元。

一位长期关注国产算力领域的投资人告诉记者,这种极度接近的报价反映出硬件环节的利润已经被压得很薄,但首期硬件交付并不是这种模式利润的主要来源。超节点把液冷散热、高速交换、电源管理等模块整合进了交付范围,后续的系统扩容、维保和驻场服务的毛利率通常在 40% 以上,远高于首期硬件。

公开信息显示,三大电信运营商 2026 年算力资本开支合计超过 800 亿元,其中中国移动算力网络投资 378 亿元,同比增长 62.4%。

值得一提的是,梁文锋在前述交流中也透露,DeepSeek 的算力集群全部是自建的,买卡的投资回报远高于资金留在账上。" 我把钱变成卡,十个月就能收回成本,肯定是能买到多少就买多少。" 梁文锋说。

第二条路径是自建自运营。

曙光 8000 走的就是这条路,十万卡集群不是卖给某个特定客户的,是中科曙光自己运营的。这种模式依托国家超算互联网运行。超算互联网是科技部推动建设的一张全国性算力调度网络,目标是把全国 30 多个超算中心和智算中心连起来,让用户在平台上下单就能按需使用算力,不用关心算力来自哪个物理机房。

今年 7 月 13 日,超算互联网在郑州上线了核心节点,定位为全国算力的中央调度枢纽。平台注册用户目前已突破 140 万,采用 " 普惠 + 市场 " 双轨定价,科研用户注册即可获得免费算力额度,商业客户按市场价计费。

记者从中科曙光方面了解到,曙光 8000 在郑州落成后直接接入了这张网络,面向全国科研机构和企业提供算力服务,定价从每卡时(一张 AI 芯片运行一小时的计费单位)1.2 元到 3.5 元不等,科研机构可享受最高 50% 的普惠补贴,补贴后最低每卡时不到 1 元。上线首周,排队等待使用的算力需求已超过集群总规模的 3 倍。

这条路径的盈利逻辑和卖硬件截然不同。前述投资人指出,卖硬件是项目制收入,一台服务器卖出去就结束了,毛利率在 20% 左右,且受客户资本开支周期波动影响;运营算力是持续性收入,只要集群利用率保持在较高水平,综合毛利率可以做到 40% 以上。

中科曙光 2025 年年报显示,算力服务收入占比已从 2023 年的 12% 升至 37%,成为增长最快的业务板块。

浙商证券计算机首席分析师刘雯蜀说,算力厂商如果能把盈利模式从一次性的硬件销售转向持续性的算力服务,就可以获得更持续的现金流。同时,集群运维托管、词元使用效率提升等增值服务也有望进一步拉高毛利率。

第三条路径是公共云。

阿里云 M890 超节点云上算力单元把超节点做成了按需取用的云服务,64 卡全互联的云上算力单元每小时 120 元,平均每卡时不到 2 元,同时支持按任务包和按词元调用量计费。

阿里云弹性计算产品线负责人吴结生在 WAIC 期间表示,当一个万亿参数的大模型需要更高效的推理,当训练任务动辄横跨成百上千张卡,真正的答案是把芯片、服务器、网络、存储凝聚成一个整体,提供一台能训练、能推理、能被开箱即用的 "AI 超级计算机 "。

在阿里云的设计中,用户不需要自己去买硬件、建机房,只需要在云平台上开通,就能直接获得一个超节点计算环境来跑大模型。

华为云也在朝类似方向演进。华为云 CEO 张平安此前曾公开表示,华为云已从卖云服务器的 IaaS(基础设施即服务)模式全面转向卖词元的 MaaS(模型即服务)模式。公开数据显示,华为云基于昇腾 384 超节点推出的 CloudMatrix384(华为云超节点云服务的产品名称)每百万词元成本约为 1.8 元,在国产算力方案中具备较强的价格竞争力。

当然,上述几种路径之间也存在交叉互渗。比如,华为既通过整柜销售服务于运营商,又通过华为云的 MaaS 模式服务中小客户;曙光既自己运营算力集群,也向其他智算中心销售超节点硬件和整体解决方案。

或者说,不同路径面向不同客户形成了分层结构:大型运营商和互联网企业有机房、有团队、有持续需求,买整柜自建最经济;中型企业和科研机构算力需求波动较大,按需租用可以避免重资产投入和设备闲置;中小开发者在公共云上按小时付费,几百块钱就能用上此前只有大厂才能接触到的顶级算力,灵活方便。

向 " 训推一体的通用算力底座 " 演进

算力能不能持续高效运转,正在成为决定这个市场能否兑现商业回报的核心变量。

曙光 8000 上线首周满载是好消息,但并非所有智算中心都有这样的需求支撑。根据工信部 7 月 20 日在国新办新闻发布会上公布的数据,截至今年 6 月底,全国智能算力规模达 2185EFLOPS,其中东部地区占比 55.9%,西部地区占 32.6%,中部地区仅占 10.6%。对此,一位长期关注算力领域的投资人告诉记者,东部智算中心普遍处于高负荷运行状态,而中西部部分智算中心建成后面临客户不足、利用率偏低的情况,算力越高端、密度越大,闲置的成本压力也越大。

智算中心的电费、运维、带宽、折旧等运营成本是刚性支出,集群规模越大每天的固定开销越高,利用率低于一定门槛就意味着持续亏损。尤其是对于刚刚转型为算力运营商的企业来说,如何在建成之后持续找到足够多的客户、维持足够高的利用率,是比技术更难回答的问题。

国家超算互联网正在尝试缓解这种供需的地理错配。

7 月 13 日上线运行的郑州核心节点定位为全国算力的中央调度枢纽,用户不管在哪个城市,接入平台就能按需调用全国的算力资源。在采访过程中,记者了解到,预计 2026 年底,国家超算互联网年算力交易额就将突破 100 亿元。另外,落地了中央调度枢纽的河南省也在省级层面建立了算力券机制,每年发放总额不超过 5000 万元,以降低中小企业的用算成本。

从需求端看,新的应用场景也正在创造增量需求。

海光信息总裁助理兼智能计算产品部总经理杜夏威在接受记者采访时提到,AIAgent(智能体,能自主规划和执行复杂任务的 AI 系统)的兴起正在改变算力需求结构。过去 AI 主要用 GPU 做模型推理,CPU 只起辅助调度作用,但 Agent 在执行一个复杂任务时,需要 CPU 完成任务编排、工具调用、缓存管理等大量工作,CPU 和 GPU 的算力配比正从过去的 1:8 向 1:1、甚至更高的方向变化。这意味着算力基础设施的需求不是在减少,而是在变得更加多元。

中科曙光 AI 行业首席工程师李冉亦认为,Agent 时代的负载是长链路、高消耗的,要求计算、存储、网络、软件整体协同,曙光的应对方式是围绕超节点打造全链路推理加速方案,从底层算子库到上层模型部署做端到端的全链路优化。

在他看来,超节点正从 " 训练专用设施 " 向 " 训推一体的通用算力底座 " 演进,应用场景已从大模型训练扩展至推理、Agent、科学计算等更多领域。

工信部信息通信经济专家委员会委员盘和林对经济观察报记者表示,超节点与传统 GPU 算力集群的本质差异在于是否实现了内存统一编址与垂直扩展级互联。传统 GPU 算力集群采用横向扩展,时延高、带宽低,而超节点通过构建统一内存编址,时延可低至微秒级,带宽可达每秒 TB 级别,并可以直接访问跨节点资源。

" 简单来说,超节点弥补了国产算力单芯片性能不足的短板,使我们追平全球先进算力水平成为可能。" 盘和林说。

不过,在盘和林看来,国产超节点要真正大规模商用,还需要跨越两个障碍。一是生态适配,目前各厂商的超节点之间存在不同的连接协议,如何统一这些协议以充分发挥互联效率,同时针对 DeepSeekV4、Qwen、GLM 等主流大模型完成适配并降低开发者的适配门槛、避免重复开发,仍是行业需要解答的问题;二是在提高系统可靠性的同时优化成本,千卡乃至万卡同时接入超节点可能导致系统整体稳定性下降,需要完善故障响应和自愈等配套机制,而算力成本的下降则有赖于节点规模化和单节点成本的持续压降,以此吸引更多 AI 大模型用户接入超节点网络。

国泰海通证券计算机首席分析师杨林告诉记者,算力竞争的核心范式已从 " 单卡峰值 " 转向 " 系统效率 ",价值分配正从 " 卖卡 " 向 " 卖系统、卖能力 " 全面迁移,光互连、液冷、网络方案、系统集成与调度软件等环节将获得更高的价值权重。

根据华泰证券在相关研报中的测算,2028 年中国超节点架构市场规模有望达到 3414 亿元,2026 至 2028 年复合年均增长率为 194%。

相关标签
经济观察报

经济观察报

理性·建设性

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容