关于ZAKER Skills 合作
钛媒体 32分钟前

1200 亿美元之上,中国服务器厂商重新排位

文 | 半导体产业纵横

服务器行业越来越焦虑了。

这句话听起来有些反常。毕竟,AI 还在制造人类科技史上最昂贵的一轮基础设施建设。按市场预测,2026 年全球四大云厂商与 AI 相关的资本开支合计将达 7250 亿美元。以 7250 亿美元计算,相当于每天投入近 20 亿美元,其中相当大一部分最终流向 AI 服务器及其配套基础设施。

服务器市场也在迅速变大。2026 年第一季度,全球服务器市场厂商收入达到 1226 亿美元,同比增长 30.4%。问题在于,流向 AI 服务器的钱越多,不等于每一笔钱都会经过传统服务器厂商。市场的增长,与服务器厂商在产业链中的位置,正在成为两件事。

01 一张卡的标准答案消失了

今年服务器厂商的焦虑,写在 WAIC 2026 里。

向上看,芯片厂商不再满足于销售 GPU 或 NPU。华为、沐曦、摩尔线程已经把互联、通信库、参考架构和整机柜一起推向客户,希望亲自回答一颗芯片如何组成千卡集群。

向下看,云厂商和头部互联网公司掌握模型与负载,可以自己定义服务器,再直接向 ODM 下单。2026 年第一季度,ODM Direct 收入仍占全球服务器市场的 50.2%。换句话说,全球约一半的服务器收入,已经可以在大客户和制造厂之间直接完成。

AI 发展下,芯片厂商、ODM 厂商、OEM 厂商、云厂商的边界越发模糊。在市场快速扩张下,服务器厂商必须重新回答一个问题:自己在 AI 产业链中究竟不可替代在哪里?

我们看到,服务器厂商想的第一步,是走向多卡异构。尤其是对于中国的服务器厂商,这一步变得非常必要。毕竟,中国市场的特殊性,让市场中出现越来越多的 AI 加速卡。

有行业研究今年 7 月对 60 名中国企业高管的调查显示,受访者预计未来 12 个月将把 46% 的 AI 加速器预算投向国产芯片,高于当前的 30%。除了英伟达,客户还可以在华为昇腾、寒武纪、昆仑芯、摩尔线程、沐曦集成、燧原科技、天数智芯等厂商之间选择。它们从 NPU、通用 GPU 和专用 AI 处理器等不同路线切入,适合的模型与场景也不相同。

选择多了,生意看起来也变宽了:同一条服务器产品线可以搭载不同芯片,覆盖更多客户。真正做起来,却不是换一块硬盘那么简单。换一张加速卡,主板布局、供电、散热、固件和信号完整性都可能重做;机器点亮以后,还要处理驱动、编译器、算子库和通信库。同一个模型迁移到另一张卡上,也常常只是 " 能跑 ",离合理性能还有一段距离。

服务器厂商先从硬件下手。今年 3 月,浪潮信息披露,其多元开放算力架构通过开放加速器模块和算力模组,可让同一系统平台支持业界 90% 的 AI 芯片,以及 x86、ARM 等 CPU 架构,并把芯片到算力系统的研发周期缩短至 6 至 8 个月。

接下来是更难的软件适配。超聚变在 B.E.S.T 3.0 和 FusionOne AI 继续推向软件层,把算子、模板库、编译器、模型部署和推理加速放入一套方案,并提出异构算力要 " 协同可用、混合可训、混合可推 "。新华三的灵犀智算试图统一接入、复用和调度异构 GPU;联想的万全异构智算平台,则要把不同芯片、模型和从百卡到万卡的集群放进同一套管理体系。

一位国产加速芯片厂商人士告诉笔者,互联网客户采购前会拿自己的模型反复做 POC,最后算的是 TCO。硬件跑分只是其中一项,软件是否好用、模型多久能够完成适配、芯片能否持续供货,都会影响采购结果。

这让服务器厂商重新有了价值空间。国产芯片越多,客户越不可能逐一吃透每套软硬件体系。服务器厂商若只能列出一张 " 兼容清单 ",仍然容易被替代;若能把换芯时间、性能损失和运维成本一并压下来,卖的才不只是一个装卡的盒子。

02 服务器正在被一座机柜吞掉

纵观 WAIC 2026,另一个明显的趋势是:超节点成为 AI 时代的产品单元。上海人工智能实验室 DeepLink 团队发布的《超节点技术体系白皮书》给过一组对比:过去 5 年,预训练所需算力增长约 3000 倍,单芯片算力同期只增长约 16 倍。

超节点先用 Scale-Up 把更多加速卡组成低时延计算域,再通过 Scale-Out 接入更大的集群。用户买到的表面上仍是机柜,使用时却要把它当成一台跨越多个机柜的 " 大机器 "。

于是也会带来一个问题:卡数并不等于有效算力。上述白皮书在一套参考设计中测算,Scale-Up 域从 8 卡扩大到 32 卡,千亿参数模型的训练收益为 20%、推理收益为 42%;扩大到 512 卡后,两项收益也只增加到 21% 和 45%。

今年 AI 服务器的竞争,更像是 " 数卡比赛 ":64 卡、128 卡、256 卡、1024 卡,以及向万卡、十万卡扩展的集群。但 " 超节点是极致工程问题,不是卡越多越好,适合应用场景的才好。" 一位国产 GPU 厂商人士在采访中说。超节点扩大了低时延通信范围,也扩大了故障影响:一张卡掉线、一次网络拥塞或一个液冷接头出问题,拖慢的可能不再是一台服务器。

这时候,不同公司的优势被摆到了同一张桌上。

第一类是掌握芯片、互联和软件的全栈厂商。华为在 WAIC 2026 展示的 Atlas 950 SuperPoD 是一套 1024 卡集群。按华为披露的数据,它拥有 256TB 全局统一内存,往返时延为 3 微秒;此前的昇腾 384 超节点已落地 750 多套。华为可以同时设计 NPU、灵衢互联、整机和 CANN 软件栈,用纵向一体化换系统效率。阿里以自研芯片、ALink 互联和磐久服务器走的是类似路线,并可用云上真实负载检验系统。

第二类是从芯片向系统延伸的 GPU 厂商。沐曦曦景 S600 将单柜 64 张 GPU 全互联;摩尔线程MTT C256 用两个标准机柜连接 256 张 GPU,并称将卡间时延压到亚微秒级。它们做超节点,是要证明自家 GPU 不仅单卡能跑,也能组成商用系统。优势是更懂自己的芯片和通信栈,短板则是商用交付还涉及网络、存储、供电、液冷、故障管理和服务体系。

第三类就是传统的服务器和 ICT 厂商,这类厂商更重要的是强调兼容和交付。我们看到,中兴通讯的 OEX 超节点主打开放和快速换芯。它将计算托盘与交换托盘正交直连,取消内部高速线缆,并开放机械和电气接口。按中兴披露的数据,这套设计能将故障维护从小时级缩短到分钟级,整机开发周期压缩至 3 至 6 个月;通过更换关键模块,可适配不同 GPU 平台。中兴还联合壁仞、沐曦、燧原、天数智芯等厂商推出 Matrix 方案。

新华三UniPoD S80000 系列单柜可部署 32 至 64 张加速卡,Scale-Up 可扩展至 1024 卡,Scale-Out 可延伸至 16384 卡。同时,新华三同时拿出了 102.4T 智算交换机、全闪存储、液冷、供电和运维系统,展示 " 算 - 网 - 存 - 云 - 安 - 维 " 全栈协同能力

远图前瞻性布局高密计算、高速互联、高效供电与液冷散热技术能力,并提供 32 卡、64 卡至 128 卡的多层级超节点整机方案。在国内多数算力厂商仅深耕服务器单一赛道时,远图选择 " 服务器 + 高速交换机 " 双赛道同时自主研发、批量交付,拉通 " 算、网、存、管 ",将长期服务头部客户积累的联合开发、供应链和制造能力,变成标准化的自有产品。

03 硬件只卖一次,Token 每天都在生产

AI 服务器的竞争,现在还要落到 Tokne 上。截至今年 3 月,中国日均 Token(词元)调用量已超过 140 万亿,相比 2024 年初的 1000 亿增长了 1400 倍。大模型从训练走向应用后,客户不只看 GPU 数量和峰值算力,还要问同样的机器与电力一天能生成多少 Token、用户要等多久、每百万 Token 要花多少钱。

今年以来,"Token Factory""Token 工厂 " 和 " 词元工厂 " 密集出现。对于 Token 的生产,不同 AI 服务器厂商有不同的看法。

新华三打造了面向算力、模型、任务与 Token 的一体化运营管理平台图灵 Token 工厂,向上承接模型任务与应用请求,向下统一调度 GPU 资源与算力分配。此前,新华三集团总裁兼首席执行官于英涛透露," 图灵小镇 " 并不只是传统意义上的算力园区。它更像是一个围绕 Token 生产、调度、使用的 "Token 工厂 "。

超聚变已经 " 以身试法 ",把 Token Factory 真正跑起来:日均 500 亿 +Token 需求、30+ 智能体场景,AI 赋能软件工程两年实现 100% 全员研发覆盖,最新 Agentic 实践中,1 个小队 3 个月由多 Agent 并行产出 50 万行代码。

04 结语

全球服务器市场还在扩张,高盛 Allen Chang 团队发表研报,将全球服务器市场总规模上调,预计 2028 年全球服务器市场收入将达 1.1 万亿美元。其中 AI 服务器机架收入将以 118% 的复合年增长率扩张至 5,614 亿美元,占全球服务器市场总收入的 51%。

AI 服务器没有变成一门更标准的生意。芯片路线、互联协议、液冷方式和模型负载都在分化,它反而从标准产品重新变成了复杂工程。这将成为 AI 服务器厂商的下一个门槛。

相关标签

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容