关于ZAKER Skills 合作
量子位 昨天

业内首款超算 + 智算的大规模计算底座,在 WAIC 上我们找到了

这几天,全网被 WAIC" 霸屏 ",从具身智能到国产算力,这场一年一度的 AI 盛典,同样吸引了科技圈所有目光。

今年 WAIC 堪称是国产芯片和算力企业的斗秀舞台,108 款芯片、超 200 款智算产品齐聚上海。除了全员大集合外,我们还看的一个明显的变化:

过去各家比的是 " 我这颗芯片算力多少 ",单卡性能多么牛;而今年,提到最多的是 " 系统创新 " 与 " 高效协同 "。换言之,单卡比拼的时代已落下帷幕,大规模计算系统性能的较量即将开启。

算力芯片群星闪耀,我们也发现了一颗 " 不走寻常路 " 的新星(芯)。

浦东张江,太初(杭州)集成电路有限公司(" 太初元碁 ")展位里外围满了人,抛开展位处于主通道上的地理位置不谈,更吸引目光的,是一台大型超节点集群,号称 " 超智融合 " 的计算系统,旁边刚揭幕的自研芯片——标签写着:异构众核,双模设计。

先拼架构,再谈单卡

" 算力产业已从单卡性能比拼进入系统级竞争阶段。" 太初元碁 CEO 杨晋喆如是说。

这话不是场面话。模型参数突破万亿级,Agent 和 AI4S 对 CPU-GPU 协同的要求越来越高,单纯堆算力的边际收益正在递减。降低单位算力成本,才是当下真正的核心命题。

这个判断与整个行业的演进方向一致。今年 WAIC 上,华为展出了 Atlas 950 SuperPoD 超节点,沐曦发布 " 曦景 "S 系列超节点,阿里平头哥也拿出了真武 M890 × 磐久 AL128 超节点。

国盛证券在近期研报中直接点明:国产超节点迎来量产元年,算力竞争范式正从单点峰值性能全面转向系统级全栈效率的比拼。

太初元碁给出的技术答案是HCU 异构融合计算架构。核心思路是把 CPU 和 AI 算力核放在同一条高速总线上,支持 M:N 可重构配比—— CPU 负责 Agent 调度和数据预处理,XPA 算力阵列专注大模型推理计算,再配合共享分级存储,实现冷热数据动态调度。

翻译成大白话:一块芯片里塞了两类 " 大脑 ",一个管调度协调,一个管高强度计算,两者还能按需调配比例。这种设计的好处在于,面对不同负载时不用 " 大炮打蚊子 ",也不用 " 小马拉大车 ",算力分配可以动态匹配。

为什么异构众核成了必选项?

这得从 Agentic AI 时代的算力需求变化说起。

传统 AI 训练和推理集群通常采用 " 单路 CPU 搭配 4 至 8 颗 GPU" 的固定配置,CPU 长期充当算力宿主,仅负责任务下发、数据调度与 GPU 资源托管。

进入 Agentic AI 智能体时代,智能体需要自主完成任务拆解、工作流编排、外部工具调用、长期记忆管理全闭环运行,CPU 在规划、决策、交互类通用计算中的算力权重与负载占比出现结构性显著提升。

AMD CEO 苏姿丰在 2026 年 Q1 财报电话会上透露,单个计算节点中 CPU 与 GPU 的数量正从过去的一对多,逐步趋近一比一,未来甚至可能出现 CPU 数量多于 GPU 的情况。

阿里云的判断也类似:Agent" 有状态调度 + 无状态执行 " 的混合模式,对资源精细化管控提出了更高要求,算力系统的优化重心正全面由单卡峰值性能转向 CPU-GPU 的高效协同。

太初元碁的 HCU 架构,本质上是在芯片层面提前响应了这个趋势。把 CPU 和 AI 核放在同一条高速总线上,相比传统 "CPU+ 独立加速卡 " 的分离架构,I/O 损耗更低,协同效率更高。

一颗芯片可打两份工

基于 HCU 架构,太初元碁发布了新一代国产 AI 自研芯片 T2 Ultra。最值得看的正是它的双模式设计。

T2 Ultra 有两种工作模式:自主计算模式下,芯片可以独立承担完整计算任务;加速模式下,则配合主机协同工作。

这意味着同一颗芯片,既能作为独立算力节点部署在边缘或中小规模场景,也能作为加速卡插进大型集群里当 " 算力引擎 "。

具体再看 T2 Ultra 的性能参数,HPC 算力(FP64)为 38 TFLOPS,可满足科学计算需求;FP4 算力则高达 4800 TFLOPS(稀疏算力),FP16 算力 1200 TFLOPS(稀疏算力)应对各种 AI 训推场景,原生支持 FP64 至 FP4、实现全精度覆盖。

对于客户来说,这种灵活性的实际价值在于:不用为不同场景采购不同硬件,一套芯片体系覆盖多种部署需求,采购和运维成本都能压下来。

在国产 AI 芯片普遍面临 " 量产难、落地更难 " 的当下,能不能让客户用得起来、用得起,比纸面参数重要得多。

不只是跑大模型

如果说 T2 Ultra 是 " 心脏 ",那元碁 HyperIntelliX 超智融合计算系统就是整个 " 身体 ",定位为面向 AI+AI4S 的全国产智算 + 超算融合计算平台。

值得注意的是,HyperIntelliX 不只是跑大模型,同样也能在 AI4S 领域发挥价值。针对 AI4S 领域,太初元碁同步披露了相关落地成果:

全球气象预测可视化系统、TecoQSim 量子经典模拟器、大规模虚拟药物筛选——覆盖气象、量子计算、生物医药三个方向。

多数国产 AI 芯片目前还停留在 " 跑通大模型推理 " 的阶段,能同时支撑 AI 和 AI4S 双线任务的平台并不多见。

这个定位有其行业背景。AI4S(AI for Science)对算力的需求与纯 AI 推理不同:科学计算通常需要高并发、大吞吐、长时任务,且对双精度计算能力有硬性要求。

太初元碁团队有三次获得高性能计算领域国际最高奖项 " 戈登 · 贝尔奖 " 的积淀,在超算领域的经验为其切入 AI4S 提供了技术底气。

生态迁移:国产芯片真正的硬骨头

俗话说 " 是骡子是马,拉出来遛一遛 ",硬件再强,也得有人用,才能谈得上 " 可用 ",进而超 " 好用 " 转变。

太初元碁 WAIC 期间发布了两款生态产品,直指国产芯片最头疼的 " 迁移成本 " 问题。

人工智能开发者社区 2.0 完成了对 Megatron-LM、DeepSpeed、飞桨 PaddleHelix、PyTorch、vLLM 等主流训练与推理框架的适配,提供从模型分析、迁移、算子开发到性能优化、精度调试的全流程工具链。

新一代国产 AI4S 计算平台,针对科学计算高并发、大吞吐、长时任务的特点做了专项优化。

这个自主研发的一站式科研创新平台,面向气象预测、生物医药、量子力学、化学材料、流体力学等前沿科学领域,全面兼容龙芯、申威、飞腾、x86 等国内外主流 CPU,提供自研编程模型和涵盖通用算子与科学计算专用加速库。

同时深度适配 PyTorch、JAX、飞桨、MindSpore 等主流框架,并配套 DevKit 开发套件,支持算子生成、编译优化与性能分析,有效降低算子开发门槛与性能调优难度。

依托平台软硬协同的全栈能力,太初元碁与清华大学、湖南大学、山东大学、百度、东润等高校和行业伙伴展开深度合作,在气象预报、量子模拟、基因分析、材料仿真、流体计算等领域打造一系列高效、精准的科研解决方案,助力科研与产业级科学计算高效落地,实现以中国芯,解科学题。

太初元碁的逻辑很清楚:芯片是入场券,生态才是护城河。

这个判断切中了国产芯片的共性痛点。当前主流框架和算子库深度绑定 CUDA 生态,模型向国产算力迁移流程复杂、开发成本高、周期长。行业调研显示,完整适配周期约需 3-6 个月,其中约 60% 的工作量集中在性能调优阶段。

国产芯片生态建设目前分为两大路线:一条是主打 GPGPU 路线,追求与英伟达的 CUDA 兼容,如寒武纪通过自研 Bangware 软件栈实现 CUDA 兼容,迁移成本降低约 70%;另一条是以华为 MindSpore 为代表的自主生态,试图在英伟达生态圈外建立独立生态圈。

太初元碁的路线更接近前者,通过多元化开发范式支持 PyTorch、vLLM 等主流框架快速迁移,满足 80%-90% 主流场景适配需求。

进一步深挖其长期以来在国产化生态搭建方面的尝试,我们发现,不管是公开信息显示的累计超 40 款 AI 大模型的即发即适配,还是太初元碁联合百余所高校、科研机构、企业等推动算力落地——

例如与清华大学研发 Teco-QSim 量子经典模拟器;携手量旋科技,打造 " 量子 - 超算 - 智算 " 超智融合平台;率先完成清醒异 RiverONE 模型适配及龙芯平台验证;为清华大学智能产业研究院 AtomWorld 原子世界模型提供 512 节点全液冷架构的硬件基础;与百度螺旋桨、神威数智团队成功复现 AlphaFold3 模型;联合湖南大学发布首个显式建模 DNA 双链动态交互的基因组语言模型 CrossDNA;与山东大学高性能计算团队完成分子对接方法优化,构建大规模药物筛选全流程方案;联合百度飞桨为百家企业提供 AI for Science 端到端方案;联合百度科学计算团队打造国产气象一体机,支持逐时动态推演与台风路径轨迹精准识别;与东润环能达成战略合作,实现训练吞吐与推理 QPS 的双提升;深度适配上海人工智能实验室的书生 Intern-S1 AI4S 多模态大模型,并联合开展 AI4S 生态赛事等等。

都直接指向一个核心问题:生态不断加码扩容。

聊完技术底层讲安全

由河南空港智算中心、瑞莱智慧、太初元碁、安势信息、清源智契、典枢科技、数安信七家单位联合打造的全域大模型安全系统,同步在 WAIC 发布。

瑞莱智慧 CTO 徐世真现场拆解了整套框架:底层是国产可信算力底座,核心是一体化大模型安全评测治理平台,上层构建大模型安全测评、数据合规、数据安全、软件供应链安全等多种安全系统,顶层配套独立 AI 安全教育实训中心。

这看起来像是 " 补丁式 " 的安全附件,但在当前的行业语境下,它可能是整场发布会中最务实的一环。大模型正在加速进入政务、金融、医疗等敏感领域,安全问题不是 " 要不要做 " 的问题,而是 " 不做就没法落地 " 的硬门槛。

看似斗秀 实为国产算力的一次大考

WAIC 2026 与其说是一次国产算力 " 百花斗艳 " 舞台,不如将其看成面向国产算力的一次大考。而当我们把太初元碁的发布放在整个国产芯片版图里看,会更清晰一些。

华为昇腾 950PR 已经量产,FP4 精度算力达 1.56PFLOPS,2026 年出货目标上调至 150-200 万颗;寒武纪思元 590 在 DeepSeek 推理场景中效率已超越 H20,2025 年全年营收 64.97 亿元,同比增长 453%;沐曦股份登陆科创板,市值一度突破 2800 亿元;海光信息深算 DCU 已与 365 款主流大模型适配。

太初元碁的差异化在于:它想做的不是某一颗芯片的替代者,而是一整套 AI 基础设施的构建者。

从底层 HCU 架构支撑的 T2 Ultra 芯片与 HyperIntelliX 系统,到中层开发者社区 2.0 与 AI4S 计算平台,再到上层七家联合的全域大模型安全体系——三层之间不是简单叠加,而是相互支撑的体系。

但挑战同样明显。国产 AI 芯片市场正从 " 政策驱动 " 向 " 市场驱动 " 深层转型,头部 3-5 家占据 80%+ 份额的洗牌窗口即将开启。

对于太初元碁而言,能否在万卡集群、十万卡集群的规模化部署中证明系统稳定性,能否在生态迁移成本上持续降低开发者门槛,将是决定其能否从 " 可用 " 走向 " 好用 " 的关键。

国产算力走到今天,早已过了靠单点参数刷存在感的阶段。真正的较量,是体系化能力与生态协同效率的综合比拼。

WAIC 2026 的展台已经说明:大家比的不再是 " 我有多强 ",而是 " 我的系统有多完整 "、" 我能不能落地更多场景 "。毕竟,只有真正走完产业闭环落地,未来才能接着 " 活下去 "。

* 本文系量子位获授权刊载,观点仅为原作者所有。

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

点亮星标

科技前沿进展每日见

相关标签

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容