
编辑|林觉民
三年前 " 百模大战 " 时,一边是英伟达 GPU 一卡难求、价格一路水涨船高,另一边却是许多国产 AI 芯片很难被大模型公司充分利用。
看到 AI 产业巨大的想象力,也看到国产算力没有被充分释放的商业价值,夏立雪意识到,团队过去十多年的技术积累终于迎来了产业机会。在导师汪玉的鼓励下,他与一群同样来自清华大学电子工程系的师兄弟共同创立无问芯穹,目标是成为打通 M 个模型和 N 款芯片的新技术范式平台,让每一块芯片都能发挥最大的商业价值。
" 凭借多年的经验,创业之初我们就不只看训练需求。我们预判模型很快会进入大规模应用阶段,于是先从异构训练切入,同时积累面向大规模推理的基础设施能力。" 无问芯穹创始人兼 CEO 夏立雪告诉雷峰网 ( 公众号:雷峰网 ) ," 虽然有所预判,但 AI 落地的速度还是比我们预想得更快。"
随着推理需求快速爆发,以及 Agent 开始走向落地,夏立雪和团队在 2024 年底看清楚趋势之后就迅速明晰了商业策略。外界看到这家成立仅三年的公司,对外的产业表达在变化:从连接 M 种模型和 N 种芯片,到 Token 工厂,再到今年 WAIC 提出的 " 前店后厂一中心 " 的 Agentic Infra 战略布局。
看起来,无问芯穹几乎每年都在变化,但在夏立雪看来,这些变化并非方向调整,而是 AI 产业从训练走向推理、再迈向 Agent 时代之后,AI 基础设施形态的必然演进。
过去三年,无问芯穹真正没有变的是什么?这家 AI 基础设施公司商业飞轮是否已经开始转动?更多 AI Infra 的行业交流欢迎添加作者微信 BENSONEIT。
为什么 Token 工厂要「开店」?
" 从训练阶段的多元异构,到推理阶段的 Token 工厂,再到 Agent 迭代阶段,升级为‘前店后厂一中心’的 Agentic Infra,无问从创立至今,核心技术体系没有发生大的变化,我们一直旨在通过 AI Infra 解决智能规模和效率的问题,变化的只是对核心问题的概括和表达。" 夏立雪说。

每一次表达变化,本质都对应 AI 发展进入新的阶段。百模大战时期,AI Infra 成为行业共识;推理需求爆发后,Token 逐渐成为标准化、可定价的商品,Token 工厂成为 AI 基础设施新的产业表达;而进入 Agent 时代,基础设施需要再次升级。在这个过程中,系统很快跟上算法的发展,并推动算法本身再去做更多尝试,这是一个健康且良性的互动。
"Agent 不是调用一次 Token 就结束的‘套餐式’需求,而是要把不同 Token 调用组织成一个完整、长期与人协作的任务,比如从代码生成到工程化,这对底层基础设施提出了大量任务并发、灵活启停等新要求。" 夏立雪表示,"Agentic Infra 的关键,是基础设施既要服务 AI 应用,本身也要大量利用 AI 实现自我迭代。"
真正促使无问芯穹提出 " 前店后厂一中心 " 的关键,是越来越多企业遭遇的 "Token 刺客 "。
Token 账单越来越长,却越来越难回答一个问题,这些 Token 到底解决了多少问题?即便达成相同的业务效果,由于底层推理路径、模型规模及芯片适配度的差异,不同 Token 的成本也不同。" 所以我们决定,不仅要有厂,还要和行业伙伴一起‘建中心’、‘开店’。" 夏立雪说。
在他看来,前店后厂一中心并不仅是一套商业架构,更是一套关注规模和效率的 AI 生产力转化系统。无问芯穹并不做模型,也不做芯片,而是保持中立,作为连接模型、芯片和客户需求的独立平台,将分散的模型能力和异构算力组织起来,持续优化从底层资源到 AI 生产力的转化效率。

无问芯穹并不是唯一一家选择选择这样做的 AI 基础设施公司。
过去一年,海外专为 AI 提供基础设施服务的 NeoCloud 快速崛起,特别是 Baseten、Fireworks、Together AI 等纯软件基础设施公司估值已达到百亿美元量级。夏立雪认为,它们增长的原因并不仅仅是提供 GPU 资源,而是通过针对 AI 应用深度优化,提供行业解决方案,让基础设施真正触达最终用户。
" 这些公司其实也不只是做 Token 工厂。" 夏立雪说。
相比海外主要围绕单一 GPU 优化,国内市场算力架构更加多元,无问芯穹需要同时优化 N 种异构芯片,技术复杂度更高,但也意味着更大的机会。
" 并且国内的应用场景更加丰富,我们看到的是一片蓝海。" 夏立雪说。
商业模式已经逐渐清晰,接下来的问题是:无问芯穹的商业飞轮,是否已经真正转起来了?
AI 商业飞轮已经转动,Token 成本仍有 10 倍下降空间
判断商业是否闭环,一个简单的标准是:产品涨价之后,客户是否还愿意买单。按照这个标准,AI 商业已经完成了从 " 证明价值 " 到 " 用户付费 " 的跨越,程序员、设计师等职业已经形成稳定的付费意愿。
" 写代码是一个职业而非行业,程序员遍布各行各业,他们都愿意为 AI 付费。现在人们讨论的不是 Token 有没有价值,而是觉得 Token 太贵,这恰恰说明了 Token 的价值。" 夏立雪说。
商业闭环还有另一个衡量标准——产业链是否能够持续分享收益。当前,主流芯片赚走了 AI 产业绝大部分利润,AI 商业真的已经闭环了吗?
" 利润分配是商业行为,会随着阶段目标变化,并不能反映产品价值的本质。" 夏立雪认为,"GPU 稀缺,芯片议价能力最强,自然赚得最多。但反过来想,大家抢着买,恰恰说明下游有真实的付费需求在支撑。如果行业没有闭环,产品应该是卖不动,而不是买不到。"
这意味着,AI 商业飞轮已经开始转动,无问芯穹自己的商业飞轮也已经逐渐形成。
雷峰网了解到,过去一年,无问芯穹通过一系列原始技术创新,实现了 10 倍推理成本下降,平台高可用率达到 99.99% 以上,与 Kimi、智谱、MiniMax、阶跃星辰等头部大模型企业密切合作,在资源组织和生产关系上已经形成闭环——截至 7 月,无问大模型服务平台单日 Token 调用量较去年 12 月,已实现了 40 倍增长。
对于无问芯穹而言,接下来的问题不再是证明商业模式,而是如何让飞轮转得更快。
如果类比通信行业,AI 已经完成了 "3G 时代 " ——证明自己有用;接下来要迈向 "4G 时代 ",真正决定产业爆发的将是基础设施持续降低成本,支撑更多 AI 应用落地。
夏立雪判断,未来 1 至 2 年,Token 成本仍有超过 10 倍的下降空间。一方面,模型结构正在逐步收敛,模型稀疏化、软硬件协同设计等更激进的优化手段将释放更大的效果;另一方面,算力供给持续增加,供需关系有望进一步改善。
当推理成本再降低一个数量级,AI 竞争的重点将从模型能力,转向应用边界。
夏立雪表示,因为团队里很多成员都是清华电子工程系的背景,既理解数字 AI,也理解物理 AI,无问芯穹对于扩展深化能源、电力以及具身智能等领域的 Agentic Infra 行业解决方案落地保持乐观。
如果说为客户降低 10 倍成本是在推动 AI 产业发展,那么持续降低自身成本,就是无问芯穹构建护城河的方式。
在 2026 年世界人工智能大会上,无问芯穹发布了相关技术进展,呼应黄仁勋提出的 " 算力即收入 ",夏立雪将 MaaS 的商业核心总结为一句话:" 算力即收入,优化即利润。" 意思是——算力规模决定收入上限,优化效率决定利润空间。
特别的是,与传统软件交付不同,无问芯穹 Agentic Infra 在大量使用 AI 持续优化自身,通过不断降低系统成本提升利润空间。夏立雪认为,这也是 Agentic Infra 与传统云平台的关键区别。传统云竞争的是规模效应,而 AI Infra 竞争的不但是规模,更是效率。
传统云的底层逻辑建立在算力供给充足的基础上,而当前 AI 基础设施仍处于供不应求阶段,谁能持续优化系统效率、降低 Token 成本,谁就能获得更高的利润空间,也能支撑 Agent 等新应用提出的新需求,这是传统云平台并不擅长的能力。
行业仍处于快速增长阶段,真正的竞争刚刚开始。无问芯穹凭什么持续把 Token 成本再降低 10 倍?它的核心竞争力又是什么?
为什么「最懂芯片」的不一定最会用芯片?
无问芯穹成立第一天就选择了基于 M 种模型和 N 种芯片做异构优化和统一部署,这也是其最核心的竞争力。这一判断既来自国内算力产业的现实,也来自团队对行业长期发展的预判。
" 国内算力供给比较多元,海外虽然相对集中,但也存在碎片化问题。从长期来看,异构问题一定会长期存在。" 夏立雪表示," 我们今天已经能够做好 16 种的异构优化,如果未来市场最终只剩下 5 家,我们只是向下兼容。"
一个更值得讨论的问题是:为什么连芯片公司自己都没有充分发挥芯片的能力?
" 芯片公司最了解自己设计的芯片,所以什么都能做好,这是一个误区。" 夏立雪说," 就像 Windows 上的软件并不都是微软开发的一样,芯片公司负责的是把芯片设计出来、写好‘使用说明’、提供好开发环境,而如何让模型真正发挥芯片的效率,则是另一套系统能力。"
无问芯穹扮演的正是这样的角色——站在 " 前店后厂一中心 " 的 Agentic Infra 战略布局上,把模型、芯片和基础设施组织起来,这正是其团队十多年持续积累的能力。
不过如果芯片本身选择的算法路线与市场需求发生明显偏离,再优秀的系统优化也无能为力。
WAIC 期间,无问芯穹发布了首创的跨集群异构 PD 分离架构(Prefill-RelayDecode-MainDecode, PDD),将传统的 "PD 分离 " 创新解构为 "P-RLD-MD" 的三级分离式推理架构,通过流水线掩盖 KV Cache 跨集群传输的延迟,通过更加精准的调控将延迟降低,进一步提升推理效率。
至于 PDD 最终能够带来多少成本 Token 成本下降,夏立雪说,实测显示,该架构在首 Token 延迟(TTFT)降低 51.5% 的同时,单 Token 成本可降低 37.5%。团队正在紧锣密鼓地将这套方法复用在更大规模且更多种异构芯片上,预期这一数据还会有进一步地跃升。
除了推理效率,无问芯穹也在强化学习方向持续投入。
"Agent 时代更需要强化学习。" 夏立雪认为," 基座模型更像优秀的本科生,而强化学习能够让它成长为某个行业的专家。"
对此,无问芯穹在今年 WAIC 上还发布了面向大规模跨域强化学习训练的网络、平台、框架的协同深度优化技术,实现跨域强化学习训练连续一周零中断稳定运行,未来将跨域计算资源的支撑规模,持续拓展至十万卡级以上,去支撑下一代高性能 Agentic AI 实现 " 在线进化 "。
在夏立雪看来,无问芯穹对发展方向的判断和滚动创新才是公司的护城河。
继续推进异构优化的同时,无问芯穹也已经开始布局下一个方向——以具身智能为代表的物理 AI。
布局具身智能,也押注 AI 的下一阶段
物理 AI 距离真正形成商业闭环还有一段距离,但现在正是布局的窗口期。
夏立雪决定布局具身智能的判断来自供给和需求两个维度。从供给来看,AI 算力长期仍将处于供不应求状态,手机、电脑等终端或边缘设备大量闲置的算力资源却还有待进一步释放;从需求来看,AI 最终不会只停留在云端,而是会以各种形态来到人们身边,成为真正的 " 好伙伴 ",具身智能是其中一种可能。
他认为,在物理世界中,具身智能的 Scaling Law 同样需要高效率、大规模的基础设施来支撑,做这个基础设施,需要既懂云端又懂终端的组织。
基于这样的判断,夏立雪表示," 无问芯穹积极入局,也会控制好在具身智能领域的投入节奏。创业公司就应该做点有挑战性的事情。"
回头看,无问芯穹过去三年的产业表达一直在变化:从 =M × N,到 Token 工厂,再到 Agentic Infra。变化的是 AI 产业的发展阶段,不变的是它始终围绕着同一个目标——让每一块芯片都能在 AI 时代产生最大的经济价值。
也正因为如此,很难用过去对一家 AI 基础设施公司的认知去判断无问芯穹的未来。没有人能够准确预测 AI 进入 4G 甚至 5G 时代之后会发生什么,也没有人知道下一代 AI 基础设施最终会演化成什么样。
对于夏立雪和无问芯穹而言,无论 AI 如何演进,让每一块芯片创造更大的商业价值,依然会是无问芯穹继续向前的核心信念。
AI Infra 公司会集体走向何方?欢迎添加作者微信 BENSONEIT 探讨。
雷峰网原创文章,未经授权禁止转载。详情见转载须知。