关于ZAKER Skills GEO服务 合作
钛媒体 29分钟前

阶跃星辰“第一梯队”,是“自嗨”吗?

文 | AIX 财经,作者|雷晶,编辑|魏佳

沉寂许久的阶跃星辰,正试图挤进大模型第一梯队。

9 月 20 日,它发布 Step 5 Preview,原生支持文本与视觉输入,重点面向编程、软件工程、专业知识工作和长程 Agent 任务。上线初期,登录并完成首次调用后可获得 30 天的 Step Plan 免费使用权。几天后,Step Plan 的月度套餐一度售罄。对于一家在大模型市场存在感不算强的公司来说,这样的关注度并不常见。

紧接着,第三方平台 Artificial Analysis 发布最新的智能指数排名,Step 5 Preview 与 Kimi K3 并列全球开源第二。这是阶跃星辰的开源模型第一次获得这么高的名次。

阶跃星辰成立于 2023 年 4 月,由前微软全球副总裁姜大昕创办,早期被外界列入 "AI 六小龙 ",但从后续业务看,它不算一家典型的大模型公司。除了通用大模型,它还布局了语音、图像、智能体和手机等业务,产品线比较分散。这次 Step 5 Preview 的发布,一度被外界视为它杀回第一梯队的信号。

这个时间点也很微妙。据媒体报道,阶跃已于 6 月底向港交所秘密递交上市申请,争取年底挂牌。而模型圈的第一梯队基本已经坐稳了月之暗面、深度求索等厂商,靠这一款模型,阶跃真能挤进去吗?

01. 阶跃模型上桌了?

判断阶跃星辰有没有进入大模型第一梯队,可以拆成两层:模型本身的能力,和市场上的使用规模。

模型能力,我们重点看榜单排名。

从阶跃公布的基准测试看,Step 5 Preview 的优势主要集中在代码、Agent、浏览检索和长上下文任务。在 GPQA Diamond、Terminal-Bench v2.1、BrowseComp 和 MMMU-Pro 等测试中成绩靠前,说明它已经具备处理复杂专业任务的能力,但这些恰好是不容易被用户直接感受到的部分。

阶跃还自建了 StepCodeBench,覆盖 553 个独立代码仓库、33 种编程语言,考察在真实开发场景中的表现。这项测试中,Step 5 Preview 排名第三,低于 Claude Opus 5 和 GPT-6 Astra,高于 Kimi K3 和 GLM 5.3。这说明它具备一定工程实力,不过测试的数据集和评分规则没有公开,参考价值有限。

在第三方榜单 Artificial Analysis 的智能指数中,Step 5 Preview 发布初期曾与 Kimi K3 并列开源模型第二,随着小米 MiMo-V2.6 发布,排名下滑至第三,说明它的位置并不稳定,容易受到其他厂商发布新模型的影响。Step 5 Preview 的得分为 44 分,远低于排名第一的 Claude Opus 5.5 的 58 分,海外闭源旗舰仍是另一档。

Arena 竞技场反映的是体验。这个平台主要依靠用户投票,结果更接近开发者的实际感受。在 WebDev 网页开发总榜中,Step 5 Preview 排名第 30,而阿里的 Qwen3.8 Max 和月之暗面的 Kimi K3 分别排在第 7 和第 10。在需要同时兼顾功能、代码和视觉效果的网页开发任务中,Step 5 Preview 仍落后于头部国产模型。

开发者的感受与之相似。独立开发者李默告诉「AIX 财经」,Step 5 Preview 的输出比较稳定,写工程代码时返工较少。Agent Loop(智能体循环)能力也不错,模型执行任务遇到问题后,会根据反馈继续修改,能够在较长的任务链中持续推进。不过,它在前端、3D 建模和视觉审美上表现一般。

在他看来,这一代模型更像是牺牲效率换智能。Step 5 Preview 比较 " 话唠 ",输出 Token 多,经常要思考很久,所以算下来实际使用成本并不低。尽管 Kimi K3 也是这个打法,用更高的思考强度换复杂任务的表现,但它的能力优势能够抵消额外的等待和成本。相比之下,Step 5 Preview 能力只是与之相近,却要消耗更多的 Token、等待更久,开发者未必愿意买单。

再来看使用规模,我们主要参考调用量。

OpenRouter 最新数据(截至 2026 年 9 月 27 日)显示,周调用量前十里没有 Step 5 Preview。排名靠前的国产模型包括 DeepSeek V4.1 Flash、GLM 5.3 Flash 和 Hy4 Preview,几乎同期发布的小米 MiMo-V2.6-Flash 也排在第 8。需要说明的是,OpenRouter 的数据不能完全代表模型的总调用量,至少从这一公开渠道来看,Step 5 Preview 没有形成明显的使用规模。

阶跃并非没拿过热度,3 月,Step 3.5 Flash Free 借 OpenClaw 走红时,曾登上 OpenRouter 月榜第二。但热度没有沉淀成稳定的开发者生态,新模型出来之后,调用量也没能延续。

综合来看,Step 5 Preview 已经站到了开源第一梯队的门口,但位置不牢,使用规模也还没起来。而这个落差不是一次更新能解决的,需要阶跃的持续投入。

今年以来,阶跃在融资方面节奏很快。1 月完成超 50 亿元人民币 B+ 轮融资,同月,原旷视科技联合创始人印奇出任董事长;4 月完成股份制改造,5 月完成近 25 亿美元 Pre-IPO 融资并拆除红筹架构,6 月被曝出向港交所递交上市申请。印奇有过带旷视两度冲击上市的经验,此前也在千里科技操盘 "AI+ 汽车 " 资本运作,他入主阶跃之后半年内跑完股改、拆红筹、Pre-IPO 等流程,有从业者评价,这个节奏更像资本团队的打法,不像典型的技术公司。

估值上,阶跃 Pre-IPO 的目标估值约 100 亿美元,明显低于月之暗面约 500 亿美元的 Pre-IPO 投前估值,也低于深度求索约 450 亿美元的市场传闻估值。月之暗面有 Kimi 在 C 端的用户资产和 API 收入,深度求索则已经形成较强的开发者使用黏性,两家都拥有可以持续复用和增长的用户资产。阶跃的技术潜力虽然得到市场认可,但用户资产和收入结构不够清晰,估值自然低同行一档。

真正的检验是收入。阶跃星辰 2025 年收入约 5 亿元,智谱约 7.24 亿元,MiniMax 约 5.43 亿元。单看去年,三家大致处在同一量级。但今年,智谱和 MiniMax 的商业化明显提速,两家上半年收入就超过了各自去年全年。

更关键的是,要看收入来自哪里。

智谱 2026 年上半年收入 9.54 亿元,同比增长 399.7%。其中,开放平台及 API 收入 8.25 亿元,同比增长 2735.7%,占总收入的 86.5%。企业和开发者一旦接入就有持续调用。MiniMax 上半年收入 1.166 亿美元,同比增长 283.1%。开放平台及企业服务收入增长 703.1%,达到 7390 万美元,占总收入的 63.4%;AI 原生产品收入增长 100.9%,约 4260 万美元,用户订阅有明确的付费曲线。

两家的收入都积累在一个能持续复用的资产上,前者是调用需求,后者是用户付费。

而阶跃 2026 年预计收入约 12 亿元,与其他头部厂商差距明显,且没有公开拆分终端、API 和企业服务的占比,外界无法判断这部分收入是来自持续调用和续约,还是来自新增项目和一次性交付。这也是它 Pre-IPO 估值和同行有差距的原因。

02. 摊子铺得大,每一层都得闯关

同行各自跑出了主线,阶跃还在多线并进,这是它和其他几家最大的区别。

智谱把 GLM 系列开源做成了国内开发者的默认选项之一,再用 API 和企业服务把调用量变成收入;月之暗面用 Kimi 在 C 端建立了 " 模型即产品 " 的用户认知,长文本是它的标签;MiniMax 靠海螺和 Talkie 进入视频创作和情感陪伴,用户资产集中在内容和陪伴场景。

三家路径不同,共同点是先把一块生意做深、做出用户心智,再往外延伸。

阶跃走的是另一条路。它对外讲的故事是 " 全栈 ",底层做模型,中间做系统和智能体,再通过终端接触用户。

这套逻辑有过成功的先例。苹果通过硬件、系统和服务打通了从设计到分发的完整闭环,特斯拉则用车、FSD 和储能业务把数据和体验闭环握在自己手里,两家都把全栈跑通了。但成立的前提有两个:要么在某个环节握有议价权,要么全链路能形成数据和体验闭环。放到阶跃身上,模型在追赶头部、系统依赖合作方开放接口、终端从零建立认知,每一环都在跟更强的对手竞争,也都还没形成闭环。

先看模型。过去一个季度,阶跃密集更新了多条产品线,包括端侧 Step Edge、语音 StepAudio 3 系列、通用模型 Step 5 Preview。

通用模型 Step 5 Preview 相比前代确实有所提升,在代码、Agent 和长上下文任务上具备一定竞争力,但还没强到能改变开发者的选择。

大模型从业者崔明告诉「AIX 财经」,Step 5 Preview 面对的问题是能不能在拥挤的市场里换来用户。编程是目前大模型商业化最成熟的场景,智谱、月之暗面和阿里都已经积累了开发者和产品入口。阶跃即使阶段性追上,也可能很快被同行的新一轮更新反超,开发者很难因为一次的能力领先改变使用习惯。金融是阶跃重点强调的差异化方向,但月之暗面等厂商也在同步布局,阶跃同样需要面对正面竞争。

语音模型是阶跃少有能拿到 " 第一 " 的方向,这跟阶跃较早把资源投在实时对话和多模态语音有关。目前,阶跃的语音产品主要分为两类,一类是 TTS 模型,面向语音生成,适合配音、播报等场景;另一类是实时语音模型,能够处理停顿、打断和连续对话。

其中 9 月发布的 StepAudio 3 Realtime 在 Artificial Analysis 语音推理和对话动态两个榜单都排名第一。崔明认为,实时语音模型适合智能座舱、车载语音助手等对实时性要求较高的场景,而汽车也是阶跃推进 " 模型 + 终端 " 路线的重要入口,模型能力能够转化为产品能力。

图像模型的存在感很弱。崔明提到,阶跃早期的图像模型曾具备与字节竞争的能力,但字节依靠豆包获得了更大的用户入口,模型更新也更加频繁。阶跃没有形成足够的产品声量,同行持续迭代之下,它在图像方向的关注度逐渐下降。

阶跃的模型业务看起来很完整,语音、图像、文本和端侧能力都有布局,但目前还没有哪一项能力长期占据用户心智。如果模型不能持续转化为 API 调用、企业订单或终端使用,覆盖面越大,维护成本也越高。

模型之外,阶跃还要解决系统和智能体的问题。

阶跃推出了智能体操作系统 Step AOS 和个人智能体 Amoo。Step AOS 负责提供运行和调度环境,Amoo 则面向普通用户执行任务,主打跨应用操作、端云协同和跨设备接续。支付宝、美团、京东、滴滴等公司已经进入首批生态合作名单。

阶跃希望把自己的模型能力嵌入这套系统,但难点在执行上。如果智能体没有足够的权限,就很难完成任务,这需要合作应用开放接口。这一层的闭环卡在合作方的权限上。

第三层终端,是全栈路线里最重的一块。

阶跃一边给 OPPO、荣耀、中兴等厂商供应模型,据公司披露,截至 2025 年底,搭载阶跃模型的手机超过 4200 万台;另一边推出自有品牌 STEPX,首款手机 STEPX Neo 搭载 Step AOS 和 Amoo。

两边各有各的难关。给其他手机厂商供货,可以较快扩大预装量,但用户和渠道掌握在合作方手里。华为、小米等厂商都在加强自研端侧模型,华为的盘古 E 系列重点解决端侧推理的速度、功耗和隐私问题;小米则将 MiLM2 等轻量端侧模型纳入澎湃 OS 的子系统,通过端云协同把模型能力延伸到手机、汽车和家庭设备。终端厂商加强自研后,它们对外部模型供应商的依赖可能下降,阶跃的议价空间也会受到影响。

做自有品牌,则要从头解决量产、供应链、渠道、售后和品牌认知,在短期内需要大量的投入。

崔明认为,AI 和终端结合确实有价值,手机和汽车能够提供更自然的人机交互,也能让 AI 接触更多真实场景。但用户普遍已经形成了固定的品牌、系统和使用习惯。换一部手机,意味着迁移数据、重新适应操作方式,也意味着放弃一部分已经形成的使用惯性。用户未必会仅仅为了一个智能体功能,就承担这些迁移成本。

阶跃的三块业务本应层层传导,模型是底层能力,智能体把能力变成任务执行,终端提供用户入口。但也可能层层影响,模型的理解和执行能力不够,智能体的体验就上不去;智能体没能建立使用习惯,自有手机就少了一个购买理由;终端卖不动,模型和智能体也拿不到反哺数据的闭环。

上市让这些问题变得更紧迫。如今它面对的是更加严苛的资本市场,智谱和 MiniMax 今年 1 月上市后股价一度大涨,但 7 月基石解禁后遭遇连续回调,二级市场对大模型公司的定价更加务实。投资人关注的已经不只是模型能力和增长预期,还包括用户规模、收入来源以及商业模式能否持续。

因此,阶跃需要在挂牌前,拿出一项能够被验证的商业成果,让三条线中至少一条长出清晰、可续约的收入。

应受访者要求,李默、崔明为化名。

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容