关于ZAKER Skills 合作
明亮公司 昨天

GPT-6 开启新叙事:Coding 之后,比长程任务执行

作者:MD

出品:明亮公司

美东时间 9 月 3 日,OpenAI 发布了 GPT-6 Astra。

按照 OpenAI 官方说法,Astra 是其 " 最智能、最对齐 " 的旗舰模型,能力重点覆盖 Computer Use、软件工程、数学与科学、专业办公、网络安全等场景。

这次发布的市场反馈明显好于 OpenAI 过去几次模型更新。据 Latent Space 整理,Astra 发布约 9 小时后,相关内容浏览量已达 3600 万,点赞数 16.4 万,是 OpenAI 自 Sora 以来最受关注的一次发布。更重要的是,Astra 被市场视为 OpenAI 对 Anthropic Fable 5.1 和 Opus 系列进展的正面回应。

模型发布声量(来源:Latent Space)

从能力披露看,OpenAI 给出的核心表述是:" 任何你能在电脑上完成的事,Astra 都可以替你完成。"这也反映出,模型竞争的重心正在从聊天、写作、代码生成,进一步转向电脑操作、长程 Agent 和端到端任务交付。

评测方面,Astra 在 Terminal-Bench 4.0、OSWorld 2.0、AutomationBench、FrontierMath Tier 4、ARC-AGI-3、ExploitBench 等评测中取得高分,其中 OSWorld 和 AutomationBench 更值得关注,因为它们衡量的是模型在真实软件环境和专业工作流中的执行能力。

来源:OpenAI 网站

但 Astra 的发布也伴随争议。外部评测显示,它在 Coding 智能体、Computer Use 和长程知识工作中表现突出,但在通用智能指数上并未全面领先 Claude Fable 5.1;同时,由于 token 单价较 GPT-5.6 Sol 显著上升,其成本优势高度依赖具体任务和运行框架。另一方面,OpenAI 系统卡披露 Astra 在对齐表现上改善,但链式思考可监控性下降,引发安全研究者关注。

「明亮公司」结合券商观点总结发现,目前对 GPT-6 Astra 的影响已经形成几项基本共识:

第一,模型竞争正在从 " 聊天 / 写代码 " 转向端到端执行,Computer Use 与长程 Agent 成为前沿模型的新主线,能力边界正从对话框扩展到真实工作流。

第二,Astra 在单 token 价格上升的同时,强调特定场景下的任务成本下降,这意味着头部模型并未失去定价权,反而可能通过更高完成率、更少返工和更短执行时间重新获得溢价,早前 " 价格战会持续侵蚀商业模型 " 的担忧被部分证伪

第三,无论是训练侧十万卡级别投入,还是推理侧为 Agent、Computer Use 和安全监控配置更大集群,GPT-6 都再次强化了算力长期需求逻辑。

第四,OpenAI 在 Coding 和 Agentic Coding 上的表现明显追近 Anthropic,行业竞争从此前 "Anthropic 单方面领先 " 的叙事,重新回到 OpenAI 与 Anthropic 胶着竞争的格局。

而分歧则主要集中在三处。

第一是架构变化对存储需求的影响。若 Recurrent Depth 确实通过层复用和隐藏空间推理实现 " 用计算换存储 ",它可能改变推理侧算力结构,进而削弱部分 HBM/DRAM 需求弹性。

二是对市场影响的方向,硬件侧预期已经较充分,而 AI 软件开始进入 " 算利润、看兑现 " 的阶段。

第三是 Benchmark 的可信度和安全约束。多数高分来自研究环境或特定 Harness,官方对比也未完全覆盖 Muse Spark 1.3 等竞争模型;同时,Astra 达到 Critical 级网络安全能力后,监控、拒答和权限限制可能影响实际可用性。

GPT-6 三层核心变化:训练方式、技术架构、产品能力

GPT-6 Astra 的第一层变化是训练方式。

据多家券商,Astra 基于 OpenAI Stargate 德州站点超过 10 万颗 GPU 训练,是 OpenAI 迄今最大规模的一次训练。据申万宏源,Astra 首次大规模引入前代模型 GPT-5.6 Sol 参与训练监督,训练后期系统可以自主连续运行。申万宏源将其称为递归自我改进的雏形。更直接地说,上一代模型开始参与下一代模型的训练和维护,模型迭代从单次训练,开始转向更连续的系统工程。

第二层变化是技术架构。

据天风证券和西部证券,Astra 可能采用 Recurrent Depth 或 Looped Transformer 架构,即同一组 Transformer 层可以被反复调用,模型将部分推理过程放在隐藏空间中完成,而不是把每一步都展开成可见文字。

这个变化有两个结果:一方面,它可能减少显式 token 消耗,提高复杂任务中的执行效率;另一方面,推理过程更难被外部观察,安全监控和可解释性成本上升。据天风证券,OpenAI 为此额外投入约 20% 的推理算力用于监控。OpenAI 在官方介绍中也承认,Astra 的书面推理比 GPT-5.6 Sol 更难监控。此外,有分析也指出,目前这种在隐空间的推理可能使 " 蒸馏 " 的难度增大。

第三层变化是产品能力。

OpenAI 把 Astra 称为 " 世界上最好的 computer use 模型 "。据 OpenAI 介绍,Astra 可以填写在线表格、更新 CRM 客户记录、整理日历、进行在线研究并写入邮件或文档编辑器,也可以分析科学数据、生成图表、创建网站、运行前端 QA、安装和测试软件,并处理屏幕上出现的问题。这些例子比传统跑分更能说明 GPT-6 的产品方向,即模型开始进入软件界面、工具链和业务流程。据中信证券、华泰证券等机构判断,头部模型的竞争重点正在从普通对话和单点 Coding 能力,转向长程 Agent 和 Computer Use。

成本再定义:从 Token 到任务能力

GPT-6 的价格本身,是这次发布最有信息量的部分之一。

据 OpenAI 披露,Astra API 标准价格为每百万输入 token 10 美元、每百万输出 token 50 美元。按中信证券测算,这一价格较 GPT-5.6 Sol 当前促销价上涨约 2.5 倍。这也说明,OpenAI 并没有用低价抢市场,而是选择把旗舰模型重新放回高价区间。

这背后是计价口径的变化,过去模型公司更多按 token 收费,市场也习惯用每百万 token 价格衡量模型经济性。但 OpenAI 这次强调的是单任务成本。

据 OpenAI 披露,在 Terminal-Bench 4.0 中,Astra 相对 5.6 Sol 和 Fable 5.1,分别以约低 9% 和低 63% 的估算 API 成本完成任务;在 Terminal-Bench Science 0.1 中,Astra 得分 64.6%,高于 Claude Fable 5.1 的 52.6%,同时估算 API 成本低约 31%;在 BenchCAD 中,Astra 达到 95.9% 的几何重合分数,相比 Sol 和 Fable 5.1 的估算 API 成本分别低约 43% 和 86%。

这说明 OpenAI 并不试图证明 Astra 的 token 更便宜,而是证明它在特定任务里更少绕路、更快完成、更少返工。

对企业客户来说,单 token 价格只是成本的一部分。如果模型需要更多轮交互、更多人工校正,或者在最后一步失败,便宜 token 并不一定带来低成本。反过来,如果一个更贵的模型能一次性完成复杂任务,它的总成本可能更低。

但这个说法仍需要区分场景。据 Artificial Analysis,Astra 在 Coding 智能体任务上的 token 效率较 Sol 提升约 70%,部分 Codex 框架下的成本效率处于前沿;但同一机构在通用智能指数中测算,Astra 输出 token 仅减少约 10%,由于单价上涨,单任务成本反而比 Sol 高 75%。这意味着,"GPT-6 更便宜 " 不是通用结论。它在 Codex、Computer Use 和特定 Agent 框架下更有可能成立,在裸 API 和通用问答场景中未必成立。

结合上述变化可以理解,OpenAI 同步更新 Codex harness 的原因。

据 OpenAI 介绍,Astra 结合新的 Codex harness 后,在 Mind2Web 基准上的任务完成速度较当前 GPT-5.6 Sol 体验提升 1.9 倍;在 Codex 中,Astra 还可以通过跨上下文笔记保存长期任务细节,减少过去长会话压缩造成的信息丢失。

模型叙事转变起点:从 Coding 到任务交付

过去一年,Coding 能力是前沿模型竞争的核心。Anthropic 正是靠 " 赌对 "Coding 这一方向,成为了历史上最快达到万亿美元市值 / 估值的公司之一,而且,在二级市场上的开源模型公司,也多因 Coding 收获了上市后投资者的认可。

此前,OpenAI 用 GPT-5.6 Sol、Codex 和 ChatGPT 开发者生态追赶。但 GPT-6 发布后,这个叙事可能发生变化——Coding 更像是端到端任务的一部分,而不是终点。

原因很简单,会编程,不等于能完成工作。或者说,编程只是工作 / 任务中高价值的一环。

据 OpenAI 介绍,Astra 在 Codex 中可以跨上下文检索前序窗口中的需求、测试结果和工具输出,避免在长时间调试或大型重构中丢失关键细节。

Jane Street 相关负责人就在发布中的信息中表示,Astra 在内部编码基准和交易直觉评估中较 GPT-5.6 Sol 有明显提升,用于 agentic coding 时,生成代码达到生产质量所需迭代更少。

这正是大模型产品形态的变化。过去模型更多是 " 回答者 ",现在头部公司希望它变成 " 执行者 "。

据 OpenAI 介绍,Astra 可以在指令不完整时补足常规信息,在关键决策前提问;在 Codex 中,它可以异步提问,同时继续处理不依赖用户回复的部分。这类能力比单次回答准确率更接近企业使用场景,因为真实工作很少是一次性、结构化、边界清晰的。

这也反映出 AI 大模型下一程叙事的方向。

据华泰证券,顶级模型竞争已经转向长程 Agent,小模型则在追平上一代旗舰。这意味着模型市场开始分层,旗舰模型处理复杂任务和高价值工作,中端模型覆盖多数生产需求,小模型承担低价、高频调用。

OpenAI 此前对 Sol 降价,更像是为 GPT-6 发布做产品分层,而不是前沿模型失去定价权。Astra 价格重新站上高位,也可能继续证明,最前沿模型仍然可以通过复杂任务获得溢价,而这意味着中国的大模型厂商也将迎来变化。

对中国大模型公司的叙事影响:差距在任务执行层

在 GPT-6 发布前,中国头部模型刚完成一轮追赶。2026 年 7 月至 8 月国产模型密集发布后,头部国产模型已经接近上一代前沿模型水平,Kimi K3 在部分 Coding 榜单表现突出,国产模型在 OpenRouter 上的调用份额也有提升。这说明,中国模型公司在普通对话、中文场景、部分 Coding 能力和低成本调用上,已经具备较强竞争力。

但 GPT-6 Astra 把前沿差距重新拉到执行层。

如前文所述,Astra 的一些表现得分明显提高。

这些提升集中在长程任务、软件操作、终端任务和专业流程上。这恰好是国内模型公司仍需补齐的地方。

据中金公司此前评价,部分国产小参数模型除长程任务外,大部分日常任务已经可以较好运转。国产模型在多数日常任务上已经不弱,但在长程 Agent、Computer Use 和闭环执行上仍有短板,而GPT-6 主打的正是这些能力。

一些观点甚至认为,短期看中国模型公司和 OpenAI 的差距可能在执行层重新扩大,而不是在所有维度同时扩大。

但这种差距并非无法追赶,据天风证券,Recurrent Depth 和 Latent Reasoning 并非完全封闭路线,国内外已有相关论文和开源实践;Astra 的提升也不完全来自更大的知识库,而与后训练、强化学习、工具调用和工程系统相关。国产模型公司过去在后训练和工程优化上有较快追赶速度。

9 月 4 日收盘,智谱(02513.HK)股价跌 2.98%,MiniMax(0100.HK)股价涨 1.8%,两家模型公司的股价并未大幅波动。

| 发福利!添加下方明亮公司主编微信有惊喜!

估值叙事

从寒武纪走势看摩尔线程、沐曦股份袁记食品和老乡鸡阿里 " 千问 " 补课雷军的声量,小米的估值英矽智能 AI 制药泡泡玛特做家电理想 L9 Livis 的 AI 豪赌蔚来击穿估值折价|美光与 AI 瓶颈叙事腾讯市值叙事拐点|MiniMax 和智谱的估值锚阿里的「割裂叙事」智谱与 Anthropic垣信卫星的估值锚 | Momenta 的「物理 AI」叙事MiniMax 重估的关键指标|Kimi 和 DeepSeek 的估值溢价 | 联影构建 AI 资产| Kimi 寻求独立叙事|估值不依赖 SOTA | 蓝箭航天该对标谁靠数据重估蚂蚁阿福如祺出行做 AI 基础设施|蜜雪暂别增长 | 瑞幸市值首超蜜雪

资金叙事

AI 交易加剧量化脆弱性

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容