OpenAI 宣布推出新一代人工智能模型 GPT-6 Astra,并将其定位为公司迄今智能水平和对齐能力最高的模型。Astra 目前首先向部分机构开放,并将在未来数日逐步覆盖 ChatGPT Plus、Pro、Business 和 Enterprise 用户,同时登陆 OpenAI API、微软Azure 和亚马逊AWS Bedrock。
此次升级的重点已不仅是传统问答能力,而是进一步强化计算机操作、软件开发、科学研究、网络安全以及复杂专业工作。OpenAI 公布的多项测试显示,Astra 相较上一代 GPT-5.6 Sol 在计算机操作、编程和科研任务上出现明显提升,并尝试把模型能力进一步转化为可执行的企业级自动化工具。
从商业化角度看,Astra 正在把大模型竞争进一步推向 " 直接完成工作 " 的阶段。OpenAI 称,新模型能够操作软件、填写在线表单、维护客户关系管理系统、整理日程、进行网络研究,也可以直接处理科学数据、制作图表、开发网站和执行前端质量检查。
计算机操作能力明显提升,单项任务耗时下降近一半
OpenAI 此次重点强调了 Astra 的计算机操作能力。
在模拟真实专业软件环境的 Agents ‘ Last Exam 测试中,GPT-6 Astra 得分 59.3%,高于 GPT-5.6 Sol 的 53.6%,也高于 Claude Opus 5 的 55.5%。OpenAI 称,在最高得分配置下,Astra 使用的输出 Token 数量比 Claude Opus 5 少约 65%。
在 OSWorld 2.0 测试中,Astra 得分 72.6%,高于 GPT-5.6 Sol 的 65.7%。与此同时,完成单项任务的模拟耗时从 Sol 的大约 75 分钟降至 40 分钟左右,缩短约 47%。
OpenAI 还同步升级了 Codex 的计算机操作体系。结合 Astra 本身的效率提升,公司称,在 Mind2Web 测试中,新组合的任务完成速度达到目前 GPT-5.6 Sol 体验的约 1.9 倍。
这意味着 OpenAI 正在把模型竞争从 " 谁回答得更好 ",逐步推进到 " 谁能更快、更稳定地在真实软件环境中完成整套工作流程 "。
企业级文档、表格和演示文稿成为重点应用场景
除了计算机操作,Astra 明显加强了针对专业办公环境的训练。
OpenAI 称,新模型能够处理多步骤专业任务,并直接生成文档、电子表格和演示文稿,同时更好地遵循企业已有模板、排版标准和视觉风格。模型还被专门训练为只提取与任务真正相关的信息,减少无关内容重复。
在 BenchCAD 测试中,Astra 借助工具完成三维物体重建时取得 95.9% 的几何重合度,高于 GPT-5.6 Sol 的 83.3% 以及 Claude Fable 5.1 公布的 84.3%。OpenAI 称,在相关测试配置中,Astra 的估算 API 成本分别低约 43% 和 86%。
这部分升级对于 OpenAI 的企业业务尤其重要。随着大模型能力逐渐趋同,企业客户越来越关注的已经不是模型能否生成文本,而是能否直接嵌入财务、法律、工程、数据分析和内容制作流程,并减少人工二次修改。
编程能力继续提升,Codex 强化长期任务处理
OpenAI 同时将 GPT-6 Astra 称为公司迄今最强的软件工程模型。
在 Terminal-Bench 4.0 测试中,Astra 得分 57.9%,明显高于 GPT-5.6 Sol 的 37.3%,并略高于 Claude Fable 5.1 的 55.8%。OpenAI 称,在相应测试配置下,其单项任务 API 成本也低于对比模型。
Astra 还为 Codex 引入新的长期上下文处理机制。过去,当一次编程任务持续时间过长、上下文空间被占满时,系统通常会将此前内容压缩成摘要,而压缩过程可能丢失失败原因、测试结果或组件行为等细节。
按照 OpenAI 的介绍,Astra 可以在不同上下文之间保存工作记录,并重新搜索此前的需求、测试结果以及工具输出,从而减少长时间调试和大型代码重构过程中出现的信息损失。
科学与网络安全能力进一步提升
Astra 此次另一项明显升级来自科学研究。
在 Terminal-Bench Science 0.1 中,Astra 取得 64.6% 的完成率,高于 Claude Fable 5.1 的 52.6%。OpenAI 称,在该测试配置中,其估算 API 成本低约 31%;在一个成本更低的配置下,Astra 得分 61.1%,而 GPT-5.6 Sol 的最高成绩为 22.4%。
在 GPQA Diamond 研究生级科学推理测试中,Astra 得分 96.0%。OpenAI 还表示,模型能够直接操作专业科研软件,对数据进行检查、分析和可视化。
但更值得关注的是网络安全能力的跃升。
OpenAI 表示,Astra 已经达到其《Preparedness Framework》中的网络安全 "Critical" 级别。在没有生产环境安全限制的测试中,Astra 在 ExploitBench 取得 100% 的成绩,高于 GPT-5.6 Sol 的 78.5%;在 ExploitGym 中成功率达到 42.4%,Sol 为 30.3%。
在针对 2026 年 6 月至 8 月新近漏洞设计的测试中,OpenAI 称 Astra 甚至发现并利用了两个此前未知的零日漏洞,公司正在将这些漏洞披露给相关软件维护方。
正因如此,OpenAI 此次也同步强化了安全限制。正式上线版本可以用于安全代码审查和漏洞修复,但会拒绝部分更高级别的攻击性网络安全请求,例如直接创建漏洞概念验证攻击代码。
安全对齐成为此次发布的另一条主线
相比此前单纯强调能力提升,OpenAI 此次对 Astra 的安全和行为边界给予了更多篇幅。
公司称,在一项测试模型是否会超出授权范围的内部评估中,没有生产安全措施保护的 GPT-5.6 Sol 有 48% 的情况会超出预定目标,而 GPT-6 Astra 在该测试中的比例为 0%。
在另一项计算机操作安全压力测试中,Astra 出现不符合预期结果的比例为 2.4%,低于 Claude Fable 5.1 的 9.5% 和 Claude Opus 5 的 11.5%。
不过,OpenAI 同时披露了一个潜在问题:部分评估显示,Astra 的书面推理过程比 GPT-5.6 Sol 更难监控。公司称,这是由于 Astra 在较简单任务中能够使用更少的显性推理步骤完成问题,目前提升模型行为的可监控性仍是研究重点。
API 定价每百万输入 Token 10 美元,输出 50 美元
商业化方面,GPT-6 Astra 将直接进入 OpenAI 现有订阅体系。
Plus、Pro、Business 和 Enterprise 用户将在未来数日陆续获得访问权限,Astra 的使用量将计入现有订阅额度,用户和企业也可以额外购买使用额度。Pro、Business 和 Enterprise 用户还将获得 GPT-6 Astra Pro 版本。企业管理员需要主动开启 Astra,发布初期默认处于关闭状态。
开发者可以通过 OpenAI API 调用 gpt-6-astra,微软 Azure 以及亚马逊 Bedrock 也将提供该模型。
OpenAI 公布的 API 标准价格为每百万输入 Token 10 美元、每百万输出 Token 50 美元,缓存读写另行计费。此外,公司还提供 Fast 模式,处理速度最高可以达到标准模式的两倍,但价格也是标准模式的两倍。
从此次发布可以看出,OpenAI 对下一阶段大模型商业化的定位正在进一步变化:单纯提升推理基准已经不是唯一重点,计算机操作、软件开发、企业办公、科学研究和自动化执行能力正在成为新的竞争核心。
GPT-6 Astra 能否进一步扩大 OpenAI 在企业 AI 市场的领先优势,最终仍取决于这些测试中的能力能否稳定转化为实际生产效率,以及企业客户是否愿意为更高等级的自动化执行能力支付额外成本。