(本文作者为 AIX 财经,钛媒体经授权发布)
文 | AIX 财经(AIXcaijing),作者 | 雷晶,编辑 | 金玙璠
7 月的模型圈很热闹。
25 日凌晨,Anthropic 正式推出了新模型 Claude Opus 5。
这一次,Anthropic 没有强调 " 最强模型 ",而是给出更务实的定位:Opus 5在复杂任务上更少遗漏步骤、更倾向主动验证中间结果,在多项评测中兼顾性能与成本,适合日常高频使用。
定位的变化也直接体现在产品里,目前 Opus 5 成为 Claude Max 的默认模型,也是面向个人订阅用户(Max/Pro)可调用的最强模型;能力更高的 Fable 5 主要面向 API 与企业客户,个人订阅用户虽然可用,但额度相当有限。
从官方公布的成绩来看,Opus 5 重点提升了编程、知识工作和智能体任务的完成效率,在多项软件工程、商业流程和电脑操作评测中位居前列;在最高思考档位下,部分成绩已经逼近甚至超过 Fable 5。不过,在进攻性网络利用和长周期自主生物研究等高风险场景中,受限的 Mythos 5 仍然更强。
Opus 5 提供了可调节的 effort(思考档位),用户可按任务难度调整推理资源投入。档位越高,处理复杂问题的能力越强,但速度更慢、Token 消耗也更多;调低则省时省钱。
目前,Opus 5 已在全平台上线,API 价格为每百万 Token 输入 5 美元、输出 25 美元,与 Opus 4.8 持平,约为 Fable 5 的一半;追求速度可开 Fast 模式,以约两倍价格换 2.5 倍速度。
Anthropic 同时上线了两项 Beta 功能:动态调整工具与自动回退,用于降低 Agent 任务因缓存失效抬升成本、或因安全拦截中断的风险。
性能逼近、价格减半,那 Opus 5 能替代 Fable 5 吗?
我们先来看官方给出的成绩单。
为了突出模型的领先性,Opus 5 的对比对象选的是当前能力最强的几款模型:上一代 Opus 4.8、公开旗舰 Fable 5,以及 OpenAI 刚发布的旗舰模型 GPT-5.6 Sol。

类似优势也出现在需要模型连续操作的任务中。在 Zapier AutomationBench 测试中,按相同的单项任务成本计算,Opus 5 通过率约为第二名(Fable 5)的 1.5 倍。在 OSWorld 2.0 测试中,它仅用 Fable 5 单项任务成本的略多于三分之一,超过了后者最好成绩。
这些项目的共同点在于,测试的不只是模型能否答对一道题,还包括它能否调用工具、跨越多个步骤、发现错误并继续推进。

不过,Opus 5 并非在所有项目中都领先。在 Anthropic 公布的十余项对比中,有四项落后其他模型。
在 Humanity ’ s Last Exam 测试中,不用工具时,Opus 5 得 56.3%,略低于 Fable 5 的 56.5%;开放工具后 Opus 5 升至 64.7%,反超 Fable 5 的 63.9%。这更能说明两者差别:Fable 5 仍有更强的纯模型能力,Opus 5 更擅长搜索、调用工具、检查结果并持续推进任务。
Anthropic 披露的案例也符合这一特点。Opus 5 在没有图像查看工具的情况下,自行编写计算机视觉程序,从机械图纸的原始像素中提取数据;在缺少实时行情的情况下,主动搭建测试环境验证交易所数据接口是否正确。
从这些表现来看,Opus 5 此次升级的重点,与其说是纯模型能力的跃升,不如说是执行、验证和纠错能力变得更成熟。
当然,官方跑分需要谨慎看待。以 Frontier-Bench 测试为例,结果是在特定智能体框架下进行五次测试后取平均值,触发安全分类器时还会由 Opus 4.8 接管,说明工具配置、提示词和运行环境发生变化,结果也可能变化。
我们再来看看第三方榜单。
截至 7 月 25 日,Artificial Analysis 的智能指数榜单上,Opus 5 max 以 61 分排在第一位,仅高于第二名的 Fable 5 一分。该榜单综合 9 项评测,比单看某个优势项目更能反映综合能力。

所以,Opus 5 只是当前榜单上的领先者。跑分给出了能力上限,真实使用中的稳定性、Token 消耗和最终交付质量,才决定性价比究竟高不高。
模型上线后,评价很快两极分化。
正面评价集中在编程和可交互内容生成。有网友在 X 上分享 Opus 5 生成的可交互 3D 黑洞可视化器,还能实时合成一段电子音乐,代码、视觉效果和声音被整合进同一个成品,说明它快速制作产品原型的能力很强。




李默提到,实用的是两个 Beta 功能直接改善了 Agent 开发体验:过去改一次工具列表整段缓存就作废,现在对话中途换工具也不会失效;API 还可启用自动降级,被安全分类器拦截的请求会自动转交其他模型。
综合来看,Opus 5 目前更像一名执行力强、愿意自查,但还需要磨合的同事。它适合生成代码、修复问题和完成边界清楚的工作,但在复杂规划、长周期自主任务和部分文字表达上,Fable 5 仍有优势。
Anthropic 最近在加快模型更新速度。
5 月 29 日,发布 Opus 4.8;6 月 10 日,发布 Fable 5 和 Mythos 5;7 月 1 日,上线 Sonnet 5;7 月 25 日,发布 Opus 5,不到两个月,Claude 的主要产品线几乎更新了一遍。
在密集发布模型的情况下,行业对模型应该如何开放的分歧也在扩大。7 月 16 日,月之暗面发布开放权重模型 Kimi K3,性能被认为已接近前沿。几天后,OpenAI 战略负责人在 X 上预测,华盛顿会围绕中国开放权重模型制造 " 监管风险 ",这番话被广泛解读为对开源阵营的施压。
Opus 5 发布当天,英伟达、Meta、微软等 25 家公司和机构联合发表公开信,呼吁美国政府不要过早限制开放权重模型,OpenAI、Anthropic 和 Google 没有出现在签署名单中。
缺席不等于明确反对开放权重,但与开放权重相比,Anthropic 确实更强调闭源、分级开放和风险控制。6 月 12 日,美国政府对 Fable 5 和 Mythos 5 实施管制,两款模型一度全面下线。限制解除后,Fable 5 恢复公开服务,安全限制更少的 Mythos 5 仍只向部分获批机构开放。
Opus 5 的定位,正嵌在 Anthropic 这套 " 模型该如何开放 " 的策略里。它发现源代码漏洞的能力接近 Mythos 5,将漏洞转化为实际攻击工具的能力却明显较弱。对 Anthropic 而言,它不只是更便宜的 Fable 5 替代品,也是一个更容易在合规框架下向普通用户和企业开放的选项。

从密集发布模型,到扩充芯片供给,再到精简系统提示词,Anthropic 做的不仅是提高跑分,而是把模型能力拆分到不同价格、风险和使用场景中:Fable 5 负责更复杂、更长周期的任务,Sonnet 5 承接成本敏感的普遍需求,Opus 5 则试图成为开发者和知识工作者的日常默认选择。
所以,Opus 5 没有让 Fable 5 失去意义。后者仍代表 Anthropic 公开可用的模型能力上限,Opus 5 解决的是如何以更低成本,把接近旗舰的能力交给更多用户。它的竞争力在于能否以更稳定的表现、更少的人工接管和可以控制的成本,把一项工作真正完成。
* 题图来源于 Anthropic 官网。应受访者要求,李默为化名。