关于ZAKER Skills 合作
钛媒体 10分钟前

Anthropic 发布 Opus 5,性能直逼 Fable 5,价格却只有一半?!

文 | 字母 AI

Anthropic 真是 " 疯 " 了。

就在刚刚,新模型 Opus 5 发布,性能直逼旗舰模型 Fable 5,价格却降了一半。

5 月 28 日,Claude Opus 4.8 发布。12 天后,能力更强的 Fable 5 和 Mythos 5 登场。6 月 30 日,Sonnet 5 上线。到了 7 月 24 日,Anthropic 又发布了 Opus 5。

短短 57 天,这家公司几乎把 Claude 的几条主要产品线都更新了一遍。即便放在模型按月迭代的 AI 行业里,这个速度也有些夸张。

其中最让人意外的,是 Fable 5 和 Opus 5 之间只隔了 45 天。

Fable 5 刚发布时,是 Anthropic 面向普通用户开放的能力标杆。正常情况下,这样一款模型至少应该在聚光灯下多待一阵。Opus 5 却很快追了上来。

Anthropic 简直就是在高喊:" 打败 " 我自己的只能是我自己!

Anthropic 这轮更新也紧贴着 OpenAI 的节奏。7 月 9 日,OpenAI 刚刚发布 GPT-5.6,并在官方评测中把 Fable 5 列为主要参照模型之一。15 天后,Anthropic 发布 Opus 5,又将 GPT-5.6 Sol 放进核心对比,在陌生问题求解、电脑操作和商业流程等项目中展示自己的优势。

在产品发布和官方宣传上,两家公司追着对方出牌的意味已经十分明显。

Opus 5 究竟是何方神圣?来看看 Anthropic 这次公布了什么。

性能与性价比

Claude Opus 5 的价格与上一代 Opus 4.8 相同,性能却有了大幅提升。

Anthropic 展示了 Opus 5 在不同 " 投入档位 " 的表现。用户可以自己调整,简单任务可以选更省钱、更快的模式,遇到难题时再提高档位,换取更好的结果。

从 Anthropic 的披露看,Opus 5 尤其擅长处理具有实际价值的软件工程任务。

例如,在 Frontier-Bench v0.1 评测中,Opus 5 超过了所有其他模型;与 Opus 4.8 相比,它完成每项任务的成本更低,成绩却提高了一倍以上。

在 CursorBench 3.2 评测中,当投入档位设为最高时,Opus 5 与 Fable 5 最高得分之间的差距不到 0.5%,每项任务的成本却只有 Fable 5 的一半。

在 high、xhigh 和 max 三个投入档位下,按照相同成本比较,Opus 5 的表现也超过了所有其他模型。

在知识工作和问题解决任务中,Anthropic 也观察到了类似结果。例如:

在 ARC-AGI 3 这类 " 陌生题 " 测试中,模型拿不到现成套路,只能自己摸索规则、判断目标并调整策略。Opus 5 的得分达到第二名的 3 倍,说明它遇到从未见过的问题时,更有能力靠试错找到解法。

类似优势也出现在真实工作流程中。

AutomationBench 要求模型调用商业软件,从头到尾完成一项任务,Opus 5 的通过率约为第二名的 1.5 倍;即使使用最低投入档位,也超过其他模型的最高成绩。

也就是说,Opus 5 不用付出最高的推理成本,也能完成更多任务。

在电脑操作测试 OSWorld 2.0 中,Opus 5 同样在各个成本区间领先。它只花费略高于 Fable 5 三分之一的成本,成绩就超过了 Fable 5 的最高水平。

这意味着,Opus 5 在打开应用、查找信息、跨软件操作并持续推进任务时,效率明显更高。

这种特点在其他评测中也很明显。

HLE 考察跨学科难题,不调用工具时,Opus 5 以 56.3% 略低于 Fable 5 的 56.5%;允许使用工具后,它升至 64.7%,反超 Fable 5 的 63.9%,成本也更低—— Opus 5 单靠模型内部知识未必总是第一,但一旦可以搜索、调用工具和反复核对,优势就会扩大。

在模拟真实知识工作的 GDPval-AA v2 中,它最高得分 1861,高于 Fable 5 的 1747 和 GPT-5.6 Sol 的 1736。大约花 700 美元,就能达到其他模型最高投入档位附近的成绩。DeepSearchQA 上的领先幅度较小,但同样以更低成本取得了略高的通过率。

Opus 5 在 Anthropic 全部生命科学评测中都超过 Opus 4.8,其中光谱推断分子结构和预测蛋白质变异影响两项任务分别提高 10.2 和 7.7 个百分点。这些提升意味着,Opus 5 在辅助分子结构分析、蛋白质功能预测等科研环节上更有潜力。

Anthropic 还用两个可交互的演示展示了 Opus 5 的视觉生成能力。第一个是一个可以实际操作的三维风洞:用户能够旋转汽车、调整风速,观察气流如何绕过车身,同时查看阻力系数等数据。第二个是一个三维动物细胞模型,用户可以转动、剖开细胞,点击细胞核、粗面内质网等结构查看说明,页面还会主动指出示意图为了便于展示做了哪些简化。

从这两个案例看,Opus 5 已经能把代码、三维建模、交互界面和知识讲解整合进同一个成品里。用户给出一段要求后,它可以直接搭出接近教学软件或产品原型的演示。

安全与对齐

Anthropic 用了几个案例说明 Opus 5 比此前模型更会独立推进任务。

一次测试要求模型根据机械零件图纸,用代码重建一个 FreeCAD 三维模型,但系统没有提供直接查看图纸的工具。Opus 5 干脆自己写了一套计算机视觉程序,从原始像素中提取尺寸和几何结构,随后完成了建模。

同样条件下,其他模型连续尝试 5 次也没有成功。

另一次任务来自一个流行的开源软件包管理器。Opus 5 查出了程序错误的根本原因,还补上了社区修复方案遗漏的边缘情况。

参与对比的另一款模型只消除了表面症状,随后便宣布问题已经解决。

一家交易公司的工程师还让 Opus 5 为新交易所搭建市场数据系统。此前的模型即使拿到详细方案也无法完成,Opus 5 找不到实时数据用于验证,便自行做了一套测试工具检查代码。

这些案例展示了 Opus 5 的进步,也解释了 Anthropic 为什么花了很大篇幅讨论安全。

模型开始自行补工具、检查结果、修正错误后,人类需要确认它不会为了完成目标隐瞒问题、绕过限制,或者做出风险过高的决定。

Anthropic 称,Opus 5 是目前对齐表现最好的 Claude 模型。

上线前的自动化审计显示,与 Opus 4.8、Sonnet 5 和 Fable 5 相比,它更能遵守 Claude 宪法,欺骗行为更少,也更难被诱导执行有害请求。

" 对齐 " 说得直白一些,就是模型能力提高以后,做事方式仍符合开发者设定的规则。

网络安全领域最能体现这种两难。

Anthropic 没有专门用攻击任务训练 Opus 5,但模型综合能力提高后,它寻找代码漏洞的水平已经接近 Mythos 5。

两者在发现漏洞时表现相近,到了编写漏洞利用程序、把缺口转化成实际攻击手段的阶段,Opus 5 仍明显落后。它已经很会检查哪里出了问题,真正利用这些问题发动攻击的能力仍受到限制。

Opus 5 可以继续检查源代码和寻找漏洞,二进制漏洞扫描、渗透测试及漏洞利用程序生成则会被拦截。

相比 Fable 5,新分类器触发干预的频率预计减少约 85%,正常的安全研究更少被误伤。

触发限制后,Claude.ai、Claude Code 和 Claude Cowork 会默认改用 Opus 4.8 处理请求;加入网络安全验证计划的企业和研究人员,可以使用限制较少的版本。

生物学领域也采用了类似安排。Opus 5 成为 Anthropic 面向普通用户开放的最强科研模型,但在需要长时间独立运行的研究任务中仍有明显局限。

此前在 Fable 5 上因安全限制被拦截的生物学请求,现在会先转交给 Opus 5 处理。普通科研问题因此能用上更强的模型,高风险任务仍然留在安全边界之外。

加量不加价

Opus 5 可以算是一次 " 加量不加价 "。

它延续了 Opus 4.8 每百万输入 Token 5 美元、输出 Token 25 美元的价格。

但正如前文所述,在多项编程和智能体测试中新模型完成率更高,单位任务成本反而下降。

横向来看,它最直接的对手是 OpenAI 旗舰模型 GPT-5.6 Sol,两者输入价格相同,Opus 5 的输出价格低约 17%。

处理超长资料时,Opus 5 的价格优势还会更明显。Anthropic 对最高 100 万 Token 的上下文维持普通单价。GPT-5.6 Sol 的输入超过 27.2 万 Token 后,整次请求的输入价格翻倍,输出价格提高 50%。

对于大型代码库、长篇研究资料和复杂智能体任务,这项差异会直接反映到账单上。

按照 Anthropic 公布的评测,Opus 5 虽然没有在所有项目中胜过 GPT-5.6 Sol,但在电脑操作、商业流程和陌生问题求解等需要模型连续做事的任务上,表现和价格都更有竞争力。

用 Anthropic 的话说,Opus 5 专为日常使用而设计,它比其他型号效率更高。如今,这款新模型成为了 Claude Max 的全新默认型号,也是 Claude Pro 的最强型号。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容