关于ZAKER Skills GEO服务 合作
钛媒体 23分钟前

Sonnet 5.5 发布,智能水平超越 GPT-6 Astra,说好的减速呢?

文 | 字母 AI

口口声声呼吁减速的阿莫迪,一脚踩满了油门。

2026 年 9 月 26 日,Anthropic 发布了 Sonnet 5.5。不仅性能接近 Opus 5.5,价格还只有 Opus 5.5 的一半。

在 Artificial Analysis 给出的智能水平评分榜上,Sonnet5.5 更是超越了 GPT-6 Astra 以及 Anthropic 自己的旗舰模型 Claude Fable 5.1。

关键在于性价比,目前,Sonnet 5.5 几乎包圆了所有中等难度的任务,尤其是开发、科研和数学。除去那些非常简单的任务外,没有任何一款模型,能在性价比方面追上 Sonnet 5.5。

所以,说好的减速呢?

为什么它这么强还这么便宜?

Sonnet 5.5 的性能非常强。其在 Terminal-Bench 4.0 的成绩为 70.6%,上代 Sonnet 5 只有 10.3%。

在 GDPval-AA v2.1 上,它拿到 1844 分,距离 Opus 5.5 的 1846 分只差 2 分。CursorBench 4.0 是 55.5% 对 57.8%,同样接近于 Opus 5.5。

Anthropic 表示,虽然 Sonnet 5.5 性能和 Opus 5.5 接近,但是遇到需要持续判断、目标又不够明确的复杂工作,Opus 5.5 的效果会更好。

Sonnet 5.5 更适合日常任务,比如修 bug、迭代功能,以及做文档、幻灯片和表格。

Sonnet 是 Claude 家族里的轻量模型,它的性能本应该和旗舰模型差很多才对,但为什么 Sonnet 5.5 会突然变得这么能干?

从公开材料看,最明显的变化不是它记住了更多知识,而是它把任务做完的能力强了。

Anthropic 从 Sonnet 5 开始,就强化了推理、工具使用和编程,做事时更愿意调用工具并检查结果。到了 5.5,提升集中体现在智能体编程、电脑操作和视觉理解这些需要连续行动的环节。

它在 OSWorld 2.1 上从上代的 57.0% 提升至 80.1%,在不使用工具的图表识别测试 Chartography 上从 15.6% 提升至 61.6%。

也就是说,Sonnet 5.5 已经掌握了从屏幕里收集信息,再据此推进任务。

拿修 bug 来说,读懂代码只是第一步,模型想要完成整个修 bug 的任务,它还得找到相关文件、判断改动会影响哪里、调用工具修改,再确认问题是否解决。

任何一步出错,整道题都可能失败。

这就是为什么 Sonnet 5.5 在 Terminal-Bench 上的得分能大幅提升,它不是那种简单的 " 代码智商 " 暴涨,是通过这种收集信息的能力,让模型能完成整个链条。

一个猜想,Sonnet 5.5 可能也对 Opus 5.5 进行了蒸馏。在测试过程中发现,Sonnet 5.5 会说一些 Opus 5.5 才会出现的口头禅,比如 "You are right!"(你是对的)

Anthropic 在发布 Opus 5.5 时,就明确说过它改进了写作与沟通方式,"You are right!" 最具代表,Fable 5.1 从来不会说这个口头禅,但是 Sonnet 5.5 也开始说这个口头禅了。

那它为什么便宜?先看标价:Sonnet 5.5 每百万输入、输出 token 分别是 2 美元和 10 美元,正好是 Opus 5.5 的一半。5 分钟缓存写入是 2.50 美元对 5 美元,缓存读取都是 0.20 美元。

所谓 5 分钟缓存写入,指的是通过 API 首次发送一段会重复使用的提示内容时,让系统把它缓存起来,这次写入,就是按 "5 分钟有缓存 " 档位来计费的。

同时,Anthropic 还表示 " 每项任务最高便宜 30%",来自完成同一件事通常消耗更少 token。用同一价格、少走一些弯路,账单自然会变薄。

还是以编程来举例。

早期测试者观察到,Sonnet 5.5 比 Sonnet 5 更倾向于把工具调用成批处理。这就使得整体步骤更少,进而更省 token。

Anthropic 称,在 FrontierCode 的 High 档位上,它比上代同档位高约 10%,单任务成本却约为后者的 15 分之 1。

在一些评测中,Sonnet 5.5 用 Low 或 Medium 档位,就能以大约十分之一的任务成本超过 Sonnet 5 的最好成绩。

便宜的关键不只在每个 token 卖多少钱,还在模型为完成任务究竟花掉多少 token、绕过多少次工具。

此外,Sonnet 5.5 的输出速度也比 Sonnet 5 提高了 30% 以上。

以下为 Sonnet 5.5 和 Sonnet 5 速度、性能对比。

模型之外还有什么?

比起性能,Anthropic 如今更注重工程方面的提升。

比如 Fable 5.1,它就引入过防止提取推理内容的 Preserved Thinking。如今,这套机制也进入了 Sonnet 5.5,并且向前走了一步。

Anthropic 为 Sonnet 5.5 加上防止推理提取的安全分类器,同时把它产生的思考块绑定到创建它的账户或关联账户。

换一个不关联的账户重放,API 会丢弃该思考块,模型看不到先前的推理。不过这套防护系统,普通开发者根本不用管这套防护系统,因为它并不影响你阅读整个思考过程,Anthropic 主要想防的是那些想大规模蒸馏、反复调用来抽取模型能力的企业。

思考块的签名还与此前的对话绑定。

如果开发者改动已经发生的系统提示、工具定义或历史消息,再把旧思考块塞回去,新账户默认可能收到 400 错误。

正常追加对话通常不受影响,但那些习惯在后台悄悄改写历史的智能体框架,就得重新处理会话。

安全护栏也从 " 要不要拒绝用户过分的请求呢?",变成了 " 我该把这个问题交给谁回答?"。

Sonnet 5.5 的网络安全能力提升,因此高风险网络安全请求可能触发分类器,并被明显地回退给 Sonnet 5。

正常找 bug 和修 bug 仍可使用 Sonnet 5.5。

Claude API 上的服务端自动回退目前处于测试阶段,需要开发者启用。

Sonnet 5.5 遇到某些被安全系统拦下的请求时,不一定直接结束;如果开发者开启了 " 自动回退 ",系统会尝试换成 Sonnet 5 来回答。

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容