【CNMO 科技消息】9 月 29 日,Claude Sonnet 5.5 正式上线后的多项测试数据陆续公布。相比单纯关注新模型发布,更值得关注的是它的实际性能和成本表现:Anthropic 公布的 Terminal-Bench 4.0 成绩达到 70.6%,而独立评测机构 Artificial Analysis 测得其在最高推理强度下的综合 Intelligence Index 为 56 分,同时单个测试任务平均成本达到 7.60 美元。

从模型能力来看,Sonnet 5.5 在 Terminal-Bench 4.0 上拿到 70.6%,明显高于上一代 Sonnet 5 的 10.3%,也高于 Opus 5.5 的 66.4%。在 CursorBench 4.0 中,Sonnet 5.5 得分 55.5%,Sonnet 5 为 34.1%;在 GDPval-AA v2.1 知识工作测试中,Sonnet 5.5 达到 1844 分,与 Opus 5.5 的 1846 分仅相差 2 分。



因此,Sonnet 5.5 目前呈现出的特点比较明确:模型本身的 Token 单价没有变化,但在部分实际任务中,可以通过减少 Token 消耗、工具调用和重复执行来降低整体成本;而当 Effort 拉到最高水平后,模型为了追求更高完成度会消耗大量 Token,单任务成本也随之上升。对于开发者来说,真正值得关注的并不是 " 每百万 Token 多少钱 ",而是完成一个有效任务究竟需要多少 Token,以及不同 Effort 设置下的性能成本比。