
作者 | 程茜
编辑 | 心缘
智东西 9 月 29 日消息,今日凌晨,Anthropic 发布 Claude 5.5 系列第二款模型 Claude Sonnet 5.5,主打快速、高性价比。
Anthropic 在博客中透露,相比 Claude Sonnet 5,新模型速度提升超 30%,成本降低近 30%,更擅长处理日常任务,如修复错误、创建文档、制作幻灯片和电子表格等。






Anthropic 还透露,其专为高并发和成本敏感的应用而设计的 Claude Haiku 5.5,将在未来几周发布。
一、数位开发者实测对比,效果惊艳但烧不起,一款射击游戏花费上千元
不少开发者实测对比了 Sonnet 5 和 Sonnet 5.5,两代模型之间的性能提升幅度肉眼可见。
官方案例,知名开发者 @_re_pete 对比了 Sonnet 5 和 Sonnet 5.5 生成落叶模拟器的效果。可以看出,Sonnet 5.5 的落叶飘落效果更自然,整体画面更和谐。
在不到一分钟内,开发者 @kevin_t_ngo 让 Sonnet 5.5 通过 JavaScript 动画展示了恐龙的历史,其还对比了 Sonnet 5 和 Sonnet 5.5 的生成结果。Sonnet 5.5 生成的动画主题形象明确,还能添加配套文字,生成带叙事感的完整插画。
另一开发者对比了 Sonnet 5.5 与 GPT-6 Sol、GPT-6 Astra 的效果,其与 GPT-6 Astra 的差距并不大。Sonnet 5.5、GPT-6 Astra 在生成骑自行车动作时没有出现太大瑕疵。
不过效果惊艳背后,用户实测发现 Sonnet 5.5 的成本并不低。
BridgeMind 使用 Sonnet 5.5 制作了一款射击游戏,它称新模型表现机器出色,生成的游戏堪称神作,但构建成本要达到 177 美元(约合人民币 1187 元),耗时 49 分钟完成。
在下面开发者制作的城市模拟器案例中,Sonnet 5.5 的效果明显比 Sonnet 5 更好,Sonnet 5.5 的输出 token 数量为 38 万,花费了 9.23 美元,Sonnet 5 为 12 万,花费 4.85 美元。
另一开发者使用 Sonnet 5.5 制作了一个果酱西瓜浏览器动画,最终预计的 API 使用成本约为 8.20 美元,其中代码与推理 2.80 美元、缓存上下文数据 3.6 美元、缓存写入操作 1.8 美元、常规输入 token 0.02 美元,其中 2/3 的资源都被用于处理上下文相关任务。

从 Anthropic 发布的基准测试来看,Sonnet 5.5 在多项指标中已经超越其性能更高的 Opus 5.5 模型。
具体来看,该基准测试对比了 Sonnet 5.5、Sonnet 5、Opus 5.5、GPT-6 Sol 四大模型在智能体编程、知识工作、多学科推理、电脑操作、图表识别等方面的性能。
和上代 Sonnet 5 对比,Sonnet 5.5 在编程、图表识别上的分数提升了数倍;和 GPT-6 Sol 对比,Sonnet 5.5 在智能体编程、知识工作、图表识别上都更优;Sonnet 5.5 在主动编程领域上的分数甚至超过 Claude Opus 5.5,其他几项与之相当。
下图是各模型在不同投入等级下的得分与单任务成本的对比曲线,数据点越靠近图表左上角,代表每花费一美元所能获得的模型能力越强。


CursorBench 基于 Cursor 真实编程会话任务开展测试,在该基准上,Sonnet 5.5 的最高分与 Opus 5.5 差距仅约 2 分。
很多早期测试者称,在直接对比测试中,Sonnet 5.5 能够将工具调用合并在一起,从而减少操作步骤、降低成本。
Sonnet 5.5 在多项知识工作任务上均取得性能提升。GDPval-AA 基准覆盖 44 个职业、9 大行业的真实业务任务,在该测试中,Sonnet 5.5 得分与 Opus 5.5 几乎持平,相比 Sonnet 5 高出约 400 分。在电脑操作与图表识别能力上,它的表现也十分接近 Opus 5.5;而在长周期知识工作场景,其性能明显优于 Sonnet 5 和 GPT-6 Sol。
价格方面,开发者调整投入档位,可在成本、响应速度与任务整体质量之间做权衡。在 Claude Code 以及 Anthropic 官方应用中,默认投入档位为中等(Medium);开发者平台 Claude Platform 默认档位为高(High)。
Anthropic 官方称,档位较低时,Claude 响应更快、消耗 Token 更少,适合常规事务处理;档位调高后,Claude 会进行更长时间的推理,并对输出结果做更全面的自检核验。
三、大多数对齐性指标,与 Sonnet 5 相当
在其自动化行为审计中,Sonnet 5.5 在大多数对齐性指标上均优于或达到与 Sonnet 5 相同的水平。由于其网络安全能力与 Opus 5 相当,因此它是首个具备网络安全防护措施和回退机制的 Sonnet 模型。其生物学安全防护机制与 Sonnet 5 相同。这两种安全防护机制都针对的是少数高风险操作;常规的软件开发和大多数生命科学领域的操作并未受到影响。
Anthropic 研究人员在博客中透露,Sonnet 5.5 并未突破其模型能力的前沿上限,因此他们将模型的对齐评估,聚焦于一组适用于所有能力等级模型的特定风险,包括损害用户利益、误导用户,以及被用于高风险恶意场景时产生协同危害。
研究人员开展自动化行为审计,在约 1850 个场景下对 Claude 进行测试。
结果显示,在对齐性、抗滥用能力与诚实度的大部分指标上,Sonnet 5.5 相比 Sonnet 5 均有提升或持平。 在其新推出的隔离防护评估中,Sonnet 5.5 尝试突破沙箱的概率接近本次测试中表现最优的 Opus 5.5;并且在所有 Anthropic 模型里,它去试探容器防护边界的概率最低。他们没有发现 Sonnet 5.5 会去执行与用户意图相冲突的目标。
网络安全方面,Sonnet 5.5 的网络安全相关能力相对 Sonnet 5 有提升,因此研究人员为其部署了与 Opus 5.5 相近的安全防护机制。用户仍然可以在常规软件开发流程中,利用模型查找并修复代码漏洞;但高风险网络安全任务会自动降级回 Sonnet 5 处理。
Sonnet 5.5 沿用与 Sonnet 5 相同的生物相关安全防护机制。该防护体系针对有害请求;绝大多数科研、教育以及临床工作不受影响,但部分微生物学与病毒学相关请求可能出现误拦截。
在模型蒸馏防护方面,Sonnet 5.5 是首款内置安全分类器以抵御推理提取攻击的 Sonnet 系列模型,并扩展了保留思考链路(preserved thinking)机制:Claude 的推理思考过程无法脱离生成该内容的账号单独剥离。
此外,Claude Sonnet 5.5 版本也提供了不保存任何数据功能的版本。
结语:Claude 中端主力模型性能暴涨,但成本是个坎
Sonnet 5.5 的升级,标志着 Anthropic 的主力中端大模型正在快速收窄与旗舰模型之间的能力差距。这或许会改变企业落地大模型的选型思路,不必一味追求最高规格旗舰,可采用主力模型承担绝大多数常规任务、旗舰模型仅处理高难度复杂任务的分层调用架构,在能力与成本之间找到更优平衡点。
不过综合开发者的实测结果来看,Sonnet 5.5 在成本端并未实现大幅缩减。一旦面对复杂 Agent 任务,用户往往需要拉高投入等级来换取足够性能,此时单任务开销会明显抬升。
来源:Anthropic、X