Claude Haiku 5.5 发布,小模型大逆袭!
单论跑分,直接超越两大前 " 斩杀线 "DeepSeek V4.1Flash 和 GLM-5.3-Flash,成为新的小模型守门员。


Haiku 5.5 甚至价格也完全对标 GPT-6 Luna。
上代 Haiku 4.5 还是刚好一年前出的,价格是 5.5 的 10 倍。

而且这样一来,除了缓存命中的输入这一项,Haiku 5.5 在不超出 100k 提示词时的价格也比 DeepSeek-V4.1 Flash 的谷时价格便宜了。
为了测试计算机使用能力,我们让 Haiku 5.5 把 GPT-6 和 DeepSeek 的价格填到 Haiku 发布页表格的后面。


只能说隔壁 OpenAI 要是不努把力,Claude 都没必要把 Fable 5.5 这管大牙膏挤出来。
仿佛回到了英特尔和 AMD 比拼 CPU 的日子。
换了 tokenizer,耗费 token 更多
Haiku 5.5 是第一个支持 effort 调节的 Haiku 模型,继承了系列从 low 到 max 的五档配置。
上一代 Haiku 4.5 在计算机操作和编码方面基本交白卷,这一代直接进化。
看 OSWorld 2.1(测 agent 操作真实电脑完成多步任务):Low 档 42.0% 准确率、单次成本 $0.07;Max 档 72.4%、$0.61。Haiku 4.5 只有 Max 档 15.7%、$1.45,
也就是说,5.5 的 Low 档比 4.5 的 Max 档准,还便宜一半。


特别是代码、表格、非英语内容的膨胀可能更高。
在 AA 测评中,Haiku 5.5 虽然 API 价格便宜了,但 " 完成任务的平均成本 " 并没有到达理想区间。

很多人对 Haiku5.5 的期待是能在部分任务替代 Sonnet 5.5,进一步压低成本。
但这次并没有出现奇迹,小杯还是小杯。
Terminal-Bench 4.0 上 Haiku 5.5 拿 39.2%,Sonnet 5.5 拿 70.6%。复杂多步编码、跨文件重构、长周期自主规划方面差距非常清楚。
Anthropic 自己也建议了,复杂 agent 编码优先用 Sonnet 5.5 或 Opus 5.5。
Haiku 5.5 的价值在执行层。任务已经拆好、验收标准明确、可以并行跑的任务。
比如 Cognition 的 Devin 用 Opus 5.5 做主模型、Haiku 5.5 做子智能体,FrontierCode 组合跑到了 66.2%,比两个模型各自单跑都高。

budget_tokens 手动思考配置直接报错,必须改成自适应思考加 effort 参数。
temperature、top_p、top_k 全部锁定默认值,依赖采样参数做创意控制或多样化生成的应用要改逻辑。
assistant 消息预填充被取消了,以前靠预填充强制 JSON 开头的写法得换工具调用或结构化输出接口。
计算机操作工具版本也更新了,从 computer_20250124 换成 computer_toolset_20260801,接口格式和返回结构可能都不同。
另外自适应思考默认开启,响应第一个内容块可能是思考块而不是正文,解析逻辑要按 type 字段过滤。
五处变动,每一处都可能让请求直接报错或返回非预期结构。
Anthropic 提供了迁移指南,建议切之前对着过一遍。
顺带两条福利
Sonnet 5.5 的缓存读取从 $0.20/M 降到 $0.10/M,Anthropic 称大多数 agent 任务因此成本降约 20%。

这些额度可以用来实验调 API 建工具、应用、agent,所有模型通用。
神马?你说 A 社把我的买 Coding Plan 钱还给我,让我还可以在 API 上再用一次?


[ 1 ] https://www.anthropic.com/claude-haiku-5-5
[ 2 ] https://x.com/AI_Screening/status/2107906044915749274?s=20
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见