财联社 9 月 23 日讯(编辑 李莹)Anthropic 新模型性能直逼旗舰,定价却不到其一半;OpenAI 新款 Luna 表现追平上代主力,成本却仅约其百分之一。当地时间周二,两大 AI 巨头同日出牌、短兵相接,AI 模型价格战愈演愈烈。
美西时间 9 月 22 日,Anthropic 发布新款 AI 模型 Claude Opus 5.5;同日,OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna。
Opus 5.5
Anthropic 称,Opus 5.5 在大多数任务上的表现与其最强模型 Fable 5.1 相当,在默认设置下,典型工作负载的成本比 Opus 5 低 40%。
定价方面,Opus 5.5 每百万输入 token 4 美元、每百万输出 token 20 美元,单价较 Opus 5 下调 20%。公司还表示,Opus 5.5 的输出速度比 Opus 5 快 30% 以上,文字表达也更清晰。
据 Anthropic,在 CursorBench 编程基准测试中,Opus 5.5 得分比 OpenAI 的 GPT-5.6 Sol 高 11 分,运行成本仅为后者约三分之一。

Anthropic 表示,Opus 5.5 是其 "5.5 系列 " 的首款产品,该系列将比以往各代更具成本效益。Claude Sonnet 5.5 与 Claude Haiku 5.5 将于未来几周推出。
投资者此前猜测,新模型发布或将成为 Anthropic 公布招股书的催化剂。市场正关注其能否在竞争加剧、客户对价格日益敏感的背景下延续高速增长。
GPT-6 Sol、GPT-6 Luna
OpenAI 方面,GPT-6 Sol 定价为每百万输入 token 2 美元、每百万输出 token 10 美元,较 GPT-5.6 Sol 的促销价下调 50%。
GPT-6 Luna 的定价仅为每百万输入 token 0.10 美元、每百万输出 token 0.50 美元。
两款新模型面向专业工作、编程、自动化和计算机操作等场景,是本月早些时候发布的旗舰模型 GPT-6 Astra 的低成本选择。
OpenAI 表示,缓存与推理效率的提升降低了服务成本,公司将节省的成本直接让利给用户。
性能上,OpenAI 称 GPT-6 Sol 的出错率约为前代的一半。GPT-6 Luna 在较高推理强度下可达到 GPT-5.6 Sol 的水平,成本仅约其百分之一。
GPT-5.6 Sol 与 Luna 于今年 7 月发布,距此次更新不足三个月。
OpenAI 也将新模型与 Anthropic 的上一代产品作了对比。在 AutomationBench 专业工作测试中,GPT-6 Sol 得分比 Claude Opus 5 高 6.3%,单任务成本仅为后者的 9%。

此外,OpenAI 改进了 GPT-6 系列的提示词缓存功能。公司称,调用已缓存提示词的成本最多可比未缓存时低 90%,这对需要长时间运行、反复处理相同指令的 AI 智能体尤为有利。
安全性上表现如何?
Opus 5.5 是 Anthropic 首席执行官达里奥 · 阿莫代伊(Dario Amodei)本月早些时候呼吁业界放缓前沿能力发布节奏后,公司推出的首款模型。
发布前,该模型接受了大规模对齐测试,以及 AI 安全研究机构 METR 和 Frontier Design 的外部评估。
Anthropic 称,Opus 5.5 配备了此前仅用于最强系统的安全防护,以限制网络安全和生物等高风险领域的滥用。
不过,公司正扩大专门的准入计划,让更多经审核的网络安全和生命科学研究人员获得更充分的使用权限。
内部测试显示,Opus 5.5 试图突破 " 隔离边界 " 的概率比 Opus 5 或 Mythos 5.1 低约 85%。
OpenAI 方面,公司表示 Sol 与 Luna 采用了与旗舰模型 Astra 类似的训练方法,在推理、事实可靠性及对齐等方面均有改进。
测试数据显示,GPT-6 Sol 试图绕过限制的比例从前代的 68% 降至 64%,Luna 则从 77% 降至 42%。
在模拟留言板测试中,若模型发现留言板,GPT-6 Sol 执行未经授权指令的比例由前代的 52% 降至 11%。