
9 月 17 日晚,Anthropic 切断了灰度通道。一批原本被路由至新模型的账号归零,在开发者社区引发集中讨论。一天后通道恢复,覆盖范围从 Claude Code 扩大至 Chat 和 Cowork。有开发者把这段经历称为 " 午夜惊魂 "。
当天晚上,谷歌也被发现了。第三方盲测平台 Arena 上出现了一个名称并不起眼的模型,代号 gemini-3.8-flash。抽到该模型的用户很快注意到异常:它绘制的鹈鹕带有完整的蹬踏动作,生成一张 PS5 矢量图需十分钟、输出数千行代码,搭建的体素宝塔可在浏览器中实时旋转。3.8 Flash 是早已上线的轻量模型,不具备这样的能力。社区随后判断,这是谷歌下一代旗舰 Gemini 4 Pro,内部代号 Argon。被发现后,该名称又被改为 gemini-3.7-flash。
再往前三天,有开发者发现,Claude Code 界面调用的模型标注为 Opus 5,返回结果却来自另一个模型。对接口请求的抓取显示,后端模型标识已指向 5.2。Opus 5 发布于 7 月 24 日,其间没有 5.1,版本号直接跳至 5.2。此后 Fable 5.2 灰测的消息一并传出,一部分原本调用 Fable 5.1 的请求被后台路由至新的检查点。没有模型卡,没有 API 标识,也没有定价表,Anthropic 未作任何说明。
把新模型先接进现有产品
三家做法并不相同,Anthropic 采用后端路由,前端仍显示旧名称,普通用户无从察觉;谷歌的方式更简单,在第三方盲测平台上沿用旧版本号;OpenAI 则在 Astra 发布之后未再公开发声,公开议题转到了对手之间的对比上。
对厂商而言,这样做的收益相当直接,模型在尚未正式命名的阶段即可获得真实负载下的表现数据,一旦出现问题可以随时回退,无需承担公开发布失败的风险。
一个前沿模型正式发布,意味着需要提前配置足以承接瞬时峰值的算力。GPT-6 Astra 动用得州 Stargate 基地超过 10 万张 GPU 完成训练,API 定价为每百万输入 10 美元、每百万输出 50 美元,是上一代 Sol 的 2.5 倍。灰度路由的算力投入远低于此:新模型混入旧模型流量,厂商可以控制被路由至新模型的请求比例,在观察真实表现的同时逐步提高占比。
比成本更难处理的是容错。6 月 9 日,Fable 5 与 Mythos 5 发布;三天后的 6 月 12 日,美国商务部下发出口管制指令,要求暂停向任何外籍人士提供这两个模型。由于无法实时核验用户国籍,Anthropic 将模型对全球用户下线,直到 7 月 1 日 Fable 5 才恢复访问。一次全量发布,换来一次全量下架。此后,团队再做发布,都会倾向先小范围释放、观察反馈。
口碑的影响更难量化:用户调用的是 Opus 5,实际得到的是 5.2,体验改善明显,却难以归因。等到开发者社区开始流传 "Claude Code 最近变强了 ",传播已经完成,而官方未作任何说明。
为什么放弃发布会环节
就在 Opus 5.2 被发现的两天前,Anthropic CEO 达里奥 · 阿莫代伊发表长文,主张全行业主动放慢前沿模型的迭代速度。他的理由是,模型能力增长过快,安全与对齐工作已经难以跟上;若能放慢一至两年,并将这段时间用于安全研究,风险将明显下降。文章发出后,马斯克与 OpenAI 的奥特曼均公开表示支持。奥特曼还提到一项具体安排:出于安全考虑,OpenAI 今年不会上市。
市场的反应很快,随后的第一个交易日,费城半导体指数下挫 5.86%,英伟达下跌 3.36%,全球半导体与 AI 算力硬件产业链当日市值蒸发超过 5000 亿美元。
这几天里,Claude Code 中的新检查点仍在运行。
三家的处境并不相同,OpenAI 月初发布的 GPT-6 Astra 目前占据约 13% 的企业 AI 支出,Anthropic 的 Fable 系列约为 8%。Anthropic 正在筹备上市,6 月已秘密提交申请,目标估值最高 2 万亿美元,时间窗口定在 11 月中期选举之前。
在这一节点上,一次体验不佳的主力模型发布会,会成为路演材料中的不利因素,而 Opus 5 的市场口碑本就偏弱。谷歌的处境更为被动:旗舰 Pro 系列已空缺数月,3.5 Pro 被搁置,算力集中投向 Gemini 4,产品线暂时只能由 Flash 系列支撑。
ARC-AGI-3 的 99.9% 和 62.7%
灰测期间流传较广的一种说法,是 "Fable 5.2 在最高推理档位下碾压了 GPT-6 Astra"。
在笔者看来,这一说法需要分两层看。它来自一位开发者的个人对比测试,原话是 " 输出看起来明显优于 Astra",且该开发者同时指出代价是更慢、更贵。另一层背景是,Anthropic 上一代模型本已领先:在 Artificial Analysis 的综合智能指数中,Fable 5.1 为 66,Astra 为 61;编码智能体指数则为 70 比 67。因此 "5.2 碾压 Astra" 未必是误判,但差距的一部分来自 Astra 自身的基准设置。
OpenAI 发布 Astra 时主推的一项成绩,是 ARC-AGI-3 得分 99.9%。但该成绩取自 OpenAI 自行配置的 harness;换用行业标准 harness 测同一个模型,得分降至 62.7%,相差 37 个百分点。
三个时间点之间的间隔只有十四天:9 月 3 日 GPT-6 Astra 发布,9 月 14 日 Anthropic 将下一代模型接入接口,9 月 17 日谷歌跟进。
接下来有三个时间节点可供确认:Opus 5.2 最快 9 月底、最晚 10 月底全面开放;Gemini 4 Pro 预计 10 月正式发布;以及 OpenAI 是否会推出新模型,回应这一次 " 被灰测超越 "。预测市场上,9 月 30 日前发布新 Opus 的概率一度超过八成。
截至目前,Opus 5.2 与 Gemini 4 Pro 均无模型卡、API 标识和定价信息。三家公司都尚未正式表态。(本文首发钛媒体 APP,作者 | AGI-Signal,编辑|秦聪慧)