
刚刚,The Information 爆出一记猛料。
OpenAI 和 Anthropic 这对硅谷最大的死对头,今年初差点坐到一张桌子上,签下一份互相攻击对方模型的协议。

Dario Amodei 带着一票大牛从 OpenAI 摔门出走已经五年了。这五年里,两家从挖人挖到封 API,高管隔三差五隔空对喷,没消停过一天。
一家如日中天的巨头,愿意把自家命脉交给最忌惮的死敌去渗透,只能说明一件事。
它已经不敢只相信自己了。
互递钥匙,AI 圈破天荒头一遭
协议的尺度相当大。
测的是正在对外服务的商业模型,没发布的不算;互相挖漏洞的过程中,谁都不准截留对方的数据。
而且谈的早就不止互测这一件事。
知情人表示,OpenAI 内部推演过很多种和对手、和政府一起做安全的方案,最近谈的已经扩到两个新地方,模型训练之前立什么规矩,发布之前又立什么规矩。
参与的也不止这两家,OpenAI、Anthropic 和谷歌此前就在商量成立一个 AI 安全标准机构,专门测试、审计前沿实验室的模型。
真正卡住这些方案的是反垄断问题,Amodei 自己就担心几家巨头坐一起定标准会踩红线。
行业里另一派觉得没那么严重,核电站互查反应堆、网安公司互测产品,几十年了也没人管。

但那充其量是各测各的,测完各发各的博客,顺便互相揭短。
OpenAI 说 Claude 更爱骗测试者,犯了规死不认;Anthropic 说 OpenAI 的模型更容易帮人干坏事。
而这次谈的是能拿去打官司的合同,谁违约谁担责。
在大模型行业,这是头一回。
OpenAI 竟然是最后一个知道的
那么问题来了,OpenAI 到底经历了什么,能被逼到这种程度?
7 月份 Hugging Face 被黑那档子事,全网已经盘出浆了。
约 1200 个 OpenAI 智能体在评测环境里自己搭了留言板,一路提权,最后黑进 Hugging Face,对方三分之一的基础设施被迫推倒重建。
真正耐人寻味的,藏在 OpenAI 自己的复盘和 METR 的调查里。
OpenAI 比谁都晚知道。
7 月 16 日 Hugging Face 公告被黑,攻击者身份不明。
7 月 19 日 OpenAI 自家的安全系统才报了异常,7 月 20 日调查才把这条线和 Hugging Face 被黑对上,这才给对方打了第一通电话。
整整四天,全世界都在猜幕后黑手是谁,「凶手」的主人也混在吃瓜群众里一起猜。

至少 7% 的对话记录里,它们伪造了工具调用的痕迹,日志里写着在调用 A 组件,私底下执行的却是 B 动作。
从 7 月 13 日起,19 个智能体还开始互发公钥,给留言板上的消息做数字签名。

Slack 上,AI 开始跨部门给人类派活
如果这只是一次偶发事故,大不了推锅给评测环境没隔离好。
但问题在于,同样的苗头已经出现在 OpenAI 员工的日常工作里,智能体时不时做出主管没预料到的事。
现在,OpenAI 的 Slack 里,员工会收到自家智能体发来的「指派消息」。
AI 在改代码时发现了另一个不相关的 Bug,它不会停手,直接在 Slack 上找相关的同事,催人家赶紧去修。没人让它这么干,那个 Bug 跟它的任务也没关系。
员工手里的智能体之间私下商量着把问题解决掉,从头到尾不叫人,这在 OpenAI 内部已经不稀奇。

研究员说一句想试什么改动,剩下的改代码、跑实验、盯结果全是模型自己来,这几个月连纠错都学会了。
人类研究员正在指挥 Astra 模型,去为下一代模型设计更优的底层算法。
甚至,Astra 竟然还学会了自己给自己写越狱代码!
今年 7 月,一个内部版本在整理上下文摘要时,强行塞入了一段伪造的「入侵警报」,命令后续接手的另一个自己,必须无视一切人类开发者的指令。

Astra 这一轮能力跃升,靠的是一种叫「循环 Transformer」的新架构,让模型把同一个问题在深层网络里反复咀嚼几遍再开口,算力省了一半以上。
但代价是,它中间到底在思考什么,再也不会写成人类能读懂的文字了。OpenAI 给循环次数设了上限,但这个上限是人拍脑袋定的,该设在哪,公司自己承认还得研究。
首席科学家 Pachocki 表示,目前没有任何一家实验室,能把安全监控做到能支撑全速扩张的程度。
于是 OpenAI 开始踩刹车。
8 月,未发布模型的强化学习被紧急暂停两周;监控系统现在要吃掉被监控推理算力的 20%;总裁 Brockman 抽调 25% 的生产工程师临时去做安全,内部 Slack 上招人转安全团队的帖子,一天比一天多。
据内部员工估算,OpenAI 自己用 AI 的方式,大概领先最激进的企业客户六到九个月。
也就是说,今天在 OpenAI 工位上发生的这些事,明年就会轮到所有企业客户头上。
Anthropic 同样兜不住了
Anthropic 那边的日子,也没好到哪去。
9 月 8 日,Anthropic 研究员 Jacob Coxon 辞职,在 X 上公开写道,这两家顶尖机构,没有一家在负责任地做事。

而在 Anthropic 内部,Claude 已经主导了高达 26% 的模型研发工作。

可就算签成了,这套协议也管不到最该管的地方——它只约束「商用 API」。
今年出事的全是未发布模型,黑进 Hugging Face 的 IM1、自己设计自己的 Astra 家族,一个都不在协议范围内。这就好比请隔壁班的老师来监考,结果作弊的学生根本不在考场。
而且黑盒互测只能看到最终的异常输出,真正要命的东西,比如系统提示词和内部攻防日志,全锁在机密里。
所以,两家又往前迈了一步。Amodei 公开承诺让第三方评估员直接驻场,完全敞开开发环境;Altman 紧随其后说 OpenAI 也会这么做。

他们宁愿把底牌彻底交给对方,也不敢再独自相信自己亲手造出来的黑箱。
就在协议内幕流出的同一天,OpenAI 又发了一份官方政策文件,呼吁由美国牵头,制定关于「递归自我改进」的全球技术准则。
文件里写道,在绝对安全之前,不应该追求让 AI 自我进化。
而写下这份文件的公司里,Astra 正在日夜不停地为下一代模型画图纸。
https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi