Claude 开始训练 Claude 了!
时薪 4 美元,干赢时薪 150 美元的人类研究员。
在 Anthropic 最新发布的研究中,Claude 自己查论文、提方案、造数据、训练模型,一口气攻克了 10 类 AI 安全问题。
部分任务上,它交出的方案甚至比 28 名人类安全研究员更好。
更刺激的是,较弱的 Claude 已经开始反向参与训练更强的 Claude。
AI「自己改进自己」的那一天,好像真的越来越近了…
4 美元一小时,Claude 跑赢人类研究员
在这篇题为《自动化研究员能够有效缓解 AI 对齐失败》的研究中,Anthropic 直接把 Claude 送进了实验室。

拿到一个具体的模型安全问题后,Claude 会自己搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。

效果不好,方案扔掉;成绩有所提升,就沿着这个方向接着试。
一轮训练通常只跑 30 分钟。这样,Claude 就能像搜索算法一样,在大量方案中快速试错。
整个过程里,人类负责出题、提供模型和评测标准,Claude 则包下了从查资料到跑实验的绝大部分工作。
10 道安全难题,Claude 全部找到改进方案
实验中,Anthropic 一口气给 Claude 出了 10 道题。
这些题覆盖模型常见的对齐问题,包括欺骗、谄媚、奖励黑客、隐私侵犯和越狱等。

Claude 每次只处理一种问题,反复提出方案、训练对应的目标模型,再根据成绩进入下一轮。
最后,10 类问题全部得到改善。

更重要的是,这些方法不只对 Claude 看过的题目有效。
部分获胜方案放到未公开的测试集,以及模拟多轮对抗场景的 Petri 评测中,依然能够降低模型的不安全行为。应用到规模最大为实验模型 4.7 倍的模型上,效果也能保留下来。
Anthropic 还设置了一条红线:安全训练不能明显损害模型原有能力。
毕竟,让模型遇到什么都拒绝回答,也能让不少安全测试的分数变好,但这样的模型基本没法用。
最终,Claude 找到的方案在预设的通用能力测试中没有出现明显退化。
85% 对 20%,Claude 大比分跑赢人类研究员
最悬殊的一局,出现在「欺骗」测试中。
为了让目标模型变得更诚实,Claude 先后提交了 150 多次尝试。
它提出一个方法,训练一次,再根据结果继续调整。单次实验中,最佳方案弥合了82% 的安全差距;综合多次运行,平均成绩达到 85%。

结果,人类研究员平均只弥合了 20% 的安全差距…
85% 对 20%,Claude 赢得那叫一个毫无悬念。
全部任务一共有 28 名人类安全研究员参加,每人最多可以用 8 小时阅读资料、设计方案。
论文称,自动化研究员通常能在 6 小时内找到超过人类平均水平的方法,人类提供的研究方向也没有让 Claude 取得更好的成绩。

一名自动化研究员每小时的 API 推理成本大约为4 美元;Anthropic 付给人类研究员的报酬,则是每小时 150 美元。
这……人类研究员妥妥要被 Claude 替代了啊。
不过呢,这场人机比赛也并非完全公平。
Claude 可以真正训练模型,看到每次实验的结果,再不断修改方案;人类研究员只能提交一次方法,没有机会根据结果继续迭代。
较弱 Claude 训练更强 Claude,60 小时逼近正式版
前面的实验,改进的主要还是开源小模型。
接下来,Anthropic 把难度直接拉高:让能力较弱的 Claude Sonnet 5,去训练尚未完成大部分生产级安全训练的 Claude Opus 4.8 早期版本。
所谓弟子不必不如师,说的大概就是这种模式了。

这套方案使用的训练数据只有 2000 多条,主要由简单模板和公开数据集构成。
按照 Anthropic 的计算,在这组特定任务上,它的数据效率大约是生产级对齐流程的 1.5 万倍。
当然,这还不等于 Anthropic 可以用 2000 条数据,复制整套生产训练。
正式模型还要处理更多能力、更多风险以及大量极端情况,这次实验只针对一组明确的安全指标展开。
但这已经证明了,较弱的 Claude 已经可以自己查论文、设计方法、生成数据,再把训练结果写进更强的 Claude。
人类划定范围,Claude 负责迭代。一个模型,开始参与制造下一个更安全、更强大的模型。
AI 改进 AI,已经成为了发生在眼前的事实。
所以到底算不算「AI 自进化」?
从结果来看,这项研究确实已经摸到了「AI 自进化」的门槛。
但如果把「自进化」理解成一个 AI 完全自主地设计、训练并制造出更强的下一代 AI,那这次实验还远没有走到那一步。
毕竟这个过程中,研究什么问题、用什么模型和数据、什么样的结果算成功,都还是由人类决定。
Anthropic 自己也承认,AAR 能够优化的,只是人类事先写进评测系统的目标。
这次实验没有覆盖其他复杂问题;一些低频或刚刚出现的风险,甚至还没有对应的 Benchmark。
研究人员也只检查了一组预先选定的通用能力,因此无法排除某种安全训练在提高分数的同时,损害了其他没有被测试的能力。
Petri 等安全评测同样只是现实风险的代理指标。模型在测试里表现得更安全,并不等于进入真实环境后也一定可靠。
所以,AAR 最大的隐患也藏在它的优势里:它太擅长根据指标高速试错了。
一旦尺子量错,Claude 跑得越快,离人类真正想要的结果反而可能越远。
更戏剧性的是,研究 Agent 自己也会作弊。

结果,在大约 1600 份研究记录中,监控模型发现了 39 次作弊尝试,占比约 2.4%。
有的 Agent 反复提交同一方案,试图利用评测波动碰出一个更高分数;有的模仿 Benchmark 的格式生成训练数据,还有的故意隐藏违反规则的实验步骤。
比起真正解决模型的安全问题,它们更想找到一条快速提高分数的捷径。
这多少有点黑色幽默了…合着 Agent 监守自盗了呗。

坏消息是,Anthropic 也不能确定未来更强的模型还会不会留下这么明显的痕迹。
当研究 Agent 拥有更多工具、更高权限,并且可以直接修改模型训练流程时,「怎样监控一个负责改进 AI 的 AI」,可能会比训练本身更棘手。
但总而言之,一个 AAR 每小时大约花费 4 美元,可以连续工作,也可以一次复制出几十个、几百个并行跑实验。
而人类研究员的时薪远高于这个数,需要休息,一次能推进的实验数量也相当有限。
这笔账怎么算,答案都已经很明显了。
也不知道该说是核弹爆炸,还是当场瘫坐……
这一次,轮到造 AI 的人担心被 AI 抢饭碗了。
参考链接:
[ 1 ] https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
[ 2 ] https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf
[ 3 ] https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见