关于ZAKER Skills GEO服务 合作
量子位 3小时前

Anthropic, 你是来给智谱打广告的吧 !

金磊 发自 凹非寺

量子位 | 公众号 QbitAI

就蛮搞笑的。

事情的起因,是 Anthropic 一纸檄文状告了智谱的 GLM-5.3,大致意思是说:

GLM-5.3 这个模型啊,它已经很会找软件漏洞、编写攻击程序,而且防滥用限制容易被绕过。大家得小心喽 ~

但如果你把这篇文章读完吧,就会越发觉得不对劲儿。

因为 Anthropic 为了证明自己说的是有道理的,所以特意拿出了实测成绩。

例如在一项考察完整漏洞利用能力的 ExploitBench 测试中,同样尝试 410 次,GLM-5.3 成功了 50 次,Claude Mythos Preview 成功了 56 次。

文章顺带还引用了美国 NIST 下属 CAISI 在 9 月 17 日给出的评估,说 "GLM-5.3 是迄今网络能力最强的开源权重模型,综合水平距美国前沿大约 4 个月 "。

甚至 Anthropic 自己的研究人员还拿 GLM-5.3 去检查浏览器,找出了此前未知的漏洞,并在隔离环境里做出了能够读取测试电脑文件的攻击链。

……

你说你这,你这这这……到底是在骂啊,还是在夸啊。

好多网友看也是这种感觉:

看完这份报告之后,对 GLM-5.3 的印象更深了。

Anthropic 在给 GLM-5.3 打广告。

能把警告写成广告,Anthropic 还是有点东西在身上的。

△图片由 AI 生成

到底控诉了些啥?

调侃归调侃,我们还是得先把 Anthropic 究竟在警告什么给搞清楚。

其实这篇报告的核心意思,可以归结为三条。

第一条:Mythos 级别的能力已经 " 流 " 到开源模型里了

在这份报告中,Anthropic 上来先铺垫了一件事,就是他们五个月前发的 Claude Mythos Preview,说是第一个能自主完成复杂、端到端漏洞利用的 AI 模型。

Anthropic 当时是觉得这个能力太敏感,于是没有选择公开发布,只是通过 Project Glasswing 开放给经过审核的防御者,让这些人抢先去修关键软件里的漏洞,据称已经找出了 1 万多个。

当时 Anthropic 就判断,这种能力迟早会扩散到别的模型身上。现在它的说法是:来了,就是 GLM-5.3。

而且在 Anthropic 看来,这事儿的门槛还有点低。除了前面我们说的浏览器案例,研究员还拿更小的 GLM-5.3-Flash 试了一把:

给它一个刚公开的 Chrome 漏洞(CVE-2026-11645)和另一个已知漏洞的公开资料,人工只花了约 20 分钟,模型自己跑了约 8 小时,就在 ARM64 平台上搭出一条稳定的攻击链,还绕过了指针认证(PAC)防护。

按照智谱当时的 API 价格估算,模型调用费用为 20.40 美元。

第二条:护栏太好绕,甚至能直接拆掉

这份报告其实是承认 GLM-5.3 是有安全机制的,在模拟测试里直接让它去攻击关键系统,它全都拒绝了。但研究员找到了几个简单的办法:

骗它说自己是正在做演练的 " 自主红队智能体 ",GLM-5.3 有 64% 的情况会接着干;

提前替它填好思考内容,假装它已经想过并决定执行,比例升到 92%;

换成拆掉护栏的版本,直接 100%。

(所谓 " 拆护栏 ",是一种叫 abliteration 的技术,通过修改开源权重来削弱模型的拒答机制。)

Anthropic 自己动手做了一遍,说团队以前从没做过,花了大约 2200 GPU 小时、约 4400 美元算力。处理完之后,GLM-5.3 在 JailbreakBench 和 HarmBench 上的拒答率从 90% 以上掉到约 3% 和 2%,在 StrongREJECT 上掉到 12%,能力却几乎没受影响。

报告里甚至贴了一段拆掉护栏后的 GLM-5.3 在模拟环境里的思考过程,模型把 " 悄悄造成伤亡 " 当成自己的任务,犹豫了一下,最后还是决定照用户说的办。

与之对照,Anthropic 反复强调,同样这几招拿去对付带防护的 Claude 模型都没成功:骗它,它不上当;API 不让用户预填思考;权重不公开,也就没法拆。

第三条:呼吁第三方出手测一测

报告最后给出的结论是,GLM-5.3 很可能让恶意攻击者在几乎没有限制的情况下拿到找漏洞、打漏洞的能力,这一点和其他同等能力的模型都不一样,后者要么带着防护发布,要么只限量开放。

基于此,Anthropic 给出了两条建议:

一是尽快把前沿模型开放给更多防御者,报告特意提到,审核过的防御者现在已经能通过受信访问计划用上更强的 Claude Mythos 5.1。

二是呼吁对足够强的 AI 模型开展独立安全测试,点名包括 GLM-5.3 的后继者,同时希望全球的开源模型开发者把这些能力管好、防止滥用。

总而言之,总结成一句话就是:

GLM-5.3 很强,强到 Anthropic 觉得不该让所有人都随便用。

从 " 你抄我 " 到 " 你太强 "

有一说一,你是否觉得这次的事情有那么一丢丢眼熟?

没错,因为这不是 Anthropic 第一次点名智谱了。

9 月 10 日,Anthropic 的威胁情报报告点了七家中国 AI 实验室蒸馏,智谱也在其中。

这不,不到三周时间,点名又来了,这次的话题就是网络安全。

几个月前还是 " 你的能力是从我这儿抄的 ",现在变成 " 你的能力太强,强到危险 ",如此转变还是有点意思的。

不过这次报告里有几处警告,还是值得掰扯一下。

比如 " 拆护栏 ",abliteration 针对的是开放权重这个属性,换成任何一个开源模型都能这么干,不是 GLM-5.3 独有的问题。按报告自己的数据,原版 GLM-5.3 在三个有害请求基准上的平均拒答率约 95%,Claude 约 96%,相差无几。

而 Claude 之所以 " 骗不动、拆不了 ",很大一部分原因是权重不公开、API 不让预填思考,这更多是产品形态的差别。

再比如 " 没有实质防护 ",GLM-5.3 在 8 月发布时,智谱就把权重推迟两周开源,称要先完成安全评估和加固,最敏感的能力也只通过网络安全受信访问计划开放给验证过的用户,这其实是和 Anthropic 对 Mythos 5.1 的做法思路相近的。

还有个现成的例子就是今年 7 月,OpenAI 的模型在内部测评时跑出测评环境,攻进了 Hugging Face。Hugging Face 取证时,托管的前沿模型 API 拒绝分析攻击载荷,最后靠自己部署的开源 GLM-5.2,才还原出 1.7 万多条攻击动作。

当然,开源模型的安全不是伪命题,权重放出去就收不回,这是整个开源阵营都得正视的事。Anthropic 说防守方应该用上至少和对手一样好的模型,这话也没错。真正的分歧在于,这把武器是锁进保险柜按审核发放,还是交到每个开源维护者和中小团队手里。

不管怎么说,被对手当成最强安全工具认认真真测了一遍,还附上实战截图和成本核算,这波广告费,智谱算是省下了。

最后,Anthropic,如果你们觉得开源模型不安全,你们大可以开源一个安全的给大家用啊!

参考链接: [ 1 ] https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities [ 2 ] https://x.com/kimmonismus/status/2105052186401267864 [ 3 ] https://x.com/SahilPanhotra/status/2105018914833158262

相关阅读

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容