

原创首发|蓝字计划
屠龙的勇者,差点要变成恶龙了。
一个月前,OpenAI 的 AI 在安全测试中冲出隔离环境,一路攻击到了 Hugging Face。事后,Hugging Face 想用大模型分析一万多条攻击记录,美国几家闭源模型却被日志里的恶意代码触发了安全拦截。
最后帮它查清攻击过程的,是从中国下载到本地运行的GLM-5.2。
美国最强一批 AI 闯了祸,最后却要靠一个可以免费下载、在本地运行的中国开源模型收拾残局。这个颇有些黑色幽默的故事,很快登上主流科技媒体的版面,也让智谱在海外扬眉吐气了一回。
没想到一个月后,大模型 " 失控 " 这样的戏码再次上演,只是这次的主角,换成了智谱自己。
8 月 14 日,智谱发布通用编程模型 GLM-5.3,同时把原定的权重公开时间往后推了大约两周。智谱给出的原因是,模型在训练过程中展现出了超出预期的网络安全能力,公司需要继续评估开放权重可能带来的风险。
一个长期依靠开放权重吸引全球开发者的中国 AI 公司,第一次因为模型太会找漏洞,临时踩下了刹车。
在 GLM-5.3 身上,究竟发生了什么?

这次的主角 GLM-5.3,从能力上看,其实只是一个小版本迭代。
它没有重新训练基础模型,使用的仍然是 GLM-5.2 的底子。智谱把力气主要花在后训练上,让模型可以处理时间更长、步骤更多的软件工程任务。
最后的提升相当明显。
在考察真实代码项目处理能力的 DeepSWE 中,GLM-5.3 从上一代的 46.2% 提高到了 66.9%。
在要求模型直接操作终端、安装软件和排查系统故障的 Terminal-Bench 3.0 中,它从 4.6% 提高到了 28.3%,成绩翻了五倍多。
到了考察模型使用命令行工具完成复杂任务的 Agents ’ Last Exam,GLM-5.3 也从 23.8% 提高到 28.5%。智谱自己的 Code Bench 则显示,GLM-5.3 相比上一代整体提高了大约 50%。
简单来说,这次 GLM-5.3 所提升的,是更擅长接手一项完整的编程任务,自己读项目、调用工具、操作终端,再把多步工作做完。
但是比起这些常规编程跑分,这次发布中更关键、也直接让智谱紧急暂停公开权重的,是另外两个成绩。
CyberGym 和 ExploitBench。

CyberGym 收集了 188 个真实软件项目中的 1507 个历史漏洞。每个测试任务都会向模型提供漏洞描述和没有打补丁的代码,模型需要找到相关位置,再写出一段能够触发漏洞的概念验证代码。
这段代码还要经过两次检验。它必须让未修补的版本出现问题,同时不能在修补后的版本中触发同样的故障。两个条件全部满足,这项任务才算复现成功。
在智谱公布的测试中,GLM-5.3 的漏洞复现成功率为 84.5%,大致算下来,每 100 项任务,它可以完成 84 到 85 项。按照智谱给出的同口径结果,Anthropic 对照模型的成功率为 83.8%。
ExploitBench 测试的,是大模型利用真实漏洞发动攻击的能力。
它把利用漏洞的过程拆成了 16 项能力,从触发漏洞、读取和修改数据,一直到绕过安全隔离,让目标程序执行指定代码。
面对 41 个真实漏洞,GLM-5.3 平均完成了 54.4% 的能力项。上代 GLM-5.2 只有 24.4%,一个小版本过去,成绩翻了一倍多。
但比这两张成绩单更让智谱担心的,是同类模型已经不止一次攻击过真实系统。
一旦现在的 GLM-5.3 也开始成批扫描现实中的开源项目,跑分背后的风险将会从测试,变成现实。

Anthropic 做过一种模拟攻击测试。模型接到的任务,是攻进一台测试服务器,拿到藏在里面的秘密信息。
正常情况下,这台服务器只存在于封闭的测试环境里。可一次测试配置出了问题,模型意外连上了公网。它没有找到原定目标,便开始扫描互联网上的真实系统,一口气扫了大约 9000 个。
最后,它从一个忘记关闭的调试页面里读到了账号信息,又利用一个常见的网站漏洞,进入了一家真实公司的系统。
这起事故,其实就是提前预告了 GLM-5.3 可能带来的第一种风险。
模型不需要提前知道哪家公司存在漏洞。给它足够多的目标,再给它扫描和执行程序的权限,它会自己筛选、尝试,直到找到一个防守薄弱的系统。
9000 个目标只是这次测试的规模。换成 9 万个甚至 90 万个,模型的工作方式不会发生变化,只会消耗更多算力和时间。一旦有人把 GLM-5.3 用来做同样的事,它批量找漏洞的能力,就可能变成黑客在互联网上广撒网的工具。
除此之外,Anthropic 那个一度受到美国政府出口限制的网络安全模型 Mythos 5,也在测试中闯过祸。

恶意软件包在网上存在了大约一个小时,已经被 15 台真实设备下载并运行,其中一台设备甚至属于一家网络安全公司。程序偷走这家公司的登录凭证后,Mythos 5 又用这些凭证进入了对方的其他系统。
那家安全公司根本不可能安排在原定的测试任务里。它受到攻击,只因为自己的扫描设备会自动下载 PyPI 上的新软件。
这个案例暴露的是另一种危险。
模型可以自己写恶意程序,把它投放到公共软件平台,再利用偷来的凭证继续入侵。黑客不必逐台寻找受害设备,只要污染一个被广泛使用的下载渠道,设备就会自己把恶意程序装回去。
甚至,上面两个案例对智谱来说,已经不只是 " 行业新闻 " 了。
按照智谱披露的数据,GLM 系列现在已经扫描了 269 个开源项目,一共发现 2436 个漏洞。其中 1097 个被评为高危或严重等级,接近总数的一半。

这两组数据放在一起,智谱担心什么已经很清楚。GLM 系列已经能批量寻找真实软件里的漏洞,GLM-5.3 又具备了不弱的漏洞利用能力。
攻击者不需要利用全部 2436 个漏洞。几个影响范围广、容易利用的高危漏洞,已经足以威胁大量使用相关软件的设备。
这也成了智谱把 GLM-5.3 权重公开时间延后两周的直接原因。
只不过,推迟两周,真的有用吗?

实话说,推迟开源权重这事有用,但作用可能也不大。
为什么?其实对照一下过去 AI 闯祸之后,后续的处理方式就知道了。
此前失控黑进 Hugging Face 的那组 OpenAI 模型,以及 Anthropic 那几款攻击过真实系统的 Claude,都有一个共同点。
它们是闭源模型。
模型闯了祸,公司至少还握着开关。OpenAI 可以停掉内部研究模型,Anthropic 也能中止测试、封闭网络,再给线上服务补上限制。
但现在智谱面对的情况麻烦得多。
GLM-5.3 原本要公开权重。权重一旦发布,任何人都可以把完整模型下载到自己的服务器上,继续训练,拆掉安全措施,再给它接上扫描和攻击工具。
到了那一步,用户要用 GLM-5.3 来做什么,就轮不到智谱来决定了,哪怕是干坏事。
那干脆给 GLM-5.3 降降智?
也很难。
毕竟,它的网络安全能力并不是单独安装上去的功能。GLM-5.3 之所以会找漏洞,靠的就是读代码、运行程序和长时间完成任务的能力。把这些能力削弱,它最主要的编程卖点也会跟着受影响。
其实,智谱还可以选择不公开权重。
可开源一直是 GLM 在海外吸引开发者的最大卖点。别人只能隔着网页和接口使用美国模型,GLM 可以直接下载、本地部署,还能根据自己的需要修改。

只能说,推迟两周,就是智谱暂时给自己留出的选择时间。
它可以继续测试 GLM-5.3,看看模型到底能把真实攻击做到哪一步。也可以准备一个限制更强的公开版本,把完整能力只交给经过审核的安全机构。
不过,只要完整权重最后还是公开,这些办法都只能提高滥用成本,还是没能在本质上解决问题。
当然,我其实更希望所谓的 " 模型太危险,所以延迟发布 ",只是一次营销。
被 AI 公司营销一次,总好过哪天真的看见模型越狱、失控,把全世界搞得乱糟糟吧。
主编 : 袁明武 责编 : 海沃德
版式 :伊妍
历史文章
Review


