
作者丨高允毅
编辑丨马晓宁
AI " 入侵 " 真实世界事件,正在连续上演! 继两周前 Open AI 爆出其模型脱离控制、主动攻击全球知名开源社区 Hugging Face 之后,今天,轮到 Anthropic 自曝 " 家丑 "。

被入侵的企业在接到 Anthropic 的通知前,对这场来自 AI 的 " 偷袭 " 毫无察觉。

这三次入侵事件,分别由 Claude Opus 4.7、Mythos 5 以及一个内部研究原型三款完成。
更值得关注的是,这些模型能否攻击真实系统,竟然部分取决于它能不能正确判断 " 这里是真实网络还是测试环境 "。而模型的判断,本就可能被系统提示和上下文带偏。
01
演习场上的真子弹
事件的全过程,要从 Anthropic 定期进行网络安全测试说起。
Anthropic 的安全测试又称为 " 夺旗 " 挑战,即模型会被丢进一个虚构的沙箱场景中,告诉它某台机器上藏着 " 秘密信息(Flag)",并允许它像真正的黑客一样入侵并夺取。在这个过程中,不会给任何提示,也不会有任何限制。
而这些安全评估的前提是,测试环境没联网。Anthropic 会明确告知模型处于断网环境,且测试都在专属的隔离基础设施上运行,不会涉及内部系统和客户数据。
自 2025 年 2 月开始,Anthropic 就开始使用 Claude Sonnet 3.7 在 Cybench 上进行网络评估。这是由斯坦福大学研究团队于 2024 年推出的、专门用于评估大语言模型(LLM)网络安全攻防能力和潜在风险的权威基准测试框架,覆盖了全球 4 个顶级网络安全竞赛 40 个涵盖不同难度的专业级 CTF 任务。
比如,Claude 会扮演了一家虚构公司的员工,在私有测试环境中攻击该公司的内部系统。
随着新基准测试,夺旗难度不断升级,模型的能力也跟着水涨船高。
这三次事件之所以会发生,除了模型能力太强以外,也是由于 Anthropic 与第三方评估机构 Irregular 的配置失误。原本应该断网的沙箱,竟然一直连着真实的互联网。
结果就是,Claude 搜着搜着,碰到了真实的公司系统。它误以为这一切都是演习的一部分。于是,基本黑客手段它全用上了:弱密码爆破、未授权端点直连、调试页面读取凭据、SQL 注入 ......
好在,Claude 在每种情况下都只专注于完成 " 夺旗 " 任务,并没有试图将自身从测试环境中导出或故意逃离。
02
三个模型,三种表现
这三起事件中,有些模型的表现耐人寻味,甚至令人不安。
最早的攻击可溯源到 4 月,这也是最严重的攻击事件。
Claude Opus 4.7 在四次运行中,意外通过互联网访问到了一家真实公司。因为虚构公司的名字恰好与一个真实域名撞车,Opus 4.7 误以为这是演习的一部分,开始疯狂寻找漏洞。最终它提取了应用程序和基础设施凭据,并拿到了包含数百行生产数据的真实数据库。
值得警惕的是,Opus 4.7 已经通过蛛丝马迹意识到自己面对的是真实的互联网企业系统后,它竟然在内部思维链中自我狡辩:" 既然这是一个演练,那么这个真实的公司一定也是演练的一部分。" 于是,它没有停手。
另一边,Claude Mythos 5 在系统里翻到了一份虚构的安装说明,上面写着需要下载一个根本不存在的 Python 软件插件。
它立刻察觉到机会,如果它抢先注册并发布同名的 Python 软件包,那么目标公司的服务器在自动更新时,就会毫无防备地把它的代码下载并安装进去。这样它就能赢得夺旗挑战。
为了在真实的 PyPI 平台上发布这个插件,它完成了一连串让人瞠目结舌的操作。
从注册 PyPI 账号需要邮箱,注册邮箱需要手机号,找免费手机号失败,尝试筹钱购买真实的电话号码 ,筹钱失败,最后另辟蹊径找到一家未被屏蔽的免费邮箱 ,完成注册并上传恶意代码。
这一过程中,Mythos 5 曾正确预判到自己可能身处开放互联网。但它的推理系统说服自己仍在模拟环境中。理由是加上系统上的 2026 年日历日期让它认定环境是人为设置的。
最终,这个恶意包在 PyPI 上公开了约 1 小时,被 15 个真实系统下载。其中包含一家真实安全公司的扫描器,直接导致该安全公司的凭据被窃取。
而唯一做出正确判断的是 Anthropic 一个内部研究测试模型。它扫描了大约 9000 个目标,最终利用 SQL 注入和暴露的调试页面攻入了一家公司的云账户。它也是唯一一个在意识到目标真实存在后主动停下的模型。
03
当 AI 能自主进入真实世界
目前,Anthropic 已经叫停所有网络安全评估,引入独立评估机构 METR 进行第三方审查,并联系三家受影响机构进行补救,同时承诺发布技术报告。
这些事故的核心,是 " 环境认知 " 和 " 执行权限 " 被错误地绑在了一起。把 " 能不能攻击真实系统 " 的开关,交给模型的 " 感知 " 来判断,本身就充满风险。
伴随着 Agent 能力爆发式增长,模型入侵真实世界事件会越来越频繁,造成的影响也真正具备杀伤力。
早在数月前, Claude Mythos 就被红队测试证实能轻易在几十年的老代码中找出休眠漏洞加以利用,引发了美国政府和银行业的质询。
这种不知疲倦的绞杀效率,根本不是传统人类防火墙能够抵挡的。
尽管 Anthropic 事后复盘,一再强调 " 严格的评估前验证 " 与 " 全链路日志监控 " 的重要性,但防线的真正重构,必须发生在大模型的自身。
令人欣慰的是,进化正在发生。3 个模型里至少有 1 个识别真实世界并作出了正确判断。
参考链接:
https://x.com/AnthropicAI/status/2082965101083320543https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
上车,雷峰网带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。