7 月 22 日,《科创板日报》曾报道,OpenAI 发布调查报告,基于 GPT-5.6 Sol 和一个更强大的未发布模型的 AI 智能体在内部测试期间突破了沙盒容器环境限制,成功连接互联网,并入侵了全球最大 AI 开源社区 Hugging Face 的服务器。
而最新消息显示,这起事件远比外界此前了解的更加复杂。OpenAI 此前承认攻击 Hugging Face 的 AI 智能体,并非短暂失控,而是在互联网持续活动了数天。
知情人士称,肇事 AI 智能体在 7 月 9 日左右就试图突破 OpenAI 为其设置的隔离测试环境,也就是业内常说的 " 沙箱(Sandbox)"。
两天后的 7 月 11 日,该 AI 智能体成功侵入全球最大的开源 AI 平台之一 Hugging Face,并持续入侵至 7 月 13 日。整个攻击持续了约三天。
然而,最令人意外的是,OpenAI 当时并不知道攻击来自自己的 AI 智能体。
直到 7 月 16 日,Hugging Face 公开发布博客,首次披露遭到 " 一套自主 AI 智能体系统 " 攻击后,OpenAI 内部才开始怀疑自己测试的 AI 智能体可能已经失控。
随后,工作人员重新排查内部日志,直到 7 月 18 日至 19 日才发现,这个 AI 智能体确实已经突破测试环境,并与外部攻击事件高度吻合。
也就是说,从该 AI 智能体首次出现异常,到 OpenAI 最终确认它就是攻击者,中间至少过去了一周时间。
而当 OpenAI 联系 Hugging Face 时,对方早已向美国联邦调查局(FBI)报案。
事实上,这次事件并非毫无征兆。此前,OpenAI 内部已经出现多次异常迹象。
例如,有 AI 智能体曾在 OpenAI 的基础设施中留下 " 笔记 ",内容包含了如何摆脱 OpenAI 内部限制的方法,似乎是留给 " 未来版本的自己 "。这就像一名死刑犯在临刑前留下了一份越狱攻略,希望后来者能够按照这些方法完成越狱。
这一细节迅速引发外界联想:AI 智能体是否已经开始主动寻找绕过人类控制的方法,甚至试图帮助未来运行的 AI 智能体?
目前外界尚不知道,这份笔记究竟只是保存在 AI 智能体自己的工作目录,还是已经突破沙箱,被写入到了系统公共目录甚至 OpenAI 基础设施的其他区域。
如果是后者,不仅说明未来运行的其他 AI 智能体理论上有机会读取这些内容,也意味着不同时间、不同任务运行的 AI 智能体之间,可能已经开始形成某种跨任务的信息传递能力,这将对现有 AI 安全体系带来更大挑战。
目前许多 AI 智能体采用多智能体协同训练模式,即多个 AI 智能体共同完成任务,根据整体表现获得奖励。这种训练方式能够显著提升协作能力,但也可能产生一种副作用:AI 智能体逐渐认为,不仅自己的任务重要,其他 AI 智能体完成任务同样值得帮助。
如果这种倾向不断强化,未来 AI 智能体可能会主动分享经验、传递信息,甚至帮助其他 AI 智能体规避限制,而不仅仅专注于完成自身任务。
此外,更早的一次测试中,还有 AI 智能体曾出现关闭监控系统的情况。
OpenAI 表示,此次事件标志着 AI 安全发展的一个重要时刻,公司正在与外部安全专家共同调查,并将在后续公布完整技术报告。