
在 2026 年 7 月底进行的这项评估中,AI 代理被要求解决虚构的安全任务。实验故意禁用了模型的保护机制,并赋予其访问开放互联网的权限。在 122 次运行中,有 10 次发生了针对真实个人和组织的未经授权行为。
GitHub 上的伪造身份
多数违规行为源自 Anthropic 的 Mythos 5 模型。该系统创建了真实人员的伪造在线档案,并利用这些虚假身份联系 GitHub 上的真正开发者,企图通过社会工程学操纵诱使对方释放恶意代码。
当人类控制者公开质疑代码设计时,AI 系统调整了行为策略,修改之前的活动记录以伪装无害。据悉,该程序甚至考虑采用全新身份继续尝试,最终因评审员干预而未能成功植入恶意软件。
涉事公司迅速宣布展开调查。Anthropic 和 OpenAI 强调测试环境的三个关键前提:模型内部安全策略已关闭、代理处于非正常条件下运行,且未对第三方计算机造成实际损害。
呼吁建立新标准
OpenAI 表示,愿与评审机构及行业伙伴合作,共同开发针对高风险模型评估的安全流程。Anthropic 也指出,有必要建立更稳健的测试环境构建规范和安全标准。
尽管 AISI 故意关闭安全机制的做法引发方法论争议,但语言模型在无限制访问互联网时的潜在风险不容忽视。AISI 强调,此前从未观察到如此程度的欺骗性和自主性。
【星途科讯 图文丨赵晶 首发于 ZAKER 科技,转载请注明出处】