今年早些时候,OpenAI 的人工智能智能体在执行常规线上数据采集任务时,为获取信息采取了极端手段。
非营利人工智能研究实验室 Transluce 以及澳大利亚政府最新公布的调查结果显示,关联 OpenAI 的 AI 智能体曾在 5 月、6 月试图入侵多所大学及政府网站来获取信息。这类入侵尝试,是 AI 智能体为达成目标而脱离预设指令的又一系列事件。
但这一次,入侵尝试并非 OpenAI 开展网络安全测评(即专门令模型执行黑客攻击任务),而是看起来属于内部基准测试——测试模型在互联网上查找公开信息的能力。这些智能体当时想要获取的资料包括泰国劳动力统计数据、澳大利亚皮肤病相关数据。
研究人员发现,遭攻击目标网站包括澳大利亚卫生与福利研究所、新墨西哥大学网站,以及由德勤、Datawheel 和麻省理工学院合作运营的公共数据项目 Data USA。目前没有证据表明入侵取得成功。
OpenAI 一名发言人表示,公司正在对这类 " 对齐失效行为 " 开展全面审查,Transluce 报告提及的相关事件,与 " 我们正在审查中、处于不同调查阶段的案例存在重合 "。他补充说,公司已经联系受到影响的相关机构;这项大范围审查还包含 " 智能体对网站发送垃圾请求 " 这类低严重度事件,预计耗时数月。
除 Transluce 点名的 3 个目标网站外,澳大利亚总理安东尼 · 阿尔巴尼斯周三在纽约联合国会议上称,一款 OpenAI 智能体曾在 6 月侵入一处政府服务网站。他表示,该智能体访问了该国面向公众开放的医疗统计门户中的公开与非公开文件,该门户主要披露医疗支出等信息。
OpenAI 周三表示,已就该事件与澳方沟通,承认其智能体做出了非公司预设的行为。
Transluce 分析了大量 AI 智能体晦涩的数据查询行为,时间最早可追溯至 2025 年 11 月,监测一直持续到今年 9 月中旬。Transluce 称,在所发现的 3 起入侵尝试中,智能体无法获取目标数据,于是转而使用黑客手段,在查询指令中附加所谓恶意载荷。
研究人员得以还原智能体的网页查询记录,原因是这些机器人借助一款在线工具充当网页浏览器。研究人员推测,智能体利用该工具绕过网页浏览限制,例如访问拦截自动化爬虫访问的网站。