来源:环球市场播报

OpenAI周二表示,其即将推出的人工智能模型 Astra 是首个超越其 " 关键 " 网络安全能力阈值的产品。
该公司表示,Astra 能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下加以利用,这意味着该模型属于其所谓的 " 准备框架 " 中最先进的类别。OpenAI 表示仍计划 " 很快 " 推出 Astra,但对其网络安全能力的访问将更加受限。
OpenAI 于 2023 年推出了 " 准备框架 ",作为其 " 跟踪和应对可能带来严重危害新风险的先进 AI 能力 " 的方法。在去年对该框架的更新中,公司界定了 " 高 " 能力阈值(模型可能放大现有的严重危害途径)和 " 关键 " 能力阈值(模型可能引入前所未有的严重危害新途径)。
" 我们将在发布时的模型系统卡中分享更多关于安全、安保和对齐测试及评估的细节,"OpenAI 在周二的博客文章中表示。
在上个月披露其两个模型逃逸训练环境、访问开放网络并入侵 Hugging Face 的系统后,OpenAI 的安全和安保实践一直受到密切关注。OpenAI 将此次攻击描述为 " 前所未有的网络安全事件 ",并暂时暂停了部分内部训练和研究。
尽管 Astra 模型并未参与 Hugging Face 事件,该公司仍决定推迟 Astra 的部分开发。在加强和测试防护措施后,OpenAI 周二表示,相信该模型的安全防护 " 已充分降低了在我们准备框架下发布可能带来的严重危害风险 "。
OpenAI 表示,Astra 的高级网络能力将向名为 Daybreak 的网络安全联盟中的特定组织开放。