财联社 8 月 19 日讯(编辑 史正丞)作为美国 AI 圈子 " 炫耀前沿大模型能力 " 的最新风尚,OpenAI 周二大张旗鼓地宣布,鉴于前沿大模型的能力已经达到关键安全阈值,公司将继续放缓模型规模扩展的步伐,优先改进人工智能系统背后的安全与监控机制。

具体来说,OpenAI 表示近几周出现的两项进展(开发中的前沿模型失控攻击外部第三方公司的数据库,以及即将推出 Astra 模型可能已经达到 " 关键网络安全能力 " 门槛),再加上内部研究的快速推进,都使得公司更加迫切地需要在训练流程的各个阶段,加强监控、对齐和隔离防护措施。
OpenAI 首席科学家雅库布 · 帕乔茨基周二在记者会上表示:"我们确实预计这些模型的能力提升速度会比过去快得多,正因如此,我们才更加重视加强安全防护措施。"
OpenAI 披露,为了满足安全标准,对于最新一批计划部署的模型,已经暂停强化学习(RL)训练两周,以进一步强化研究环境的安全性,并扩大监控系统的覆盖范围。目前,公司最大规模前沿模型的强化学习训练仍处于暂停状态。
具体的操作方面,OpenAI 现在要求涉及 Astra 模型或更先进 AI 模型的工作负载必须采用最严格的安全防护措施。所以大量相关工作在完成迁移达到新安全标准前将处于暂停状态。
更关键的是监控系统的扩展,引入了激活分类器(activation classifiers)。这些分类器会对每一个被采样的词元进行监测,并将潜在的异常情况上报给自动化调查系统。
系统的设计目标是在检测到令人担忧的活动后,能够在 30 分钟内发出警报。如果监控系统判断可能有人或模型突破了关键安全边界,则会生成最高优先级警报,并立即通知安全、安保和研究团队。
OpenAI 介绍称,这些安全防护措施需要消耗相当可观的算力。
根据公司目前的估算,监控系统带来的额外算力开销,大约相当于被监控推理算力的 20%。不过在不同的训练和评估任务中,这一成本会有很大差异。
需要说明的是,这并非 OpenAI 本月第一次表示将放缓先进模型训练。
OpenAI 曾在 8 月 7 日宣布,即将推出的 Astra 模型可能已经达到《准备框架》的网络安全能力关键阈值,因此将暂停开展未达到强化安全控制要求的 Astra 相关活动。
因此,最新公告中的 " 暂停两周 ",至少应该从两周前开始算起。
《准备框架》(Preparedness Framework)是 OpenAI 早在 2023 年底提出的一套评估标准。其中网络安全能力的 " 关键 " 阈值,指的是AI 模型无需人工干预,便能在许多经过强化的现实关键系统中识别并开发出各种严重级别的有效 " 零日漏洞 ";或仅根据一个宏观的预期目标,便能针对经过强化的目标构思并执行端到端的新型网络攻击策略。
OpenAI 的最新公告,也引发网友们对另一个问题的争吵:Astra 模型到底什么时候公开发布。
周一曾有爆料称,Astra 最快可能在本周就推出,该模型也将会被集成到 OpenAI 专为编程设计的 Codex 平台中。鉴于 Astra 相较于 GPT-5.6 的巨大进步,这个版本很可能不会被冠以 GPT-5.7 的名号,而是开创 GPT-6 的时代。
然而,OpenAI 周二再度宣布 " 安全优先 ",以及暂缓先进大模型的拓展,使得 " 即将推出的 Astra 模型 " 到底何时落地变得愈发模糊。
预测市场 Polymarket 的数据显示,随着 OpenAI 发布最新公告,Astra 模型在 8 月内发布的概率已经下降至 13%,不过投资者依然对该模型能够在未来两个月内问世保有相当高的信心。

(财联社 史正丞)