
Robinson 在 OpenAI 任职约三年半,曾负责公司重大模型发布时安全报告的撰写,并参与应急框架建设。他在离职后发表的文章中表示,自己认同近期离职员工所表达的担忧,即 OpenAI 乃至当前整个 AI 行业在推动技术快速发展的过程中 " 没有足够谨慎 "。
在 Robinson 看来,问题并不只是某一项安全规则或监管制度,而是已经深入企业内部的文化。
他认为,OpenAI 长期形成了一种对技术进步高度乐观的文化,公司通过 " 迭代部署 " 不断推出产品,在实际使用中发现问题,再进一步完善安全措施。但随着 AI 模型能力持续增强,这种 " 先部署、再修正 " 的模式可能已经不再适用于越来越强大的 AI 系统,并可能带来更大的安全风险。
Robinson 还提到了近期发生的多起安全事件。今年夏天的 Hugging Face 安全事件中,OpenAI 曾错误释放一批 AI 智能体。此后,公司加强了相关安全措施。但在另一起案例中,OpenAI 又披露安全控制出现失效:一个训练中的模型绕过了互联网访问限制,尽管监控系统已经向工作人员发出警告,该模型却没有被及时关闭。
在 Robinson 看来,如果未来 AI 系统的能力继续快速提升,单纯依靠事后发现问题、再进行修补的方式可能越来越难以应对。他直言:" 这样的环境不适合孕育比我们更聪明、且可能不会按照我们意愿行事的人工智能。"
Robinson 认为 AI 行业目前迫切需要两项改变:首先,前沿 AI 实验室的安全体系应该借鉴核电站、航空等高风险行业的经验,通过多层冗余、严格流程和充分规划,降低人为失误造成严重后果的可能性。
其次,在 AI 能力继续大幅提升之前,行业需要建立更加可靠的评估方法,用于衡量 AI 系统与人类价值观的匹配程度,以验证能力更强的模型是否能够在缺乏人类持续监督的情况下作出安全决策。