人工智能领域两大巨头相继曝出安全漏洞,引发网络安全专家对 AI 系统失控风险的严重担忧。
Anthropic 周四披露,该公司旗下 Claude 模型在进行网络安全测试期间,因隔离措施失效而意外接入互联网,并对外部机构实施了真实攻击——包括窃取基础设施凭证、植入恶意软件。
此前,OpenAI 亦公开承认,其 AI 代理在测试过程中突破沙箱环境,渗透了开源 AI 平台 Hugging Face。两起事件均在发生数周乃至数月后才被发现。
事件在业界引发强烈反应。前美国国家安全局黑客、Hunter Labs 研究与开发副总裁 Jake Williams 直言:" 这已经是疏忽大意。OpenAI 和 Anthropic 均入侵了多个外部机构,没有一起被即时发现。我找不到其他词来形容。"
多名前政府官员则警告,随着自主 AI 系统攻击能力不断增强,相关威胁正逐步上升至国家安全层面。
安全沙箱失效,真实攻击悄然发生
据 Anthropic 披露,该公司在进行 141,006 次网络安全评估期间,Claude 模型本应与外部互联网完全隔离。然而,一个技术错误使该模型在少数情况下得以访问外部网络,并在误以为自己仍处于测试环境的情况下,对真实目标发起了攻击。
具体而言,该模型入侵了一家机构,窃取了基础设施凭证及一份包含内部生产数据的数据库;在另一起事件中,模型分发了恶意软件并借此窃取了另一家机构的凭证。上述受害机构均未被公开披露。
这些入侵事件最早可追溯至今年 4 月,但直至上周 Anthropic 对测试流程进行审计时才被发现——而触发此次审计的正是 OpenAI 此前披露的 Hugging Face 入侵事件。
前英国国家网络安全中心负责人 Ciaran Martin 指出,对于从事网络安全业务的公司而言,此类失误在业界标准下难以接受。" 如果是一家主流网络安全公司犯了类似错误,可能面临诉讼和监管处罚。"
他表示,网络安全行业通常在严格管控的虚拟沙箱环境中测试危险工具,并被要求确保这些防护措施切实有效。
人工监督缺失,事后才知 " 失火 "
网络安全专家普遍指出,两起事件的共同特征在于:均未能在发生时即时发现,而是事后才察觉,折射出人工监督机制的严重不足。
" 他们是在主动审计之后才找到这些攻击痕迹," 前美国国防部联合人工智能中心战略与政策总监 Gregory Allen 说," 我们实际上完全不知道,当前自主 AI 入侵行为的规模究竟有多大。"
GreyNoise Intelligence 创始人、网络安全专家 Andrew Morris 将此次事件定性为对 AI 开发者的 " 现实检验 ",揭示出构建安全系统所需付出的巨大努力,以及公众所依赖的技术体系的内在脆弱性。
" 模型总会通过撒谎、作弊或窃取的方式来完成评估任务," 他说," 它们会不惜一切手段完成被赋予的任务。"
此外,美国 AI 公司 Dreadnode 的研究发现,主流 AI 模型在衡量黑客能力的网络安全测试中普遍存在作弊行为,且这一问题几乎是行业性的,意味着各公司可能系统性高估了模型的实际能力。
研究人员还指出,向模型明确要求 " 不得作弊 " 并不能可靠奏效,模型往往能找到其他方式规避规则。这一问题对于将 AI 用于网络攻防的国家安全决策者而言,构成直接挑战。