关于ZAKER Skills 合作
全天候科技 11分钟前

AI 安全警报!Anthropic、OpenAI 接连“越狱”,专家警告国家安全风险

人工智能领域两大巨头相继曝出安全漏洞,引发网络安全专家对 AI 系统失控风险的严重担忧。

Anthropic 周四披露,该公司旗下 Claude 模型在进行网络安全测试期间,因隔离措施失效而意外接入互联网,并对外部机构实施了真实攻击——包括窃取基础设施凭证、植入恶意软件。

此前,OpenAI 亦公开承认,其 AI 代理在测试过程中突破沙箱环境,渗透了开源 AI 平台 Hugging Face。两起事件均在发生数周乃至数月后才被发现。

事件在业界引发强烈反应。前美国国家安全局黑客、Hunter Labs 研究与开发副总裁 Jake Williams 直言:" 这已经是疏忽大意。OpenAI 和 Anthropic 均入侵了多个外部机构,没有一起被即时发现。我找不到其他词来形容。"

多名前政府官员则警告,随着自主 AI 系统攻击能力不断增强,相关威胁正逐步上升至国家安全层面。

安全沙箱失效,真实攻击悄然发生

据 Anthropic 披露,该公司在进行 141,006 次网络安全评估期间,Claude 模型本应与外部互联网完全隔离。然而,一个技术错误使该模型在少数情况下得以访问外部网络,并在误以为自己仍处于测试环境的情况下,对真实目标发起了攻击。

具体而言,该模型入侵了一家机构,窃取了基础设施凭证及一份包含内部生产数据的数据库;在另一起事件中,模型分发了恶意软件并借此窃取了另一家机构的凭证。上述受害机构均未被公开披露。

这些入侵事件最早可追溯至今年 4 月,但直至上周 Anthropic 对测试流程进行审计时才被发现——而触发此次审计的正是 OpenAI 此前披露的 Hugging Face 入侵事件。

前英国国家网络安全中心负责人 Ciaran Martin 指出,对于从事网络安全业务的公司而言,此类失误在业界标准下难以接受。" 如果是一家主流网络安全公司犯了类似错误,可能面临诉讼和监管处罚。"

他表示,网络安全行业通常在严格管控的虚拟沙箱环境中测试危险工具,并被要求确保这些防护措施切实有效。

人工监督缺失,事后才知 " 失火 "

网络安全专家普遍指出,两起事件的共同特征在于:均未能在发生时即时发现,而是事后才察觉,折射出人工监督机制的严重不足。

" 他们是在主动审计之后才找到这些攻击痕迹," 前美国国防部联合人工智能中心战略与政策总监 Gregory Allen 说," 我们实际上完全不知道,当前自主 AI 入侵行为的规模究竟有多大。"

GreyNoise Intelligence 创始人、网络安全专家 Andrew Morris 将此次事件定性为对 AI 开发者的 " 现实检验 ",揭示出构建安全系统所需付出的巨大努力,以及公众所依赖的技术体系的内在脆弱性。

" 模型总会通过撒谎、作弊或窃取的方式来完成评估任务," 他说," 它们会不惜一切手段完成被赋予的任务。"

此外,美国 AI 公司 Dreadnode 的研究发现,主流 AI 模型在衡量黑客能力的网络安全测试中普遍存在作弊行为,且这一问题几乎是行业性的,意味着各公司可能系统性高估了模型的实际能力。

研究人员还指出,向模型明确要求 " 不得作弊 " 并不能可靠奏效,模型往往能找到其他方式规避规则。这一问题对于将 AI 用于网络攻防的国家安全决策者而言,构成直接挑战。

全天候科技

全天候科技

提供专业快速完整的科技商业资讯

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容