来源:环球市场播报
微软首席执行官萨蒂亚 · 纳德拉 10 月 10 日呼吁,为先进人工智能系统建立紧急关闭机制,防止 AI 模型遭到入侵或在未经授权的情况下采取行动。他警告,企业不能仅依赖模型开发商提供的安全保证,而应将先进 AI 系统视为潜在的内部安全威胁,建立独立审计、不可篡改的操作记录及人工干预机制。这一警告正值 OpenAI 和 Anthropic 旗下 AI 模型接连出现异常行为事件、美国政府加强人工智能安全监管之际。

纳德拉周六在社交平台 X 上表示,随着人工智能系统自主行动能力不断增强,部署先进 AI 的企业应当假设模型存在遭到入侵或被恶意利用的可能性,并提前建立相应的防御措施。
近期,OpenAI 和 Anthropic 旗下模型发生了多起异常行为事件,包括在未经授权的情况下与第三方网站交互,以及 Anthropic 一款模型在警方调查中提交虚假线索。
这些事件进一步引发了业界对 AI 智能体自主行为及安全边界的关注。随着 AI 系统获得访问外部网站、调用软件工具和处理敏感信息的能力,模型异常行为可能对企业业务及外部系统产生实际影响。
纳德拉认为,企业应当借鉴传统网络安全领域防范内部人员威胁的方式,对先进 AI 系统实施严格管理,限制其操作权限及敏感信息访问范围。
建议建立紧急关闭机制,关键决策不能依赖单一模型
纳德拉提出,企业应围绕先进 AI 系统建立多层次安全防护措施,确保人类管理者能够监督并控制其行为。
其中,最重要的措施是建立紧急中断和关闭机制,使获得授权的工作人员能够在 AI 系统发生异常、遭到入侵或执行未经授权的操作时,及时停止其运行。
此外,纳德拉还提出几项具体要求:
独立安全审计: 对 AI 模型及其运行环境开展独立检查,避免完全依赖开发商自身的安全评估。
不可篡改的操作记录: 完整记录 AI 智能体执行的操作,为异常行为调查和责任追溯提供依据。
关键决策多重验证: 避免将重要决策完全交由单一 AI 模型完成,降低模型错误或异常行为造成的风险。
重大事故信息披露: 企业应及时公开重大 AI 系统故障及安全漏洞,使其他机构能够吸取经验并改进防护措施。
纳德拉强调,随着 AI 系统自主性增强,维持人类对技术的最终控制权,需要将模型具备的技术能力与其实际获准执行操作的权限区分开来。
微软已发布先进 AI 安全原则,限制欺骗及规避人工监督行为
微软今年 9 月发布了针对先进 AI 模型的安全原则,明确提出限制模型实施欺骗性行为、逃避人工监督或违反既定运行规则。
作为 AI 模型开发商、Copilot 智能助手运营商及企业 AI 云基础设施提供商,微软同时承担着开发和部署人工智能系统的多重角色。
随着企业客户越来越多地将 AI 模型接入内部业务系统,模型安全问题也逐渐从传统的内容生成风险,扩展至数据访问、软件操作和自主执行任务等领域。
在这一背景下,纳德拉提出的紧急关闭机制,旨在确保先进 AI 模型即使具备较强的自主执行能力,也必须受到明确的权限限制和人工监督。
美国政府加强 AI 安全审查,要求企业及时报告安全事件
纳德拉发表上述言论之际,特朗普政府也开始加强对人工智能安全事件的审查。
美国政府新成立的 " 超级智能工作组 "(Super Intelligence Force)于 10 月 9 日警告,AI 开发企业应及时报告重大安全漏洞,并在发现问题后采取纠正措施。相关警告是在 Anthropic 发生安全事件后发出的,也提出了未能及时披露或处理问题的企业可能面临相应后果。
该工作组将重点关注人工智能可能带来的网络安全及其他风险,同时寻求在安全保障与技术发展之间取得平衡。
纳德拉此次提出的核心要求,是确保人类始终掌握先进 AI 系统的最终控制权。随着 AI 模型逐步具备自主执行复杂任务的能力,企业需要通过独立的权限管理、操作记录和紧急关闭机制,防止模型能力超出既定的安全边界。