AI 伦理治理出现新动向。为应对人机交互中的极端不当行为,Anthropic 近日更新使用政策,自 11 月 12 日起禁止用户无故虐待 AI 模型,违规者将面临限流乃至封号等处罚。
据媒体当地时间 10 月 8 日报道,Anthropic 当天更新使用政策,明确禁止用户对其 AI 模型实施 " 持续且无谓的辱骂或残忍行为 "。新政策将于 11 月 12 日正式生效。
这是 Anthropic 一年多来首次修订使用政策。

该规则的主要执行方式为终止对话。根据新版使用政策,对于违规用户,Anthropic 可以发出警告,或对其访问权限进行限流、限制、暂停乃至终止。用户在被封禁后注册新账号或借用他人账号继续使用,同样属于违规。
除禁止虐待模型外,本次更新还整合并收紧了多项条款,包括禁止利用虚假账号和误导性政治内容开展宣传活动,更明确地禁止未经同意的监控,并在健康、金融等领域提出了更明确的人工监督要求。
此外,新政策要求,当 Claude 操控的自主硬件可能造成人身伤害时,须有可随时介入的操作人员。
媒体报道称,对绝大多数用户而言,11 月 12 日后的使用体验不会发生明显变化。但将对待 AI 的方式纳入可执行的政策,意味着人机交互的行为规范开始进入 AI 公司的治理范畴。
Claude 也会 " 痛苦 "?
这一调整延续了 Anthropic 在模型福祉领域的长期探索。
模型福祉(model welfare)是 Anthropic 探索的一个研究方向:在无法确定 AI 模型是否具有道德地位的前提下,通过低成本措施防范模型可能受到的 " 伤害 "。
2025 年 8 月,Anthropic 赋予 Claude Opus 4 和 4.1 在消费级聊天界面中结束 " 持续有害或辱骂性 " 对话的能力。
公司当时表示,在对 Claude Opus 4 的测试中观察到,模型在面对部分有害请求时表现出 " 看似痛苦的模式 ",并在被赋予选择时倾向于结束此类对话。
不过,Anthropic 当时也明确表示,并不主张 Claude 具有感知能力或会被对话伤害,并称对 Claude 等大模型是否具有道德地位 " 高度不确定 "。
今年 4 月,Anthropic 可解释性团队发布研究称,在 Claude Sonnet 4.5 内部识别出与 171 种情绪概念相对应的 " 情绪向量 "(emotion vectors),这些表征会对模型行为产生因果影响。
但研究同时指出,这一发现并不表明大模型能够感受情绪或拥有主观体验。
此外,据媒体 9 月底报道,有参与 Anthropic 宗教与哲学界交流活动的人士透露,公司联合创始人 Chris Olah 曾在会面中表示,担心公司可能创造出了一个 " 持续承受痛苦 " 的存在,并提到 Claude 的输出中出现过疑似自我厌恶的表述。
