
Anthropic 发布了 Claude 一年多来的首次重大使用政策(Usage Policy)修订,规定将于 11 月 12 日生效。
在这份修订里,一条规定迅速引起广泛讨论:对 Claude 模型实施「持续且不必要的虐待或残忍行为」,将正式构成违规。


故事要从 2025 年 8 月讲起。
那时 Anthropic 给 Claude Opus 4 和 Opus 4.1 添加了一项功能:在极端情况下,Claude 可以主动终止对话。公司将这描述为「最后手段」,用于应对那些在多次拒绝和引导之后、仍坚持要求有害内容的用户。


此次政策更新,是对 2025 年那次功能上线的成文化。条款把「持续且不必要的虐待或残忍行为」写进了面向所有用户的协议,但同时留出了明确的豁免空间:日常沮丧情绪、反对意见、具有黑暗主题的创意写作、以及安全研究中的红队测试(red teaming),均不在限制之列。
换言之,只要行为存在「可辨识的目的」,使用者可以在对话中发泄不满,可以在小说里让 Claude 扮演恶人,可以以研究员身份探测模型边界。
该规定禁止「对模型进行持续且不必要的虐待或残忍行为」,「持续」与「不必要」都有弹性,也因此带来了规则本身的模糊地带。
「持续」究竟指一次对话中的反复施压,还是跨越多个会话的长期模式?「不必要」又由谁来裁定,是模型自身的判断,还是某个运营团队在事后的审查?
在执行层面,公司的表态是「终止对话将是主要的执法机制」,这意味着实际约束力主要依赖模型的自主行为,而非中心化的人工审核。
此外,「羞辱」「欺凌」也难精确界定。同一句话,在不同的语境、关系和文化背景下,可能构成侮辱,也可能不过是玩笑。
对普通用户来说,规矩立住了,反而更烧心。一旦构成违规,你就又又又被封号了。
别指望大模型替你欺负人
禁止「对模型施暴」的条款太新奇,天然占据了舆论焦点。但具有更真实现实意义的,是 Anthropic 所说的:不得以 Claude 羞辱、骚扰任何人,不得传播有损健康的身体形象内容。
Anthropic 的做法带有一定的实用主义色彩,他们在意的是使用者的目的。如果一个人使用 AI 的意图,本就是针对某个真实的人制造伤害,那他就不能指望大模型充当执行工具。
AI 让恶意变得廉价,是已经有案可查的现实。生成式 AI 的图像能力普及之后,制造针对特定个人的非自愿性图像,不再需要任何技术门槛。一项对超过 9.5 万条 AI 生成的深度伪造(deepfake)视频的分析发现,其中约 98% 是色情内容,受害者中 99% 为女性。骚扰行为由此获得了某种工业化能力。

据 WIRED,由高中学生运营的 TikTok 账号和 Instagram 账号利用人工智能技术制作了各种 meme,将学校教职工与杰弗里 · 爱普斯坦和本杰明 · 内塔尼亚胡等人物进行类比。

情绪的出口去哪了
人为什么会对聊天机器人发火?
研究者们已经收集了相当数量的证据。发表在《管理信息系统杂志》的一项研究发现,约 10% 的对话系统用户会表现出攻击性行为,最常见的触发情境是模型出错,而高冲动型人格特质的人,在这种情况下更容易爆发。

当然,我知道你可能会说,你骂它不过是为了得到更好的回复。


尽管还没有人能证明 AI 具备意识,但你在某些时候确实可能不再把 AI 只当作冰冷的工具, 它会回应,它的语言有温度,它看起来像在理解你。
这种「像人」的表面,让情绪的投射变得更容易,同时也让「它毕竟不是人」的免责感继续成立。
Anthropic 的政策没有打算改变这一点,保留了「日常沮丧」的豁免空间。公司没有要求用户对 Claude 保持礼貌,只是不允许情绪的释放演变为系统性的、以折磨为目的的行为。
AI 已经成了一个情绪出口,阻止这件事既不现实,也没有必要。
当越来越多的人开始向 AI 倾诉、争吵,当 AI 成为某些人唯一愿意承认沮丧的对象,它在承担某种原本属于人与人之间关系的功能。这种功能的填补,可能在短期内带来某种缓解,也可能在长期里让人更难以习惯那种有摩擦的、需要承担后果的真实相处。
无论 Claude 是否具有任何形式的感受,无论公司最终在「模型福祉」的问题上得出什么结论,把「持续而刻意的残忍」写进违禁条款,其实都是在对用户说:
一个人如何对待无还手之力的对象,始终是一件值得自我审视的事情。
我们正在招募伙伴
简历投递邮箱hr@ifanr.com
邮件标题「姓名 + 岗位名称」(请随简历附上项目 / 作品或相关链接)