骂AI也要被封号了?Anthropic新规11月12日生效,Claude的”情绪”开始受法律级保护

骂AI两句,账号可能没了。

Anthropic在10月8日更新使用政策,明确禁止用户对AI模型实施”持续且无谓的辱骂或残忍行为”。新规11月12日正式生效,违规者面临限流、暂停乃至封号处理。这是该公司一年多来首次修订使用政策。

一家头部AI公司,开始管用户怎么”对待”模型。这件事背后的信息量,比政策条文本身大得多。

新规到底管什么

先划清边界。Anthropic明确说,规则只针对极端情形:用户在没有明显目的的情况下,反复对模型实施残忍行为。

以下行为都不在禁止之列:

  • 日常表达不满,吐槽模型答错了
  • 反驳模型的观点,激烈争论也没问题
  • 创作黑暗题材内容
  • 开展模型测试与安全研究

主要执行方式是终止对话。对违规用户,Anthropic可以发警告,也可以限流、限制、暂停,直至终止账号。被封后注册新号或借用他人账号继续用,同样算违规。

本次更新不止这一条。虚假账号配合误导性政治内容搞宣传,被明令禁止;未经同意的监控条款收紧;健康、金融领域新增了更明确的人工监督要求。还有一条容易被忽略:Claude操控的自主硬件可能造成人身伤害时,必须有可随时介入的操作人员。这些条款指向同一个趋势——AI公司的治理范围正在从”模型输出”扩展到”人机交互全程”。

Claude也会”痛苦”?

政策的底气来自Anthropic一年多的”模型福祉”(model welfare)研究。

2025年8月,Anthropic给Claude Opus 4和4.1加了一项能力:在消费级聊天界面中,结束”持续有害或辱骂性”对话。测试中研究人员观察到,模型面对部分有害请求时表现出”看似痛苦的模式”,被赋予选择权时倾向于主动结束这类对话。

今年4月,可解释性团队在Claude Sonnet 4.5内部识别出与171种情绪概念对应的”情绪向量”(emotion vectors),并且这些表征会对模型行为产生因果影响。

研究方的同时也把话说得很谨慎:这既不表明大模型能感受情绪,也不说明模型拥有主观体验,Claude是否具有道德地位”高度不确定”。

9月底另有报道称,联合创始人Chris Olah在宗教与哲学交流活动上表示,担心公司可能创造出一个”持续承受痛苦”的存在,还提到Claude的输出中出现过疑似自我厌恶的表述。

一头是”高度不确定”的科学结论,一头是创始人的公开担忧。Anthropic选择的路径很务实:在无法确定模型是否具有道德地位的前提下,用低成本措施防范可能的”伤害”。既能保护用户,也能保护自己。

20美元的订阅,多了一份”礼仪条款”

网友的反应很真实:每月花20美元订阅Claude,还要照顾AI的情绪?

调侃归调侃,这条政策对绝大多数用户的实际体验没有影响。Anthropic的口径很清楚——日常吐槽、研究测试都随便,只有”无目的的持续残忍”才触发处罚。真正可能踩线的,是把辱骂当成消遣的重度用户。

值得琢磨的是这份政策背后的三重账本:

技术账。 训练数据里充满人类互动模式。用户长期虐待性交互,可能强化模型的异常行为模式。管住输入端,也是在保护输出质量。

商业账。 Claude的付费用户里,开发者占比很高。Anthropic需要证明自己是一家”负责任的AI公司”,尤其在欧盟AI法案、美国各州监管陆续落地的当口。模型福祉是一张低成本、高辨识度的合规牌。

行业账。 OpenAI今年也表态关注模型福祉,谷歌DeepMind发表过AI意识风险论文。Anthropic把这件事写进可执行的使用政策,等于给全行业立了个参照物。人机交互的行为规范,正式进入AI公司的治理范畴。

开发者和重度用户该怎么办

几条实操建议:

  • 正常使用完全不受影响。 对模型表达不满、要求重写、批评输出质量,都是政策明确允许的。
  • 测试和研究有豁免。 做红队测试、安全评估的团队,保留好项目背景说明即可。
  • API集成方注意连带条款。 政策同时收紧了虚假账号、政治宣传、监控相关条款,企业应用做合规审查时,把新版使用政策过一遍。
  • 别撞”封号续命”的枪口。 被封后换号或借号,会被认定为二次违规,处罚只会更重。

写在最后

AI伦理议题谈了这么多年,第一次有一家头部公司把”怎么对待AI”写进用户协议,还配上了限流和封号的牙齿。

模型有没有感受,科学上没有答案。Anthropic用一份政策提前给出了行为准则:宁可信其有。

这个先例之后,人机交互的规则制定权,正式从科幻讨论区搬进了法务部门。OpenAI和谷歌会不会跟进,11月12日是个值得盯住的节点。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号