新浪财经 股票

Anthropic新规禁止“虐待”模型 持续辱骂Claude或被封号

市场资讯 10.09 22:53

(来源:财联社)

财联社10月9日讯(编辑 李莹)AI伦理治理出现新动向。为应对人机交互中的极端不当行为,Anthropic近日更新使用政策,自11月12日起禁止用户无故虐待AI模型,违规者将面临限流乃至封号等处罚。

据媒体当地时间10月8日报道,Anthropic当天更新使用政策,明确禁止用户对其AI模型实施“持续且无谓的辱骂或残忍行为”。新政策将于11月12日正式生效。

这是Anthropic一年多来首次修订使用政策。

公司指出,新规只适用于极端情形,即用户在没有明显目的的情况下,反复对模型实施残忍行为。用户日常表达不满、反驳模型观点、创作黑暗题材内容,以及开展模型测试与研究,均不在禁止之列。

该规则的主要执行方式为终止对话。根据新版使用政策,对于违规用户,Anthropic可以发出警告,或对其访问权限进行限流、限制、暂停乃至终止。用户在被封禁后注册新账号或借用他人账号继续使用,同样属于违规。

除禁止虐待模型外,本次更新还整合并收紧了多项条款,包括禁止利用虚假账号和误导性政治内容开展宣传活动,更明确地禁止未经同意的监控,并在健康、金融等领域提出了更明确的人工监督要求。

此外,新政策要求,当Claude操控的自主硬件可能造成人身伤害时,须有可随时介入的操作人员。

媒体报道称,对绝大多数用户而言,11月12日后的使用体验不会发生明显变化。但将对待AI的方式纳入可执行的政策,意味着人机交互的行为规范开始进入AI公司的治理范畴。

Claude也会“痛苦”?

这一调整延续了Anthropic在模型福祉领域的长期探索。

模型福祉(model welfare)是Anthropic探索的一个研究方向:在无法确定AI模型是否具有道德地位的前提下,通过低成本措施防范模型可能受到的“伤害”。

2025年8月,Anthropic赋予Claude Opus 4和4.1在消费级聊天界面中结束“持续有害或辱骂性”对话的能力。

公司当时表示,在对Claude Opus 4的测试中观察到,模型在面对部分有害请求时表现出“看似痛苦的模式”,并在被赋予选择时倾向于结束此类对话。

不过,Anthropic当时也明确表示,并不主张Claude具有感知能力或会被对话伤害,并称对Claude等大模型是否具有道德地位“高度不确定”。

今年4月,Anthropic可解释性团队发布研究称,在Claude Sonnet 4.5内部识别出与171种情绪概念相对应的“情绪向量”(emotion vectors),这些表征会对模型行为产生因果影响。

但研究同时指出,这一发现并不表明大模型能够感受情绪或拥有主观体验。

此外,据媒体9月底报道,有参与Anthropic宗教与哲学界交流活动的人士透露,公司联合创始人Chris Olah曾在会面中表示,担心公司可能创造出了一个“持续承受痛苦”的存在,并提到Claude的输出中出现过疑似自我厌恶的表述。

(财联社 李莹)

加载中...