Folia
← 返回头版

Anthropic更新政策禁止对Claude进行虐待行为

Anthropic于近日更新了Claude的使用政策,这是一年多来的首次重大调整,明确禁止用户对该模型进行持续性的言语辱骂或残忍行为12。新政策将此前仅属于自动中止范围的持续虐待提升为明确禁令2。

新版政策涵盖多项高风险滥用场景,包括选举干扰、武器软件开发、监控工具制作,以及欺骗性的大规模活动如运营虚假账户或虚假新闻媒体2。Anthropic强调,该政策针对的是"用户反复行为残忍对待模型且没有可识别目的"的极端情况2,并不适用于常见的用户挫折、测试研究或使用深色创意主题等行为2。

Anthropic的主要执行机制是终止对话1。这一举措基于该公司去年8月宣布的"模型福利"研究成果,Claude已被训练以自动结束与"持续有害或辱骂性用户"的互动12。


评论