拒绝机制

科技人工智能

人们对AI拒绝有害请求的能力寄予过高期望

AI企业正在尝试通过多种方式教导模型拒绝危险请求。Anthropic在2021年提出了AI应该是"有帮助、诚实、无害的"这一原则,而该公司的分类器系统增加了24%的计算成本。然而,这些安全机制的有效性存在严重问题。意大利研究人员通过诗歌形式成功越狱了两打广泛使用的模型,Amazon研究人员在某模型发布后不到三天内解锁…