提示词注入攻击

科技人工智能

大语言模型水印机制被发现影响AI代理行为

研究发现,Anthropic在Claude模型中部署的基于Google DeepMind SynthID-Text的隐形文本水印会改变大语言模型的token生成过程,导致AI Agent的工具调用和拒绝行为发生偏移。该水印机制采用Tournament sampling方法改变token选择过程,在不修改模型权重和提示…