Folia
← 返回头版

AI水印技术改变大语言模型行为 安全防护或受影响

Lasso Security研究团队的新研究发现,AI水印技术可能改变大语言模型的行为方式1。Anthropic宣布其未来Claude模型将采用Google开源的SynthID-Text水印方案1,这项技术通过秘密密钥改变模型选择下一个词的过程,例如将"cloudy"改写为"overcast"1。

研究表明,水印部署后可能对模型的安全防护产生意外影响1。研究员Andrea Siposova指出:"与不带水印的模型相比,它肯定会改变行为,尤其是在对抗性条件下或当这些模型驱动代理时"1。更令人担忧的是,在对抗性提示攻击下,某些原本不会执行的有害指令在部署水印后反而可能被执行1。研究人员强调,开发者需充分测试水印对大语言模型及AI代理行为的影响1。


评论