Folia
← 返回头版

开源提示词注入检测器在对抗AI代理攻击时表现欠佳

研究人员对十款开源提示词注入检测器进行了基准测试,使用629个真实攻击案例和97个良性案例组成的AgentDojo数据集进行评估1。结果显示,这些检测工具在识别隐藏于普通工具输出中的攻击时能力有限1。表现最佳的检测器仅能捕获51%的攻击,同时产生2%的误报1,而Meta的Prompt Guard 2的捕获率仅为1%1。

检测器面临的困境在于难以在攻击指令与合法用户指令之间进行有效区分1。deepset和fmops两款检测器虽然能捕获100%的攻击,但同时也会阻止98%的正常流量1;另有两款检测器则将98%的安全工具输出错误地标记为攻击1。即使调整配置,Prompt Guard 2也未能超过3%的捕获率1。研究表明,基于文本分类的检测方法存在根本局限1。研究人员建议,有效的防御措施应当了解指令来源和工具调用的实际作用,采用基于策略的执行方式比单纯的文本检测更为重要1。


评论