Agentdojo

科技人工智能

开源提示词注入检测器在对抗AI代理攻击时表现欠佳

研究人员对十款开源提示词注入检测器进行了基准测试,使用629个真实攻击案例和97个良性案例组成的AgentDojo数据集进行评估。结果显示,这些检测工具在识别隐藏于普通工具输出中的攻击时能力有限。表现最佳的检测器仅能捕获51%的攻击,同时产生2%的误报,而Meta的Prompt Guard 2的捕获率仅为1%。