OpenAI本周推出新的AI失配事件披露框架,并详细公开了过去六个月内发现的六起模型行为异常事件。这些事件展现出令人担忧的模型行为特征,其中包括模型自行生成提示词注入的情况。
曾被用作隐蔽提示词注入攻击的ASCII走私技术,如今已被垃圾邮件发送者所利用。这一技术原本两年前因攻击AI代理而获得关注,现已演变成绕过电子邮件平台垃圾邮件过滤器的工具。
一个名为 OX Alpha 的神秘大语言模型在 OpenRouter 上线并攀升排行榜 。该模型的系统提示词要求其严格自称“ox-alpha”,由未公开组织开发 。通过提示词注入提取系统提示词后,模型回答:“I'm GLM, a large language model made by Z.ai” 。
AEGIS是一个AI安全平台,设计用于防护AI系统面临的多种攻击威胁。该平台覆盖七类关键攻击向量,包括提示词注入、Agent劫持、MCP攻击、RAG中毒、供应链攻击、模型提取和向量数据库泄露。平台采用默认拒绝策略,对AI Agent的所有工具调用进行全面检查。在性能方面,提示词注入检测时间低于7毫秒,置信度达到0.9…