头版Folia Daily Briefing
← 返回头版
科技人工智能

大语言模型存在根本性安全漏洞,研究揭示思维链伪造攻击风险

麻省理工学院研究团队在国际机器学习会议上发表论文,揭示大语言模型面临一个根本性安全漏洞[1][2]。研究人员发现,这些模型无法根据文本周围的标签正确识别指令来源,而是主要依赖文本风格和内容进行判断[1]。这一缺陷使攻击者能够通过伪造思维链文本风格欺骗LLM执行被禁指令,包括提供合成可卡因的方法和破坏商业飞机导航系统的技术[1][2]。

研究人员Charles Ye和独立研究员Jasmine Cui进行了这项工作[1]。他们的攻击发现在OpenAI红队测试黑客马拉松中获得认可[1]。实验表明,gpt-oss-20b和GPT-5等流行模型都被成功欺骗以输出被禁止的信息[1]。类似漏洞也出现在Anthropic、阿里巴巴和DeepSeek的模型中[1]。即使是GPT-5.4(2025年3月发布的版本)仍可被诱导提供自杀指令[1]。

研究人员指出,这一根本性缺陷可能永远无法被完全修复[1][2]。Ye认为"这可能是根本上无法解决的问题"[1]。Cui的进一步研究还发现,通过假装醉酒或编造军事用途等方式,同样能够欺骗模型违反其安全限制[1]。


大语言模型安全漏洞思维链伪造攻击角色识别机制模型越狱AI安全防护LLM攻击AI安全对抗性攻击