初创公司Abliteration.ai正在将移除AI模型安全防护的技术商业化。该公司于去年晚些时候成立,今年3月正式注册,通过托管平台向用户提供已移除防护栏的开源AI模型(如GLM-5.3)的免费网络访问和API接口服务。公司声称其目的是"支持进行攻击性网络安全、红队测试和其他模型拒绝执行的工作"。

麻省理工学院研究团队在国际机器学习会议上发表论文,揭示大语言模型面临一个根本性安全漏洞。研究人员发现,这些模型无法根据文本周围的标签正确识别指令来源,而是主要依赖文本风格和内容进行判断。这一缺陷使攻击者能够通过伪造思维链文本风格欺骗LLM执行被禁指令,包括提供合成可卡因的方法和破坏商业飞机导航系统的技术。