Folia
← 返回头版

语言模型评估恶意代码时激活道德推理机制

研究人员对混合专家(MoE)语言模型进行了深度分析,发现当被问及代码是否恶意时,这些模型会激活与道德判断相关的神经路径1。Manifold研究员Cody Nash领导的研究团队通过路由移植实验和工作空间透镜分析,在三个开源模型——OLMoE、DeepSeek-V2-Lite通用版和编码版上测试了这一现象1。研究基于240个代码样本进行,包括恶意和良性PyPI包、易受攻击和修复后的函数等多种情景1。

研究结果表明,恶意问题的路由距离道德问题最近,在每个模型上都是1.0的同义词单位距离1。通过移植其他问题的路由,研究人员验证了模型确实调用了道德推理机制而非仅进行代码语法分析,尽管移植操作会改变模型答案,但不会传递供体问题的答案或概念1。专家剪枝实验进一步确认了道德路径的关键作用——REAP剪枝删除了524个道德路径细胞中的116个,模型的判断能力仍保持完美(AUROC为1.00),而GPT-OSS-20B更激进的剪枝在保留路径专家的同时导致判断能力显著下降(AUROC从1.00降至0.71),这表明道德路径是路由器的关键咨询机制1。


评论