恶意代码检测

科技人工智能

语言模型评估恶意代码时激活道德推理机制

研究人员对混合专家(MoE)语言模型进行了深度分析,发现当被问及代码是否恶意时,这些模型会激活与道德判断相关的神经路径。Manifold研究员Cody Nash领导的研究团队通过路由移植实验和工作空间透镜分析,在三个开源模型——OLMoE、DeepSeek-V2-Lite通用版和编码版上测试了这一现象。研究基于240…