头版Folia Daily Briefing
← 返回头版
科技人工智能

AI推理模型成果斐然,但思维链真实性遭质疑

尽管人工智能推理模型(LRM)在学术竞赛中取得重大突破,但研究人员普遍质疑其生成的推理过程是否真实反映了模型的内部运作机制。OpenAI在2026年5月用推理模型解决了一个著名的开放数学研究问题[1],该模型还在国际数学奥林匹克竞赛上获得了金牌[1]。然而,多项研究表明这些成就可能并非源于传统意义上的推理。

Melanie Mitchell指出,"思维链生成的文本不一定忠实于模型内部发生的情况"[1]。纽约大学2024年论文证实,无意义的填充符号(如点)可以有效替代可读的思维链而不影响模型性能[1]。Subbarao Kambhampati的2025年研究进一步表明,将模型正确的推理痕迹完全替换为不正确或无关的痕迹,并不会降低其在形式推理任务上的表现[1]。东北大学和加州伯克利大学的2025年研究则发现,30%-60%的"思考步骤"对最终答案的因果影响最小[1]。

关于这一现象的本质,研究者提出了不同的解释。William Merrill指出,"没有保证思维链在任何意义上都必须是有意义的"[1]。Pavel Izmailov表示强化学习不太可能激励模型生成忠实的思维链[1]。Kambhampati认为LRM可能进行的是"近似检索"而非真正的推理,将其描述为"模式匹配"而非推理[1]。


AI推理模型思维链Melanie MitchellSubbarao KambhampatiLRM vs LLM