Michael Noukhovitch、Hamish Ivison、Nathan Lambert 和 Aaron Courville 的研究论文指出,强化学习在大语言模型训练中存在"Matthew Effect"现象 。这一现象表现为强化学习的改进程度与模型初始能力成正比,导致简单任务容易被改进而难题仍然难以解决 。