Folia
← 返回头版

机器学习研究代理为何不会过拟合

一项新研究论文揭示了机器学习研究代理在重复迭代优化基准数据集时不会过拟合的原因。1该研究通过将成功的研究策略压缩成极短的令牌提示语,并由无记忆的新代理重现其性能,证明了真正有效的策略具有高度可压缩性。1

研究结果表明,32个令牌的提示足以让新代理在大多数问题上匹配探索者的自适应优化模型,这支持了奥卡姆剃须刀原理的预测。1研究跨八个数据集进行了验证,包括表格分类、图像分类、语言建模、扩散建模和奖励建模。1其中一个语言建模策略甚至被压缩到16个令牌仍保持性能,具体提示为"QKn 12L768 Mu .1 R² b2M 4x"。1即使将反馈信息减少到每次查询仅一比特,代理仍能发现与完整数值分数相同质量的策略。1

在对抗性测试中,研究人员故意设计了102个实验运行以诱发过拟合,其中38个实验中验证准确率超过真实保留数据准确率10%以上。1但当这些过拟合的策略被压缩后,这些虚假优势随之消失。1论文标题为《What fits (into few tokens) doesn't overfit: Compression and generalization in ML research agents》。1


评论