Folia
← 返回头版

研究团队提出ProVer框架改进GRPO的信用分配问题

研究人员推出ProVer框架,以解决GRPO(群体相对策略优化)算法在大语言模型代理训练中存在的信用分配问题1。该框架的核心创新在于使用智能评判员对比成功和失败的轨迹来定位关键决策点,随后通过验证这些决策段的优势来优化策略,从而避免了对每个中间状态进行逐步评估的高成本1。验证过程通过估计当前策略在决策段前后的终止成功率差异来衡量优势1。

在ALFWorld、WebShop和SearchQA三个基准任务的实验中,ProVer相比原始GRPO算法取得了显著成效1。在Qwen3.5-2B模型上实现了9.91%的相对改进,在Qwen3.5-4B模型上实现了7.12%的相对改进1。该研究于2026年9月28日提交1。


评论