今天看啥  ›  专栏  ›  机器之心

LLM强化学习不稳定之谜,被Qwen团队从「一阶近似」视角解开

机器之心  · 公众号  · AI  · 2025-12-07 12:30
    

主要观点总结

本文报道了阿里千问团队针对大语言模型(LLM)强化学习(RL)的训练方法。研究发现序列级奖励与token级优化目标的不匹配引发了训练理论与稳定性的担忧,因此提出一种全新的RL公式化方法。研究集中在LLM的RL公式化、序列级奖励设置、替代的token级优化目标、MoE模型的挑战及Routing Replay方法等方面,通过实验验证了理论的有效性及训练策略的稳定性。

关键观点总结

关键观点1: 阿里千问团队提出了一种针对大语言模型的强化学习公式化方法,以解决序列级奖励与token级优化目标的不匹配问题。

团队使用替代的token级优化目标作为序列级奖励的一阶近似,并探讨了其有效性条件。同时,针对MoE模型的挑战,引入了Routing Replay方法以提高训练稳定性。

关键观点2: 实验结果表明,提出的RL公式化方法能够有效提高训练稳定性,并且在数学推理任务上取得了显著成果。

通过对比不同训练策略,团队发现带重要性采样校正的基本策略梯度算法(MiniRL)具有最佳性能和最高训练稳定性。此外,Routing Replay和clipping在引入off-policy更新时成为实现稳定训练的关键。

关键观点3: 研究指出未来研究应更关注RL方法本身,而不必过度强调冷启动细节。

通过展示不同冷启动初始化的结果相近,文章强调应更多关注强化学习方法本身,同时稳定的训练过程在成功扩展RL中起着决定性作用。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照