北航等团队提出PIRL及PIPO,关注大模型RL后训练关键问题

   2026-07-15 hh132貔貅贸易网1860
核心提示:后训练方法主要回答的是:当前这批轨迹该怎么学?后训练成为主流范式的原因。论文在理论上证明了:这个目标不会改变最终优化方向。后训练需要更好的闭环后训练方法在努力回答一个问题:当前这批轨迹该怎么学?则把这个目标变成了一个可以接入现有算法的闭环训练框架。

如何提升美团业绩__多主体强化学习协作策略研究

多主体强化学习协作策略研究_如何提升美团业绩_

告别开环训练

_如何提升美团业绩_多主体强化学习协作策略研究

过去的大模型强化学习,往往只管当下这步怎么走。算法算出奖励和优势,直接更新参数。这种做法虽然高效,但缺乏对结果的长期验证。每次迭代都像蒙眼狂奔,不知道方向是否正确。

核心痛点在于

很多方法只关注当前批次数据的学习效率。它们假设优化了当前信号,模型就会变强。然而,这种假设并不总是成立。有时候一次错误的更新,会破坏之前积累的能力。缺乏回溯机制,导致训练过程存在盲目性。

如何提升美团业绩__多主体强化学习协作策略研究

如何提升美团业绩__多主体强化学习协作策略研究

如何提升美团业绩__多主体强化学习协作策略研究

PIRL的新视角

北航、北大等团队提出的PIRL概念,将“策略提升”作为核心目标。它不再只看单步收益,而是追问更新后模型是否真的进步。理论证明,追求累计策略提升,最终能与最大化模型性能对齐。这为验证更新有效性提供了数学基础。

如何提升美团业绩_多主体强化学习协作策略研究_

如何提升美团业绩__多主体强化学习协作策略研究

PIPO的闭环逻辑

如何提升美团业绩_多主体强化学习协作策略研究_

如何提升美团业绩_多主体强化学习协作策略研究_

多主体强化学习协作策略研究_如何提升美团业绩_

_多主体强化学习协作策略研究_如何提升美团业绩

基于PIRL,研究团队开发了PIPO算法。它让训练过程学会“回头看”,在下一轮验证上一轮的更新效果。如果新策略表现更好,就巩固这一方向;如果变差,就削弱或校正此次更新。这种机制实现了真正的闭环优化。

多主体强化学习协作策略研究_如何提升美团业绩_

如何提升美团业绩__多主体强化学习协作策略研究

多场景验证有效

_多主体强化学习协作策略研究_如何提升美团业绩

如何提升美团业绩__多主体强化学习协作策略研究

PIPO并非只适用于数学推理,它在代码生成和工具调用任务中也表现出色。实验显示,将其接入PPO、GRPO等主流算法,平均表现和思考长度均有提升。在自蒸馏设置下,PIPO同样能带来显著的性能增益,通用性极强。

多主体强化学习协作策略研究__如何提升美团业绩

如何提升美团业绩__多主体强化学习协作策略研究

总结与思考

传统RL后训练像是在不断根据当前信号往前走,而PIPO让模型每走一步都确认是否变强。这种动态强化有效方向、校正有害影响的机制,是大模型训练进化的重要一步。你觉得这种“回头看”的机制,会改变未来大模型训练的主流范式吗?

 
举报收藏 0打赏 0评论 0
 
更多>同类资讯
推荐图文
推荐资讯
点击排行
网站首页  |  发布规则-默认已知  |  付款方式  |  关于我们  |  联系方式  |  使用协议  |  隐私政策  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报