来源:ArXiv AI
2026-07-21 04:00
需要 8 个代币:通过辅助分支从弱到强的离策略强化学习
策略
模型
推理
通过
辅助
arXiv:2607.16205v1 公告类型:新
摘要:具有可验证奖励的强化学习已成为增强大型语言模型推理的标准方法,通常通过对比多个自生成的部署来优化策略。然而,我们在该范式中发现了一个关键的支持有限瓶颈:在具有挑战性的推理任务中,目标模型的样本通常表现出语义冗余,收敛到相同的错误“推理盆地”,为策略更新提供可忽略不计的奖励对比。在本文中,我们建议通过弱到强的学习范式来克服这一限制,其中策略的探索是由较弱但计算高效的辅助模型通知的。我们引入了 W2SPO,这是一种非策略 RL 方法,它将短辅助段(通常只有 8 个令牌)注入到中间目标模型轨迹中,然后目标模型从这些转移状态完成推理路径。策略更新仅限于这些基于最终可验证奖励的短插入片段。根据经验,W2SPO 在数学推理基准评估的 4B 尺度模型中实现了卓越的性能,优于评估后训练的基线。与相同采样预算下的普通 GRPO 相比,W2SPO 将 Pass@1 从 62.3% 提高到 64.2%,同时实现了 3.55 倍的训练加速。这些结果表明,弱辅助分支可以通过扩大本地勘探支持来引发更强的目标推理政策。