来源:ArXiv AI 2026-08-21 04:00

超越模仿:通过推理进展过滤政策蒸馏

推理 教师 奖励 蒸馏 获得
arXiv:2608.19408v1 公告类型:新 摘要:在策略蒸馏(OPD)通过将学生生成的轨迹与教师的密集标记级监督相结合,已成为训练后语言模型的有效框架。然而,OPD 隐含地假设教师获得的奖励是推理进度的适当代理,因此在策略优化期间平等对待所有教师反馈。但在实践中,这个假设并不总是成立。我们观察到,教师获得的奖励经常与真正的推理进展相冲突,因为具有明确推理进展的推理步骤可能仍然会获得较低的蒸馏奖励,这仅仅是由于与教师输出的偏差。为了解决这种不匹配问题,我们提出了用于策略蒸馏的推理进度感知奖励过滤(R2-OPD),它构建了两个推理跨度的轨迹内排名,一个来自教师获得的奖励,另一个来自独立估计的进度奖励。当两个排名不一致时,蒸馏奖励就会被选择性地抑制,从而减少与推理进度相冲突的监督,同时保留有效的教师指导。我们的方法显示出相对于标准 OPD 的持续改进,尤其是在推理性能方面。

相关文章推荐

返回首页