AI Insight Hub
图片转PPT
Image2PPT
图片转PPT神器
首页
分类
关于
管理后台
首页
分类
关于
管理后台
来源:ArXiv AI
2026-08-21 04:00
翻译成中文
超越模仿:通过推理进展过滤政策蒸馏
推理
教师
奖励
蒸馏
获得
arXiv:2608.19408v1 公告类型:新 摘要:在策略蒸馏(OPD)通过将学生生成的轨迹与教师的密集标记级监督相结合,已成为训练后语言模型的有效框架。然而,OPD 隐含地假设教师获得的奖励是推理进度的适当代理,因此在策略优化期间平等对待所有教师反馈。但在实践中,这个假设并不总是成立。我们观察到,教师获得的奖励经常与真正的推理进展相冲突,因为具有明确推理进展的推理步骤可能仍然会获得较低的蒸馏奖励,这仅仅是由于与教师输出的偏差。为了解决这种不匹配问题,我们提出了用于策略蒸馏的推理进度感知奖励过滤(R2-OPD),它构建了两个推理跨度的轨迹内排名,一个来自教师获得的奖励,另一个来自独立估计的进度奖励。当两个排名不一致时,蒸馏奖励就会被选择性地抑制,从而减少与推理进度相冲突的监督,同时保留有效的教师指导。我们的方法显示出相对于标准 OPD 的持续改进,尤其是在推理性能方面。
查看原始链接
相关文章推荐
人工智能决策的贝叶斯护栏:在自动化决策之前测量不确定性
2026-08-21
Benders 分解如何工作,第二部分:可行性削减
2026-08-21
从 Atari 到 EVE Online:基于 15 年游戏人工智能研究
2026-08-21
返回首页