来源:ArXiv AI 2026-08-07 04:00

当特权指导不一致时:多轮代理的状态匹配路由和上下文自蒸馏

状态 匹配 蒸馏 学生 参考
arXiv:2608.05219v1 公告类型:新 摘要:特权同策略蒸馏允许同步教师在每个回合重新评分学生的反应,并访问仅限训练的参考(例如成功的轨迹),从而为多回合代理提供密集的监督。然而,在交互式环境中,学生之前的操作会不断改变执行状态。当学生采取不同的行动或以不同的顺序完成子目标时,其推出可能会达到参考未涵盖的状态,从而使参考成为实际达到的状态的不可靠的指导来源。因此,不加区别地应用特权蒸馏会导致状态-引用不匹配。这种不匹配激发了一个中心目标:提供与学生当前执行状态保持兼容的特权参考指导。我们引入了状态匹配路由和上下文自蒸馏(SMRC-SD),它明确确定了特权轨迹何时以及如何指导政策学生。在每个回合,SMRC-SD 都会验证学生当前的执行状态是否与参考轨迹上的支持状态匹配。蒸馏仅适用于匹配状态,过滤掉参考缺乏局部兼容指导的轮次。对于每个匹配的状态,SMRC-SD 进一步根据成功轨迹构建状态条件教师上下文,将监督扎根于实际达到的状态。在 ALFWorld 和 WebShop 中,SMRC-SD 始终优于无条件成功的全路径蒸馏。借助 Qwen3-1.7B,它可以将 ALFWorld 上的任务成功率从 $0.746$ 提高到 $0.865$,将 WebShop 上的任务成功率从 $0.574$ 提高到 $0.693$。受控路由和上下文消融支持选择本地支持的转弯和构建状态兼容的教师上下文作为这些收益的贡献者。代码可在 https://github.com/liujunzhuo/SMRC-SD 获取。

相关文章推荐

返回首页