AI Insight Hub
图片转PPT
Image2PPT
图片转PPT神器
首页
分类
关于
管理后台
首页
分类
关于
管理后台
来源:ArXiv AI
2026-08-07 04:00
翻译成中文
当特权指导不一致时:多轮代理的状态匹配路由和上下文自蒸馏
状态
匹配
蒸馏
学生
参考
arXiv:2608.05219v1 公告类型:新 摘要:特权同策略蒸馏允许同步教师在每个回合重新评分学生的反应,并访问仅限训练的参考(例如成功的轨迹),从而为多回合代理提供密集的监督。然而,在交互式环境中,学生之前的操作会不断改变执行状态。当学生采取不同的行动或以不同的顺序完成子目标时,其推出可能会达到参考未涵盖的状态,从而使参考成为实际达到的状态的不可靠的指导来源。因此,不加区别地应用特权蒸馏会导致状态-引用不匹配。这种不匹配激发了一个中心目标:提供与学生当前执行状态保持兼容的特权参考指导。我们引入了状态匹配路由和上下文自蒸馏(SMRC-SD),它明确确定了特权轨迹何时以及如何指导政策学生。在每个回合,SMRC-SD 都会验证学生当前的执行状态是否与参考轨迹上的支持状态匹配。蒸馏仅适用于匹配状态,过滤掉参考缺乏局部兼容指导的轮次。对于每个匹配的状态,SMRC-SD 进一步根据成功轨迹构建状态条件教师上下文,将监督扎根于实际达到的状态。在 ALFWorld 和 WebShop 中,SMRC-SD 始终优于无条件成功的全路径蒸馏。借助 Qwen3-1.7B,它可以将 ALFWorld 上的任务成功率从 $0.746$ 提高到 $0.865$,将 WebShop 上的任务成功率从 $0.574$ 提高到 $0.693$。受控路由和上下文消融支持选择本地支持的转弯和构建状态兼容的教师上下文作为这些收益的贡献者。代码可在 https://github.com/liujunzhuo/SMRC-SD 获取。
查看原始链接
相关文章推荐
Matplotlib 与 Plotly:您应该选择哪种 Python 图表工具?
2026-08-07
Cohere Health 如何使用 Amazon Bedrock AgentCore 将临床政策数字化
2026-08-07
TReNDS 如何使用 Amazon Bedrock 自动进行根本原因分析
2026-08-07
返回首页