来源:ArXiv AI 2026-07-21 04:00

掩蔽扩散语言模型是强大且可操纵的基于文本的代理强化学习世界模型

模型 环境 世界 模式 状态
arXiv:2607.16204v1 公告类型:新 摘要:强化学习(RL)的最新发展表明了对多样化、专业培训环境的需求。随着模型性能的提高,具有固定任务和奖励难度的手工策划环境变得无效信号,并且长期稀疏的奖励会导致特定工作流程或工具结构的模式崩溃。模拟环境状态的世界模型与纯粹的部署性能相匹配,使它们有望按需扩展多样性。然而,自回归(AR)世界模型存在从左到右的偏差,无法对全局相互依赖的状态锚(例如工具模式、先前的转向和预期结果)进行调节。我们 (i) 将基于文本的世界建模形式化为可操纵的转换动力学问题,分解为初始状态、任务上下文、工具模式、领域规则和转向指令,以及 (ii) 策划跨越 9 个开源环境和 12 个前沿模型系列的 239,403 个接地状态动作轨迹。我们比较了 AR LM 和掩码扩散语言模型 (MDLM),结果表明,MDLM 通过双向锚感知去噪,在相当的推理延迟下,比参数大小超过 4 倍的 LLM 实现了更好的连贯性、基础性和经经验验证的推出多样性。我们引入了具有确定性状态检查的即插即用 GRPO 训练框架,并在三个 OOD 环境(ScienceWorld、ALFWorld、AppWorld)上跨三个 1.2B-7B 代理骨干网(LFM2.5、Qwen3、Mistral)执行零样本传输消融,无需针对特定环境进行微调,即可实现比基线高达 47% 的绝对增益。我们进一步对对抗场景下的故障模式进行行为分析,并对现实性、结果正确性和训练效用进行人类评估。我们开源我们的工作以鼓励这个方向的研究。

相关文章推荐

返回首页