arXiv:2608.06544v1 公告类型:新
摘要:视觉控制的世界模型通常通过重建观察来学习紧凑的潜在状态,隐含地鼓励表示在整个视觉输入中保留信息。然而,与任务相关的内容通常只占观察的一小部分,而背景杂乱和干扰因素会消耗宝贵的表征能力。视觉重建和控制目标之间的这种不匹配会导致潜在表征偏向于对与任务无关的视觉内容进行建模,从而稀释了与控制相关的特征的学习信号,并严重降低了视觉干扰下的下游性能。我们引入了 TaskSense,一个以任务为中心的世界建模框架,它通过以先前潜在状态为条件的可微随机空间注意机制,在潜在编码之前强制执行任务相关性。为了将注意力转移到与控制相关的区域,我们通过辅助逆动力学目标来增强训练。世界模型不是重建完整的观察结果,而是仅重建关注的区域,鼓励潜在表示保留与任务相关的信息,同时丢弃不相关的视觉内容。解码器进一步以采样的注意力图为条件,从而在随机注意力的情况下实现一致的重建。与 DreamerV3 基线相比,TaskSense 在 DeepMind Control Suite 上保持了具有竞争力的性能,同时在 Distracting Control Suite 上始终优于 DreamerV3,显示出对视觉干扰的鲁棒性显着提高。定性分析进一步证实,在逆动态监督的指导下学习到的注意力能够一致地定位与控制相关的区域,同时抑制不相关的视觉内容。