AI Insight Hub
图片转PPT
Image2PPT
图片转PPT神器
首页
分类
关于
管理后台
首页
分类
关于
管理后台
来源:ArXiv AI
2026-09-03 04:00
翻译成中文
信念校准优化:代理优化的显式世界模型
模型
信念
代理
文档
优化
arXiv:2609.01861v1 公告类型:新 摘要:LLM 代理的性能取决于冷冻模型周围的支架。改进该脚手架的常见方法是使用编码代理作为优化器:它读取当前分数和跟踪并迭代编辑源,每轮生成一个新的候选者。每个编辑都是根据对环境将如何响应的信念来选择的:出了什么问题,以及哪些更改应该有所帮助。这种信念通常是隐含的。它存在于编码代理对当前调用的推理中,或者隐藏在其参数中,而不是作为写下来的东西。因此,后来的呼叫会看到分数和痕迹,但他们不使用这种信念。我们引入了信念校准优化(BCO),这种方法将信念写下来作为持久的上下文文档,并在评估新候选人时不断修改该文档。生成的文档是一个世界模型:环境如何响应编辑的当前说明。添加到其他标准循环中,BCO 在跨越内存 QA、工具使用 QA、代码即操作应用程序代理和终端代理的五个基准上达到了比仅缺少世界模型的匹配控制更高的训练通过率。每个保留的分裂都存在差距,不用于选择候选人。在目标模型交换(其中冻结模型被替换而脚手架未被替换)之后,选定的 BCO 脚手架会引导我们测试的任务,除非上下文窗口溢出导致任务未完成。然后,离线消融会询问这种差距是否来自世界模型所说的内容。与没有文档或内容被伪造的相同形式副本的预测器相比,给定累积文档的新预测器可以更准确地预测环境将如何响应。比较表明该文档不仅在形式上,而且在其内容中包含可重用的信息。
查看原始链接
相关文章推荐
认知女巫抵抗:在不增加证据的情况下增加人工智能代理
2026-09-03
内存信任差距:持久内存代理中与功能相关的故障
2026-09-03
SSAKG 2.0:用于结构关联序列记忆和基于上下文的检索的开源包
2026-09-03
返回首页