来源:ArXiv AI 2026-08-12 04:00

SBCO:针对规划代理的自我监督、基于验证者的线束优化

自我 代理 改进 通过 方法
arXiv:2608.10157v1 公告类型:新 摘要:自我改进代理试图通过使人工智能系统能够随着时间的推移不断进化和自我改进其性能,从而减少人工智能系统背后的人类工程工作。最近,人们提出了诸如 Darwin G\"odel Machine 和 Huxley G\"odel Machine 之类的方法,这些方法通过编码代理编辑自己的代码的自我引用来实现开放式、递归的自我改进。这种自我参照的自我改进方法要求执行任务所需的能力与自我修改所需的能力一致或很好地一致,编码任务就是这种情况。对于不满足所需一致性的领域或任务,自我参照的自我改进是不可用的。在这种情况下,可以通过删除自引用方面或引入元代理的显式自修改来使上述算法适应其他任务——这两种方法的计算成本都很高,依赖于对许多候选代理的群体或自修改搜索。对于具有明确约束的规划任务,我们提出了一种更便宜的替代方案。我们引入了 SBCO(自监督块坐标优化器),这是一种基于验证者的线束优化器,与 G\"odel 机器方法处于相同的闭环、经验改进系列中,但它是自我监督而不是自我参考。给定代理线束,SBCO 通过近似块坐标上升来学习分解的验证器库和线束策略,通过固定的元代理从其自己的分级反馈中改进代理的输出并且没有人工标签。在两个域中,SBCO 匹配或超过了自定义的自我修改基线,同时使用的计算预算减少了 4-5.5 倍。

相关文章推荐

返回首页