来源:ArXiv AI 2026-09-03 04:00

内存信任差距:持久内存代理中与功能相关的故障

模型 信任 内存 功能 陈旧
arXiv:2609.01852v1 公告类型:新 摘要:持久内存支持个性化代理,但陈旧的存储事实可能会在没有警告的情况下覆盖当前的权威证据。我们研究随着模型能力的变化,这种危害何时开始。我们在同系列模型尺寸系列(Qwen3 0.6/1.7/4/8B)上评估了一个冻结、封闭集、动作评分的基准,其中有 2 个套件代表“无记忆”的 2 种不同含义(福利套件,如果没有存储的事实就无法解决,以及安全套件,其中权威工具始终保持正确的值)。记忆信任差距反映的是过度信任而不是混乱。在 Benefit 套件中,模型在每个尺度上都以当时的陈旧值 0.92-1.00 进行回答。在安全套件中,陷阱条件下($\Delta_{\mathrm{mem}}$)低于无内存基线的伤害是受能力限制的,一旦陈旧的注释看起来是最新的,较大的模型就会崩溃。在 $2\times2\times2\times2$ 阶乘中,哪个特征触发过度信任取决于特征和模型规模。删除标签会放大每个尺寸的过度信任,而新近度功能(过时的更新)更难欺骗较大的模型。来源权威较弱且规模平坦,在 Qwen3 型号尺寸系列中,位置从正面变为负面。我们通过直接的跨尺寸对比测试来确认这些尺度相互作用,而不是重叠每个模型的间隔。缓解同样取决于功能:公开元数据可以提高功能模型的准确性,但只有预先解决冲突才能恢复 2 个较小检查点的准确性。相同的模式出现在独立 Llama-Instruct 模型尺寸系列中的功能模型和 2 个外部数据集(RGB、MisBench)上。框架控制没有发现内存标签具有一致的优势:在 3 个较小的尺度上,模型更信任陈旧的文档而不是陈旧的内存;在8B时,差异并不显着。

相关文章推荐

返回首页