智能AI
morning
内存信任差距:持久内存代理中与功能相关的故障
摘要
arXiv:2609.01852v1 Announce Type: new Abstract: Persistent memory supports personalized agents, but a stale stored fact can override current authoritative evidence without warning. We study when this ...
the
stale
model
and
models
memory
size
with
suite
trust
2026-09-03
1 阅读
约2分钟阅读
Jundong Hu, Shekar Ramachandran
字号:
arXiv:2609.01852v1 公告类型:新摘要:持久内存支持个性化代理,但过时的存储事实可能会在没有警告的情况下覆盖当前的权威证据。我们研究随着模型能力的变化,这种危害何时开始。我们在同系列模型尺寸系列(Qwen3 0.6/1.7/4/8B)上评估了一个冻结、封闭集、动作评分的基准,其中有 2 个套件代表“无记忆”的 2 种不同含义(福利套件,如果没有存储的事实就无法解决,以及安全套件,其中权威工具始终保持正确的值)。记忆信任差距反映的是过度信任而不是混乱。在 Benefit 套件中,模型在每个尺度上都以当时的陈旧值 0.92-1.00 进行回答。在安全套件中,陷阱条件下($\Delta_{\mathrm{mem}}$)低于无内存基线的伤害是受能力限制的,一旦陈旧的注释看起来是最新的,较大的模型就会崩溃。在 $2\times2\times2\times2$ 阶乘中,哪个特征触发过度信任取决于特征和模型规模。删除标签会放大每个尺寸的过度信任,而新近度功能(过时的更新)更难欺骗较大的模型。来源权威较弱且规模平坦,在 Qwen3 型号尺寸系列中,位置从正面变为负面。我们通过直接的跨尺寸对比测试来确认这些尺度相互作用,而不是重叠每个模型的间隔。缓解同样取决于功能:公开元数据可以提高功能模型的准确性,但只有预先解决冲突才能恢复 2 个较小检查点的准确性。相同的模式出现在独立 Llama-Instruct 模型尺寸系列中的功能模型和 2 个外部数据集(RGB、MisBench)上。框架控制没有发现内存标签具有一致的优势:在 3 个较小的尺度上,模型更信任陈旧的文档而不是陈旧的内存;在8B时,差异并不显着。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱