智能AI
morning
自我改进的 LLM 代理人的记忆奖励膨胀
摘要
arXiv:2608.00017v1 Announce Type: new Abstract: Self-improving LLM agents increasingly learn from experience without updating any weights. Each episode is stored in an external memory, scored, and ret...
the
and
memory
stored
agent
for
reward
score
self
which
2026-08-04
1 阅读
约2分钟阅读
Mohammad Asadolahi, Amir Amini, Samira Talebi, Amirfarhad Farhadi, Azadeh Zamanifar
字号:
arXiv:2608.00017v1 公告类型:新摘要:自我改进的 LLM 代理越来越多地从经验中学习,而无需更新任何权重。每个情节都存储在外部存储器中,进行评分和检索,以用于未来类似的任务,以塑造以后的行为。从奖励的角度来看,存储的分数是隐式非参数策略的代理奖励。每个检索到的事件都会成为一个政策改进步骤,其可靠性取决于分数的产生方式。在部署中,真实标签不可用,因此存储的奖励最多是 LLM 评估。这种替代在所研究的基于记忆的自我改进代理和模型系列中创建了一种故障模式,即“回声间隙”。不正确的情节会获得夸大的奖励;因此,智能体优先重用它最有信心的错误。因为错误通过记忆复合而不是平均,并且确认法官的错误仍然与原始自我评分偏差相关,因此它无法识别哪些记忆被高估。缺失的属性被形式化为“错误独立假设”(EIA),我们证明它是纠正通货膨胀的“必要”条件,而不仅仅是对一个好的验证者的描述:可用的信号必须跟踪真相*并*将其错误与记忆偏差去相关,而可恢复的回报正是这两个量的封闭形式函数。我们进一步显示,不仅当检索按存储的分数排序时,而且在简单的相似性检索(部署代理使用的机制)下,通货膨胀复合。最后,无答案的去通货膨胀算法 LUCID 在 BIRD 文本到 SQL 基准测试中提供了一致的端到端增益。它将执行精度提高到 $56.9\%$,高于 Memento 风格的自评分代理($54.0\%$,种子平均增益 $+2.9$ 点)和相同架构的无记忆代理($52.4\%$)。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱