智能AI
morning
记忆什么时候有用?对使用工具的 LLM 代理的长期记忆进行成本感知评估
摘要
arXiv:2609.05441v1 Announce Type: new Abstract: Long-term memory for LLM agents is evaluated today by conversational recall benchmarks (LoCoMo, LongMemEval), which measure question answering over dial...
and
memory
the
for
agents
facts
task
fact
full
LLM
2026-09-09
1 阅读
约2分钟阅读
Shweta Mishra, Shashank Mishra
字号:
arXiv:2609.05441v1 公告类型:新 摘要:如今,LLM 智能体的长期记忆通过对话回忆基准(LoCoMo、LongMemEval)进行评估,该基准衡量对话历史中的问题回答,而不是记住的事实是否会改变使用工具的智能体的行为。我们提出了 MERIT(现实仪器任务的内存评估),这是一个基准和工具,用于测量显式成本核算下任务执行代理的内存边际效用。 MERIT 在三个领域提供情景工具使用任务,这些任务对早期情景的依赖通过自动泄漏检查进行验证;以更新事实回忆结束的难度阶梯;受控内存损坏;每个内存操作的完整令牌和美元计量。在 23,440 个评分剧集(42.57 美元)中,gpt-4.1-mini 上的两代飞行员和预先注册的 3 模型 x 3 种子网格(GPT-4.1,Claude Haiku 4.5;内存侧固定),内存将依赖任务成功率从 0.00 的泄漏验证下限提升到 0.55-1.00。对于更新的事实,嵌入检索会不可预测地崩溃(跨模型为 0.30-0.95;最大种子间隙为 0.45),并且代理仅在 55% 的时间内对正确检索的值进行操作,而写入时更新存储(结构化事实存储,特别是 LLM 摘要)保持在 0.70-1.00;混合比单独的事实存储更糟糕。最新一代的抽查(Claude Sonnet 5,在干净的完整重放控制上门控)再现了该模式。交换内存的实现可以使任务成功率提高多达 60 点,并且完全重放从来都不经济:每个域的最佳条件每美元可提供 2.7-3.9 倍的边际效用。我们发布了基准测试、工具和所有跟踪。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱