智能AI
morning
成功少走弯路:学习长期代理的可执行演练
摘要
arXiv:2609.22120v1 Announce Type: new Abstract: Test-time self-evolving agents improve by reusing past experience, yet sparse-reward trajectories contain failures, loops, and detours, while summaries ...
and
state
from
trajectories
action
that
while
executable
credit
with
2026-09-22
1 阅读
约1分钟阅读
Kaijie Chen, Chenyu Fang, Liang Yan, Bo Li, Bo Zhang, Peng Ye
字号:
arXiv:2609.22120v1 公告类型:新摘要:测试时自我进化代理通过重用过去的经验来改进,但稀疏奖励轨迹包含失败、循环和弯路,而摘要通常会省略执行所需的状态条件和操作依赖性。我们从稀疏奖励轨迹中研究可执行的演练归纳:提取紧凑的、状态条件的和可验证的程序。我们的主要观察是,延迟信用识别与进展相关的行动,但无法确定它们是否产生后续行动所需的事实。我们提出了 Trace,这是一个以信用为导向、以依赖为基础的框架,它将嘈杂的轨迹编译成可执行的演练内存。它从奖励和持续状态变化中检测进度锚点,传播信用以识别有价值的转变,并根据跨情节的成功和失败证据估计行动先决条件。然后,向后依赖切片将所需的事实跟踪到其生产者,提取依赖一致的操作链,同时删除不相关的循环和弯路。生成的演练对进入条件、有序状态-动作-效果步骤以及完成和失败谓词进行编码,支持重用、中间状态恢复和编程验证。使用三个开源法学硕士在 J-TTL、WebShop 和 ScienceWorld 上进行的实验表明,Trace 始终优于八个测试时的学习和记忆基线。与最强的基线相比,它在使用更少的推理令牌的情况下,将平均 AUC 和 Final-$3$ 分别提高了 $30.0%$ 和 $40.5%$。这些结果表明,长视域交互从状态条件可执行程序中获益更多,而不是从完整轨迹或抽象摘要中获益。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱