首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

LLM 中的长期状态跟踪:通过依赖工具调用的深层序列执行 MD5

摘要

arXiv:2609.00012v1 Announce Type: new Abstract: Long-horizon tasks remain uncommon in large language model (LLM) evaluation, and for a reason: when each step depends on the last, per-step accuracy tha...

the and with from model step end state LLM tool
2026-09-02 1 阅读 约2分钟阅读 Dheeraj Mohandas Pai, Lu Xian
分享:
字号:
arXiv:2609.00012v1 公告类型:新 摘要:长期任务在大型语言模型 (LLM) 评估中仍然不常见,原因是:当每一步都依赖于最后一步时,随着错误级联和端到端失败概率随着长度的增加而急剧增长,孤立地看起来很好的每步准确度会灾难性地下降。现有的代理基准报告了端到端的成功,但将这种状态跟踪困难与指令解释混为一谈,没有提供隔离它的对照组,并且容易受到诸如幻觉的最终答案之类的捷径的影响,因此他们无法说出为什么长期运行会失败。 LLM 是否可以在许多工具调用之间携带精确的中间状态本身尚不明确。我们通过让模型逐步计算加密哈希 MD5 来干净地测试这一点:一系列 196$ 相关工具调用超过 64$ 轮,同时它在自己的上下文中从一次调用到下一次调用携带四个 $32$ 位单词 $(a,b,c,d)$。解释是微不足道的,因为我们从头开始实现 MD5 (RFC~1321),所以我们将每个调用与真实跟踪对齐并检查摘要,因此任何失败都是纯粹的簿记。 gpt-oss-120b 是一个专家混合模型,每个令牌只有 $\sim$5.5B 活动参数,温度为 $0$,带有简短的固定提示,在所有 $196$ 调用中携带完整状态,并在大多数已完成的运行中返回正确的摘要。在最强大的设置中,我们用第二个 LLM 替换每个原始工具,因此驱动程序和工作人员从头开始计算整个哈希,循环中没有精确算术预言。有两个因素决定成功,但两者都不会改变权重:每轮都将模型自身的推理保留在其上下文中,并投票选出具有思考能力的工作人员以消除其模块化算术失误。我们通过起源来定位残余故障,将状态承载与算术和服务分开。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱