首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

特工记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

摘要

近年来,大语言模型(LLM)智能体在长程任务中展现出强大潜力,但现有智能体框架在 记忆的使用方式与迭代方式 上仍面临显著挑战。 传统方法多在任务开始前根据任务检索记忆或在交互过程中通过上下文来检索经验,随着任务的推进,在任务开始阶段一次性检索的记忆已无法反映当前的问题,膨胀的上下文中又混杂着过期信息与执行噪声,检索因此越来越不可靠。检索之所以不可靠,根源并不在于缺少有用的经验,而在于 缺少一个紧凑...

Recuris Claude Opus Recursive Experiential Working Memory Evolution 小模型到 https
2026-08-30 1 阅读 约10分钟阅读 机器之心
分享:
字号:
近年来,大语言模型(LLM)智能体在长程任务中展现出强大潜力,但现有智能体框架在 记忆的使用方式与迭代方式 上仍面临显著挑战。 传统方法多在任务开始前根据任务检索记忆或在交互过程中通过上下文来检索经验,随着任务的推进,在任务开始阶段一次性检索的记忆已无法反映当前的问题,膨胀的上下文中又混杂着过期信息与执行噪声,检索因此越来越不可靠。检索之所以不可靠,根源并不在于缺少有用的经验,而在于 缺少一个紧凑而可靠的任务状态 ,去把已积累的经验与当前的执行需求持续对齐。 而近期的 递归式自我改进(RSI) 在长程任务中也面临同样的挑战,记忆的迭代几乎只由下游任务的分数决定,无法精准定位到产生问题的具体组件,因此更新往往是粗粒度的且缺乏针对性,而面对长程任务中的推理轨迹,不断增长的上下文长度也让智能体难以在分析并在其中准确找到最有效的改进策略。 在此背景下,新加坡国立大学、普林斯顿大学与斯坦福、牛津等研究团队合作提出了 Recuris(Recursive Experiential–Working Memory Evolution),作为首个将递归自我改进应用在记忆控制层内的智能体架构,Recuris 通过三项核心技术突破, 无需训练 即成功实现了 从 3B 小模型到 Claude Opus 5 的全面提升 。 论文标题:Recursive Experiential–Working Memory Evolution for Long-Horizon Agent Harnesses 代码仓库:https://github.com/Gen-Verse/Recuris 论文链接:https://arxiv.org/abs/2608.24876 Recuris 与既有记忆方法的差别体现在两个维度上:记忆怎么被使用,以及记忆怎么被迭代 。 Recuris 与既有记忆方法的两个范式差别 记忆怎么用 :既有框架对着不断膨胀的对话历史做记忆的注入或检索,在长程任务中容易产生幻觉,导致技能调用错位;Recuris 在执行事件上取用技能,并由检查器把环境返回转成 经过验证的状态更新 ,而不是听信对话里的一句「 已完成」。 记忆怎么迭代 :既有框架从单次任务成败出发重写整个记忆;Recuris 读取结构化轨迹,把失败 定位到具体组件 、只修改引起问题的组件,并且只有通过验证集的门控后才被接受。 性能表现: 从 3B 小模型到 Claude Opus 5 全面暴涨 研究团队在四个长程基准(τ²-Retail、τ²-Airline、SkillFlow、Terminal-Bench 2.1)与十个模型上进行了评测。 Recuris 在从 3B 开源模型到前沿模型上的表现 从 3B 的小模型到 Claude Opus 5 和 GPT-5.6-Sol 这样的前沿模型上,Recuris 均展现出了大幅的性能提升 。同时在长程任务上,这一优势不随交互轮次的增加而衰减,并大幅降低了长程执行中常见失败模式的发生率。 长程可靠性: 优势不随任务变长而衰减 长程能力的常见评价困难在于,「 任务变长」和「 智能体提前放弃」会互相混淆。因此研究团队按 任务本身需要多少轮才能完成 把 τ²-Retail 分成四个分位。 按任务固有长度分位的长程表现 Recuris 在全部四个分位上都领先基线,幅度 +17.0 至 +44.7,不随任务变长而单调下滑 。 结构化轨迹让失败可以被定位 递归改进的前提是 知道该修哪里 。研究团队没有停留在观察记忆,而是 主动向记忆中注入已知故障 ,再让一个固定的裁判从三种证据中判断是哪个组件出了问题:只看最终成败、看原始轨迹、或看 Recuris 产出的结构化轨迹 Γ 。故障池按类别均衡构造,因此一个「 永远答同一个组件」的裁判会得到 33.3%。 只看成败的定位准确率 13.0%,低于常答同一答案的基线 ;看原始轨迹 37.0%,仅比基线高不到四个点;而看结构化轨迹达到 64.8%,接近基线的两倍 。 演化出的记忆能迁移: 跨任务,也跨模型 跨任务 :记忆从 16 个失败任务 中蒸馏而来,在 从未参与过的 86 个任务 上仍带来 +9.01 至 +17.44 的提升。这一结果验证了 Recuris 的核心假设:结构化的失败轨迹中蕴含的信息足以支撑跨任务迁移。 演化出的记忆在留出任务上的表现 跨模型 :一份记忆只在部署模型上演化一次,随后原封不动交给从未参与演化的前沿模型,同样也能产生明显提升,进一步证明了框架的泛化性。 关键技术解析 论文给出的判断是:长程场景下真正的瓶颈 并非「 没有可用的经验」,而是缺少一个紧凑而可靠的任务状态 ,用来把已积累的经验与当前的执行需求持续对齐。Recuris 的三项核心技术都围绕这一判断展开。 Recuris 架构总览 经验记忆 — 工作记忆耦合(EM–WM Coupling) 工作记忆(WM)正是那个缺失的状态表示 。它持续追踪智能体的当前进展与未解决的目标,并据此从 经验记忆(EM) 中选取最合适的技能;技能执行后,环境反馈验证进展并更新状态,闭合成一个循环: 任务状态 → 技能选择 → 执行反馈 → 更新的任务状态 具体而言,技能调用发生在 执行事件 上:草拟一次状态改变调用,或到达一个交互轮次的边界,而不是对着膨胀的历史上下文做相似度匹配。智能体动作之后,检查器依据环境返回的 工具回执 验证进展,只有被证据支持的状态变更才会被提交: 调用了技能、或尝试了一次工具调用,都不算真正完成 。 结构化轨迹与组件级失败定位 既有方法大多只能从最终成败中学习,这类信号说明「 出了问题」,却无法指出该修的是 存储的技能、追踪的任务状态、技能调用机制,还是进度验证器 。EM–WM 耦合把任务状态、被调用的技能、动作与观测显式串联起来, 把执行过程本身变成了关于「 记忆如何影响行为」的证据 : EM–WM 耦合 → 结构化证据 → 失败定位 → 靶向记忆演化 它把「 这次任务失败了」变成「 是哪一个组件让它失败」,从而使 局部修补 成为可能,而不必整体重写记忆。 有界的、验证门控的递归演化 一个固定的 Meta-Agent 读取结构化轨迹,把每个诊断出的失败归因到某个记忆组件,并 只修改被引发问题的组件 ;一个固定的门控只在补丁修复了目标任务、且不在留出集上造成回退时才准入。被接受的更新改变未来的执行模式,产生新的优化信息,进而支撑下一轮更新。 递归演化的动态 主要作者介绍 余昭辰 :新加坡国立大学博士生,研究方向为大语言模型推理、智能体系统与自我改进。 杨灵 :普林斯顿大学博后研究员,研究方向为大语言模型和强化学习。 王梦迪 :现任普林斯顿大学电子与计算机工程系终身教授,并创立并担任普林斯顿大学「AI for Accelerated Invention」中心的首任主任。她的研究领域涵盖强化学习、可控大模型、优化学习理论以及 AI for Science 等多个方向。 颜水成 :新加坡国立大学教授,IEEE / ACM / AAAI / IAPR Fellow,研究方向涵盖计算机视觉、机器学习与多模态大模型。 本工作合作者包括斯坦福大学博后吴英成,牛津大学博后尹榛菲等 © THE END 转载请联系
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱