首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

LSTM之父最新97页综述:Agent如何真正学会「自我进化」?

摘要

新智元报道 过去两年,self-reflection、self-correction、self-play、agentic RL、skill learning、test-time adaptation、open-ended evolution、self-evolving agent等概念不断涌现。 它们有时指模型继续训练,有时指Prompt或工具自动优化,也有时被直接归入递归式自我改进(Recurs...

self Self Improvement https Memory skill 自我改进 selfimproving agent github
2026-08-10 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 过去两年,self-reflection、self-correction、self-play、agentic RL、skill learning、test-time adaptation、open-ended evolution、self-evolving agent等概念不断涌现。 它们有时指模型继续训练,有时指Prompt或工具自动优化,也有时被直接归入递归式自我改进(Recursive Self-Improvement,RSI)。 问题在于,这些术语描述的变化层级和强度并不相同,却长期缺少一套统一坐标系。 近日,来自吉林大学、KAUST、阿尔伯塔大学和瑞士人工智能实验室等机构的研究团队发布综述,从系统层面重新定义「自我改进」,并将模型训练、记忆演化、工具创建和Agent架构搜索放进同一张地图。配套项目目前已整理312篇相关工作。 论文链接: https://arxiv.org/abs/2607.13104 项目主页: https://selfimproving-agent.github.io/ 代码链接: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents 值得一提的是,这篇综述发布后迅速在海外AI社区获得关注。配套GitHub仓库一周左右已收获 200+Stars ,;X上也有不少论文推荐帖也获得了约 800个Likes 。这也折射出一个清晰信号,self-improving agent正成为海外研究者和开发者共同关注的新焦点。 图 1:配套 GitHub 仓库 在一周左右获得200+Stars。 图2:X上的论文推荐帖获得约800个Likes。 图3:现代自我改进Agent的整体版图。 什么才算「自我改进」 论文将基础模型Agent表示为: 其中,θ是基础模型参数;Σ是围绕模型运行的脚手架,包括Prompt、Memory、Tools,以及路由、调度和安全约束等控制逻辑。 这个定义划出了一条重要边界:上下文中的临时计划、对话历史和一次性反思,只属于运行时状态;只有当系统依据自身执行产生的轨迹、评价或验证结果,持久修改了θ或Σ,并让下一次任务从不同起点出发,才构成真正的self-improvement。 因此,self-reflection和self-correction本身不必然等于自我改进。一次任务中「再想一遍」可以提高当前答案,却未必留下任何跨任务能力。反过来,一条经过验证并写入长期记忆的规则、一个被修复后持续复用的工具,哪怕没有更新模型权重,也已经改变了Agent未来的行为。 自我改进也不是大模型时代突然出现的概念。从反馈控制、学习如何学习、自指程序,到Gödel Machine和元学习,相关思想延续了数十年。基础模型带来的变化,在于自然语言成为统一的修改介质:错误可以写成批评,经验可以压缩为记忆,工具和工作流可以直接生成与重写。自我修改由此从低层代码与权重搜索,逐渐变成更可表达、也更可检查的工程过程。 图4:基础模型提供认知能力,Prompt、Memory、Tools与控制逻辑共同决定Agent如何感知、推理和行动。 两条路线 写进模型,或写进系统 第一条路线是 Foundation Model Improvement 。Agent自己生成训练示例、评价信号,或从真实环境与世界模型中获得探索经验,再通过SFT、偏好优化或强化学习写回参数。这类更新较慢、成本较高,也不易回滚,但一旦成功,能力可以跨任务共享。 论文将其学习信号分为三类:一是自生成示例与推理轨迹,二是模型给出的分数、偏好或批评,三是来自代码执行、网页交互、游戏和机器人环境的真实或模拟经验。Self-Instruct、Constitutional AI、WebRL等分别体现了这些思路。 风险也很直接:模型可能把自身错误重新训练进权重,导致偏差放大、模型坍塌或灾难性遗忘;也可能学会钻奖励函数和世界模型的空子。参数更新因此必须配合数据过滤、外部验证、版本管理和回滚。 第二条路线是 Scaffolding Improvement 。模型参数保持不变,系统改写Prompt,整理和淘汰Memory,选择、修复或创建Tools,甚至重构规划器、路由器和整套Agent代码。TextGrad、Mem0、Voyager、Gödel Agent、Darwin Gödel Machine等工作都可放入这条路线。它更轻量、更透明,也更容易验证和撤销,因此是当前工程实践中最活跃的方向。 论文对 skill 的处理尤其值得注意:skill不是Prompt、Memory、Tool之外的第五个组件,而是一种「可序列化、可复用的更新」。同一个技能可以被存成工具及其调用约定,可以是一条工作流或记忆,也可以被固化进权重或控制逻辑。换言之,skill描述的是「保留下来的能力单元」,而不是它被存在哪里。 这种定义也区分了两类技能:对象级skill用于完成外部任务,例如反复调用一段「收集资源」流程;元级skill则直接作用于Agent自身,例如重写Prompt、整理Memory、创建工具或触发参数更新。后者一旦还能改进「如何改进自己」,就开始触及RSI最核心的自指结构。 但这里需要降温:今天多数所谓RSI,仍是受目标函数、测试集、沙箱和权限边界约束的「有限自我修改」,距离不受约束的智能爆炸相去甚远。论文关注的重点也不是科幻式失控,而是如何让这种更新可测量、可归因、可回滚。 两条路线并非彼此排斥。更合理的系统会让脚手架承担快速、局部、可逆的探索,再把反复验证有效的经验蒸馏进参数,形成「快速适应—慢速固化」的双时间尺度。 图5:基础模型更新与脚手架更新构成两条主路径。 六大应用场景 论文系统梳理了六类应用: 软件工程、网页导航与自动化、游戏与策略推理、科学发现、具身智能与机器人、通用计算机控制。 它们的共同点是Agent都能从环境获得反馈;差异在于反馈是否可靠、获取成本多高,以及失败能否撤销。 软件工程拥有编译器、单元测试和持续集成,是反馈最密集、结果最容易验证的试验场。网页Agent面对的则是持续变化的页面、DOM和API,需要把成功与失败轨迹沉淀为记忆、grounding策略或可复用工具。游戏能够提供可重置环境、清晰规则和self-play经验,但也可能让Agent过拟合固定对手或钻模拟器的空子。 科学发现把循环扩展到假设、实验与证据管理,难点在于新颖性、可复现性和反馈延迟。具身智能需要跨越仿真与现实,处理sim-to-real gap和物理安全。通用计算机控制则要跨应用与操作系统形成可迁移的程序性经验。 在这些场景中,skill可以是代码修复流程、网页策略、游戏技能库、实验工作流、机器人动作程序或桌面操作脚本。介质不同,核心都是把一次成功转化为可复用的持久更新。 图6:自我改进Agent的六类代表性应用,以及各领域常用的环境与反馈来源。 如何评测一个会持续变化的系统 传统基准只测静态模型的最终分数,但自我改进Agent的研究对象是一条更新轨迹。可信实验至少要回答: 固定预算下每轮提高多少?能否迁移到未见任务?旧问题是否再次失败?消耗了多少工具调用与人工监督?
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱