智能AI
morning
在开源模型自主探索新环境中,RSIAgent让开源模型自主探索新环境
2026-09-16
1 阅读
约10分钟阅读
机器之心
字号:
机器之心编辑部 大模型过去几年的能力跃迁,几乎都围绕一个词: Scaling 。 模型越来越强,Agent 也开始从 “会聊天” 走向 “能干活”。 但模型部署之后呢? 一个 Agent 真正进入从没见过的软件、工具或者企业系统时,问题往往才刚刚开始。新的软件有新的交互逻辑,新的工具有新的调用方式,不同环境还有各自隐藏的约束、异常状态和失败模式。 即便底层模型已经足够聪明,它也未必真正理解这个环境里的 因果结构 :什么操作会带来什么结果?哪些条件会触发失败?改变哪些关键因素,才能真正把任务做成? 过去最直接的办法,是遇到一个新环境,就再收集一批交互数据,通过微调、强化学习或者人工反馈重新训练。 但这条路很难无限走下去。一方面,数据采集、标注和训练本身都要付出成本;另一方面,在企业内部软件、私人工作环境和不断变化的数字系统里,很多数据既不能公开,也不适合每换一个环境就重新训练一遍。 于是问题变成了: 如果不更新模型参数,一个 Agent 能不能像人一样,通过自己探索新环境、发现其中的因果规律、总结经验,并持续提升自己的能力? 最近, 专注于因果智能的 Aether AI 提出了 RSIAgent 。通过 RSIAgent,他们想试另一种 Scaling: 不继续 Scale Model,而是 Scale Experience 。 也就是说,模型参数先不动,让 Agent 自己进入环境探索、试错、验证,再把得到的经验不断积累下来。 RSIAgent 给出的方案,是一套面向数字智能体的 Autonomous Exploration for Recursive Self-Improvement(RSI,递归自我提升)框架 : 让 Agent 自己决定学什么、自己进入环境获取经验、自己验证结果,并将其中稳定的动作 — 条件 — 结果因果关系沉淀进 Memory,供后续任务直接复用 。 这个思路延续了 Aether AI 团队一直在追问的问题:AI 能不能不只记住 “什么通常有效”,而是真正理解 “什么改变会导致什么结果”。 更值得注意的是,这种 “靠经验继续变强” 的路线,已经在实验里表现出了相当直接的效果。 在不更新模型参数的情况下,RSIAgent 能够持续提升 Kimi-K3 和 GLM-5.3 等开源模型的 Agent 能力,并在 OSWorld 2.0 与 Agents’ Last Exam 上超过 GPT-6 Astra 等闭源模型。 其中,RSIAgent 在 OSWorld 2.0(0808 offline)上取得 78.98% 的 Partial Score,在 Agents’ Last Exam(Near-term)上达到 84.82% ,大幅领先于 GPT-6 Astra 的 72.60% 和 82.26%。 图 1|RSIAgent 框架与性能表现:RSIAgent 通过 “课程生成 — 执行 — 验证 — 记忆演化” 的递归闭环自主适应新环境,并使开源模型在 OSWorld 2.0 和 Agents’ Last Exam 上超过多款前沿闭源模型。 论文标题: RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments 论文链接: https://arxiv.org/pdf/2609.15364v1 代码链接:https://github.com/AetherLabsAI/RSIAgent 网站链接:https://aetherlabsai.github.io/RSIAgent/ 从 “被动学习” 到 “主动探索”: RSIAgent 的核心思路 RSIAgent 的核心,是把 Agent 与新环境的交互过程本身变成一种持续学习过程。系统围绕一个不断演化的 Memory,构建由 curriculum agent、actor agent 和 verifier agent 组成的多智能体递归闭环:curriculum agent 决定下一步应该探索什么,actor agent 进入环境执行任务并积累经验,verifier agent 根据真实环境反馈判断结果是否可靠,最终将有效知识持续写入 Memory。这样,Agent 不再只是被动完成任务,而是能够自主选择学习方向、获取经验并不断扩展自己的环境知识。 在此基础上,RSIAgent 进一步采用 Broad-to-Deep 的两阶段自探索策略,其思路类似于大模型训练中的 Pre-training → Post-training :先通过广泛探索建立整体能力覆盖,再围绕关键难点进行针对性强化。 第一阶段:Broad Recursive Self-exploration 这一阶段类似于 Pre-training ,重点是从 “单点解决任务” 转向 “快速建立对环境的广泛认知”。curriculum agent 会在每一轮同时生成多个方向不同的探索任务,例如尝试不同工具、交互方式和输入条件;随后由多组 actor agent 和 verifier agent 并行执行与验证,再将有效经验汇总进共享 Memory。基于当前已获得的知识,curriculum agent 会继续生成下一批更有价值、覆盖新方向的任务。整个过程形成一个并行递归链: 多方向任务 → 并行执行 → 并行验证 → 汇总更新 Memory → 新一轮多方向任务 通过不断扩展探索方向,Broad Recursive Self-exploration 能够快速覆盖环境中的常见规则、操作流程和失败模式,让系统先形成一张较完整的 “环境知识地图”,为后续针对关键难点的深入探索打下基础。 第二阶段:Deep Recursive Self-exploration 这一阶段更接近 Post-training ,重点从 “覆盖更多知识” 转向 “攻克关键难点”,主动寻找那些:难、隐蔽、容易出错、只有在复杂情况下才会暴露的问题。curriculum agent 会首先生成一个相对困难的任务,刻意让系统进入可能出现异常、隐藏约束或边界情况的场景。actor agent 使用当前 Memory 完成任务;verifier agent 检查结果;然后 curriculum agent 根据暴露出的失败、未知问题和脆弱环节,再继续设计一个更难的任务。整个过程变成一个顺序递归链: 困难任务 → 执行 → 验证 → 更新 Memory → 更困难任务 每一轮都建立在上一轮刚刚获得的知识之上。因此,Deep Recursive Self-exploration 更像是一种自动化的 “极限测试”,它不断把 Agent 推向知识边界,让系统真正知道:“ 这个环境在哪些地方最容易出问题 。” 最终,两阶段探索得到的 Memory 会被冻结,并直接用于后续任务执行,使 Agent 在不更新模型参数的情况下获得可复用的新环境能力。 图 2|RSIAgent 整体框架,以 FreeCAD 任务为例。 BRS 通过并行探索获取多样化经验,DRS 则通过逐步深入探索持续细化 Memory。curriculum
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱