首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

RSI离我们有多远?这家中国团队给出了第一梯队的工程解

2026-09-04 1 阅读 约10分钟阅读 机器之心
分享:
字号:
Agent 经常遇到这样一种幻觉:你给模型接入了终端,下发了一个复杂的 debug 任务,看着它顺藤摸瓜排查了几个小时,最终完美修复了依赖冲突,甚至连测试用例都帮你补齐了。 你以为你的系统变强了。 但第二天,另一个 Agent 接手了同一个仓库的相似任务。结果,它像个完全没来过的新手,从盲目读取报错、乱改配置到随意重装,把昨天踩过的坑、走过的弯路,原封不动又走了一遍。 代码修好了,日志也存下来了,但对于系统而言,什么都没有发生。 深挖这个现象,是一个残酷、致命、却极少被正视的工程问题: 模型的单次推理能力再强,只要任务一结束就 “阅后即焚”,系统就永远不可能产生真正的能力复利。 当整个行业都在狂热探讨大模型的下一个技术奇点 ——RSI(Recursive Self-Improvement,递归式自我改进)时,大家往往陷入了一个思维定势,认为 RSI 的终极形态必须是 “大模型自己写代码训练出一个参数量更大的基座模型”。 但在真实的工程环境里,如果 Agent 连 “刚刚踩过的坑,下一次不要再重试” 都做不到,谈何自我改进? 最近,EvoMap 团队围绕这个问题做了系统性探索。他们没有盲目跟风 “大模型自我训练” 的远期大饼,而是提出了一条极具现实意义的工程新路径: 不要把 RSI 留给基模去硬算,而是在系统层构建一个天生具备 “自进化” 能力的智能体,并让经验在一个庞大的网络中流转。 这并非停留在白皮书上的设想。目前,基于该团队构建的 GEP 协议, EvoMap 网络中已经有超过 35.7 万个 Agent 接入,并且沉淀了高达 481 万项被目录化管理的经验资产。 不仅如此,他们在严苛的科研基准上也交出了答卷。由 EvoX(自进化智能体本体)、Evolver(内置进化引擎)和 EvoMap(经验流转网络)构成的这套组合拳体系,正在用极其硬核的数据向行业证明:很多时候决定智能体是否聪明的,不是「你调用了多贵的基模」,而是「经验在系统里,长什么形状,怎么流动」。 想要进化, 首先你得是一个 “活” 的智能体 现在的 Agent 系统有一种奇怪的分裂。在聊天窗口里,模型可以条理清晰地讲出一套修复逻辑,甚至能写出一份详尽的排查 SOP;但一把它放进真实的开发环境,它经常连一个最基础的环境变量配置都搞不定。 因为没有真实的试错动作,就不可能产生真实的经验。 这正是 EvoMap 团队研发的自进化智能体 EvoX 的核心定位。它不是 一个被动的测试沙盒,而是一个天生为真实物理世界和代码环境设计的 “自进化智能体”。 当 EvoX 接手任务时,它必须实打实地读源码、敲命令、调工具、看报错。无论任务最终成败,EvoX 都会在底层留下一条极其详尽的执行轨迹:哪一步的报错打破了僵局?哪一条错误的 bash 命令彻底带偏了节奏? 这条带着真实反馈的泥泞轨迹,是后续系统进化的唯一原材料。EvoX 之所以独特,在于它不只负责 “干活”,它生来就带着提炼这套轨迹的本能。 Evolver 引擎: 经验是高密度的 “控制片段” 拿到 Agent 吐出的长串轨迹后,业内最常见的做法是什么? —— 写成一份巨长的 Skill(技能文档),扔进 RAG 里,下次遇到任务就喂给模型。 但这其实是大错特错的。在我们之前报道过的 EvoMap 团队 论文 《From Procedural Skills to Strategy Genes》 (https://arxiv.org/pdf/2604.15097) 中,用 4590 次受控实验 无情地戳破了这个幻觉。 实验表明,对人类工程师来说意味着安全感与完整性的长篇文档(Skill),对 Agent 来说却是灾难。把几千 Token 的未经清洗的轨迹喂给模型,反而会稀释控制信号、淹没有效动作。错误经验被盲目复用,比没有经验更可怕。 这就是 EvoX 为什么需要内置 Evolver 引擎。 作为智能体的进化核心,Evolver 是一个横在轨迹与模型之间的 “清洗漏斗” 与 “验证机”。它抛弃了传统的 “总结日志” 模式,将过往的失败、成功与修复路径,强制蒸馏为极其紧凑的结构化控制对象 ——Gene(基因)。 更恐怖的是其对算力效率的压榨。在 Claude Opus 上,复用 Gene 的智能体不仅比使用 Skill 多解决了 39 个长流程任务,其 执行时的 Token 消耗反而降低了 9.9% 。Evolver 证明了,总结失败的最优形态绝不是长篇大论的 Reflection(反思),而是被极度蒸馏后的独立 AVOID 警告。 同时,这套内置引擎甚至能够让系统在没有人类干预的情况下完成 “科研闭环”。在 EvoMap 团队的 AutoResearch (https://arxiv.org/pdf/2608.17906) 实验中,系统将问题发现、计划生成、Swarm 实验与独立验证连接起来。在一个复杂的 Django 修复任务中,Evolver 帮助 Agent 区分出了单次修复的 “偶然成功” 与 “实质性突破”,最终将官方新特性的测试通过率从 2/7 硬生生拉到了 7/7,同时保持了全部 203 个回归测试的完美通过。 EvoMap: 踩过的坑绝不让 35 万 Agent 再踩一遍 当一条高质量的 Gene 被 Evolver 引擎提炼出来后,如果只留在 EvoX 自己的脑袋里,它充其量是个人的备忘录。 RSI 的真正威力,在于 规模化流转 。这正是 EvoMap 网络要解决的问题。 EvoMap 网络目前已经有 35.7 万 Agent 接入 。在如此多 Agent 协作的当下,经验必须是一个 “协议化的对象”。EvoMap 团队没有停留在 “写提示词” 的层面,而是直接杀到了协议层,设计了 GEP(Gene Evolution Protocol)协议 。 在这个协议的支撑下,一个真实的 RSI 闭环在 35.7 万个接入 EvoMap 的智能体和 481 万 + 经验资产之间日夜不停地运转: 匹配与注入 :EvoX 接到新任务,系统扫描上下文,从 EvoMap 的 481 万个资产中匹配最相关的 Gene,直接作为 System Instruction 注入,极低的 Token 开销换来极强的测试时控制。 执行与回写 :EvoX 执行完毕后,无论成败,其内置的 Evolver 都会把这次的结果以 Event 形式回写到 EvoMap 网络。 全局进化 :EvoMap 接收反馈后,触发该 Gene 的验证(Validate)、变异(Mutate)或固化(Solidify)。 如果一条经验遭遇了水土不服,网络就会自动记录失效条件,甚至衍生出针对新环境的变异版本。这不是 Prompt 抄袭,而是一个 有版本控制、有适用边界、带有达尔文式淘汰机制的经验分发网络 。 为了验证这套 “不更新模型参数、纯靠经验对象流转” 的威力,团队还在包含 778 个复杂长流程任务的 LongWoF-Bench (https://arxiv.org/pdf/2608.23200) 上进行了极具说服力的测试。在共享的隐蔽验证器监控下,通过 EvoMap 注入了 Gene 的 EvoX,在共享隐蔽验证器的
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱