智能AI
morning
AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI
2026-09-15
1 阅读
约9分钟阅读
思邈
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI 思邈 2026-09-14 11:45:46 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 让模型自己生成训练数据、自己改写提示词、自己修复代码,这条路线被称为: 递归自我改进(Recursive Self-Improvement,RSI) 。 但几乎所有RSI系统都是同一套结构:一个固定不变的改进程序,反复作用于模型。并往往只从Harness、Data或Model RSI的单一视角切入。 为了回应这一难题,CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家海内外高校发布MetaRSI-v1。 这是 全球首个统一Model-RSI、Data-RSI、Harness-RSI的元递归架构 ,能够改进“自我改进的过程”。 RSI由此进入“平方时代”。 △论文首页 在没有任何外部教师模型参与下 ,MetaRSI-v1使得一个仅30亿激活参数的小模型, 在四项基准上平均自我提升10.9分 ;并且让GPT-5.6、Claude Opus 5等六款前沿旗舰模型, 平均提升7.3分 。 更重要的是数字背后, MetaRSI-v1是一套试图 统一整个RSI领域的架构语言 :包括一个内核、两条编排轴、三个算子、整个元RSI层,以及五大定律。 △MetaRSI-v1概览 首次被统一的Loop Kernel范式 Loop Kernel是MetaRSI-v1首次提出的自我改进统一形式。 它第一次把“进步如何发生”抽象成一条与对象无关的闭环:消费反馈得到的学习信号,在Data、Harness、Model上提出改动,交由验证器裁决,并将结果回流为下一轮信号。 Data、Harness、Model从此开始能够被统一成同一Kernel的不同实例化算子 ,可组合、可统一调度,自我改进由此第一次拥有了统一、可复用的底层骨架。 △Loop Kernel范式 改进空间:Data-RSI、Harness-RSI、Model-RSI 沿用同一个Loop Kernel,自我改进在三个空间上展开,分别由Data-RSI、Harness-RSI、Model-RSI三个算子承担并协同完成。 Data-RSI :从自身运行轨迹提取学习信号,经校验用于合成数据交由下游消费,标定并放大模型正向能力与负向能力边界。 Harness-RSI :利用学习反馈信号,在Harness拆分出的System Prompt、Skill、MCP、Tools、Memory五个可插拔槽位上生成改进,做加法与减法。 Model-RSI :更新模型自身的参数与结构,把反复验证有效的行为内化进模型。 纵横之间:让改进自己找到最优路径 横轴(horizontal orchestration)编排算子的应用顺序 :RSI² Agent在每个决策点根据信号反馈选定下一个算子,再把该算子有机衔接编排送入RSI Loop Kernel执行。 纵轴(vertical optimization)优化算子的内部策略 :RSI² Agent向目标算子专属的RSI² Sub-Agent下发指令,后者根据学习信号与环境反馈等改写算子本身的RSI规则,优化RSI系统本身。 递归之上的递归:三层改进与“元层”的诞生 整套架构由四个Agent协调运作,并且均能被人类专家局部替换形成human-in-the-loop系统。 MetaRSI² Agent :学习如何进行合适的纵横优化,优化 RSI² Agent 的策略学习。 RSI² Agent :在每个决策点选择进行横轴(指定下一个算子)或纵轴(向Sub-Agent下发策略改写指令)优化。 RSI² Sub-Agent :在纵向优化中,接受来自 RSI² Agent的 执行指令,对算子内部的RSI策略进行调整。 Transition Agent:负责衔接横向编排中上游算子的产物与下一个算子对产物的消费。 四个Agent对应形成三个RSI优化Level:算子改进目标系统,双轴编排改进算子用法,元层改进双轴编排策略本身。 实验:小模型与前沿模型均实现自我进化 实验沿两条路线展开: 小模型路线 使用可训练的开源模型,Data、Harness、Model三个算子全部启用; 前沿模型路线 面向Claude Opus 5,GPT-5.6 sol,Kimi K3等顶级模型,这类模型参数巨大或为闭源模型,仅启用Data与Harness算子。 路线一:小模型的自我改进 目标模型为Qwen3.5-35B-A3B(35B总参、3B激活),在Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond高难度子集、AIME四项基准上评测。 △MetaRSI让Qwen3.5-35B-A3B实现自进化 MetaRSI-v1平均提升10.9分,SWE-bench Pro 解决率接近翻倍 ,Meta层为RSI带来更高的天花板, 连续自进化的累计增益提升显著 。 △“改进改进者”,MetaRSI让小模型累计自进化增益扩大 路线二:前沿模型的自我改进 多款前沿模型在Terminal-Bench 2.1上平均提升7.3分,说明MetaRSI范式对前沿模型同样成立, 旗舰模型同样留有可观的自我改进空间 。 △六款前沿模型的自我改进 五条定律:为“机器如何进步”立法 MetaRSI梳理出 两条互补的改进路线 :Harness-RSI保持权重不变,让自我改进覆盖任何可通过接口调用的模型;Model-RSI通过训练把能力内化进模型。 且MetaRSI首次重新定义了Data-RSI,作为模型的能力边界探测与放大器,通过对执行轨迹与外界反馈learning-signal的联合分析得到经过验证的经验并scale为可复用的数据,并标定这些经验能够支撑到哪里,框定模型能力的正、负边界。 Data-RSI的产物同时供给Harness-RSI与Model-RSI消费,两条路线的改动结果又能够流回Data-RSI,重新标定能力边界、驱动下一轮,能力由此逐轮披露、累积。 在这一过程中,Harness不仅能做加法还能做减法:Data-RSI放大暴露的问题经Model-RSI内化之后,原本吸纳在Harness中的知识会变成冗余,Harness-RSI系统在回放校验下将其删除,能力留下,成本退场。 在此之上,MetaRSI提炼出五条定律。 定律一:验证决定自我改进的前沿。 一个领域能不能形成自改进闭环,取决于该领域任务能否被检验,是否有合适的verifier。 定律二:自我认知会过期,重新发现能力边界是速率瓶颈,RSI改变agent能力,其原本旧的系统描述随即失效。 定律三:能力与载体无关但成本与载体有关。 例如同一项能力放在Harness里每次推理都要重付成本,内化进Model只需付一次,成熟循环能够持续把能力迁移到更便宜的载体。 定律四:可信度由不可写面度量
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱