数码硬件
morning
最先跑通具身智能RSI的,未必是模型最强的公司
2026-09-23
1 阅读
约10分钟阅读
智讯智库
字号:
文 | 智讯智库,作者 | 陈宥文 如果把智能演化压缩成一条线,推动变化的主体一直在迁移。 最早,是自然选择塑造人;后来,人类用语言、工具和制度把知识留给下一代;再后来,人开始制造机器,并不断让机器变得更强。 到了2026年,一个新的转折开始出现: AI开始从被研发的对象和辅助工具,进入研发过程本身——不只被人改进,也开始参与下一代机器的研发。 这很像“棘轮”——机械上的棘轮允许齿轮沿一个方向转动,同时阻止它退回原位;人类文化也通过保存知识、工具和方法,让后来者站在前人的成果上继续改进。研究者将这种成果得以保留、并在此基础上持续累积的机制称为“文化棘轮效应”[1]。 过去,推动这个棘轮的始终是人。 关键的变化,开始出现在研发端。 在2026世界机器人大会上,王兴兴介绍宇树正在探索的物理AI机器人自进化路线:大模型介入研究检索和控制代码生成,再通过仿真、真机测试和评价反馈形成持续迭代闭环[4]。 也就是说, AI系统的角色,正在从研发对象和辅助工具,进一步延伸到下一代机器的研发过程。 而要进一步跨入RSI,关键还在于: 上一轮研发积累能否反过来提升下一轮研发效率,使系统越来越擅长产生有效改进。 这正是 RSI(Recursive Self-Improvement,递归自我改进) 关注的核心:系统不仅继承上一轮的改进结果,还进一步优化产生改进的方法本身 [5]。 如果这一机制能够稳定提效积累,“下一代更强”就可能进一步变成 “更强的下一代出现得更快” 。 推动棘轮的主体,也就不再只有人。 而当这套逻辑进入具身智能,又会多出一层数字环境难以等价面对的约束: 真实部署。 机器人每一次真机试错都会消耗设备、时间和人力,却也会暴露真实状态、异常、接管与恢复等信息。如果这些部署经验能够稳定回到训练和验证系统,并被后续版本继承,产品部署就不再只是商业交付,也开始成为持续改进的研发入口。 因此,判断一家机器人公司的持续改进能力,可以落到一个很具体的问题: 今天在真实世界暴露的问题,需要多久才能转化为下一版经过验证的新能力? 基础模型决定这一代能做到什么,持续改进系统决定下一代能力能以多快的速度形成。 由此就可以说: 最先跑出具身智能RSI闭环的,未必是基础模型最强的公司。 要理解这个判断,可以先看数字环境中的RSI究竟走到了哪一步。 AI已经会自我改进,但离“越来越会改”还有距离 1965年,英国数学家I. J. Good提出“intelligence explosion(智能爆炸)”:如果机器能够参与设计比自己更强的机器,更强的下一代又继续参与研发,改进便可能一轮轮叠加[6]。六十年后,这条链里几个过去只能存在于思想实验中的环节,已经陆续进入工程系统。 今天的问题因此已经变了。我们不再只问机器会不会参与研发,而要进一步判断: 它已经参与到哪一层,上一轮的改进又能不能真正进入下一轮? 第一步:AI开始接手研发 最先发生的变化,是AI从研发助手逐渐变成研发执行者。9月17日,Anthropic第一次用内部数据量化这种变化[7]。按照Epoch AI提出的Automation Level,2026年2月,其内部达到AL4——人主要提供高层目标、AI完成大部分端到端任务——的研发工作占比还不到1%;到8月,这一比例已经升至26%,超过90%的研发工作至少达到AL3。 图片备注:Anthropic数据显示,Claude主导完成的AI研发工作占比从2026年2月不足1%升至8月的26%,AI正在从研发助手进入更完整的端到端执行环节。 图源:Anthropic Institute,Measurements for Understanding the Pace of AI Development Inside Frontier Labs,2026年9月。 研发规模也在同步扩大。在Anthropic使用最多的内部Agent平台上,任意时刻约有3万个Agent同时从事研究和工程,仅8月就做出了超过10亿次决策[7]。虽然还没有被测量的研发工作达到完全无人介入的AL5,但人与AI的分工已经明显改变: 人开始退出越来越多 的 具体执行,把位置上移到目标设定、监督和最终判断。 执行权正在转移,但这仍然只是研发自动化。真正决定棘轮能不能继续向前转的,是上一轮研发留下的经验,能不能进一步改变下一轮研发本身。 第二步:经验开始改变下一轮怎么研发 Dream-RSI直接触到了这一层[8]。它把过去真实搜索留下的记录组织成“回放模拟器”,让AI在已经发生过的探索历史中重新测试不同策略:哪条路线值得继续,什么时候应该停止,多少实验需要并行,有限算力应该投向哪里。 图片备注:Dream-RSI把真实搜索历史转化为可反复回放的模拟环境,让上一轮经验直接参与优化下一轮搜索策略,形成“探索—回放—改进—再探索”的循环。 图源:Dream-RSI官方项目页,Dream-RSI: Recursive Self-Improvement through Evolving Worlds,Figure 1。 改进后的探索策略再进入真实任务,新产生的记录继续补充模拟器,如此循环。整个过程中,底层coding agent并没有改变,真正被改写的是模型外部的搜索和编排方式。 这种改变已经体现出可计量的效率差异。在GPU Kernel任务中,Dream-RSI用1.79至2.43倍更少的生成次数达到相近性能;在另一些任务中,则能在相近预算下把性能最高提高到固定探索策略的2.09倍[8]。 过去的经验,开始反过来改变下一轮应该怎么寻找答案。 但这里仍有一条清楚的边界。Dream-RSI改进的是模型外部的搜索策略,底层Agent并没有随着循环一起变化;研发方法变好了,并不等于被研发出来的新系统也更擅长继续研发下一代。要跨过这一层,修改对象还必须继续向系统自身推进。 第三步:被改出来的Agent,重新站回研发起点 Darwin Gödel Machine(DGM)把修改对象推进到了Agent自身[9]。它允许coding agent直接修改自己的代码,新版本随后进入真实编程任务接受检验,表现较好的版本被保存进archive,再成为后续修改和搜索的起点。 图片备注:DGM允许coding agent修改自身代码,并把表现更好的新版本重新放回后续搜索过程,形成持续扩展的Agent演化谱系。 图源:Sakana AI,The Darwin Gödel Machine: AI that improves itself by rewriting its own code,2025年5月。 最终,SWE-bench成绩从20.0%提高到50.0%,Polyglot从14.2%提高到30.7%[9]。但这里更重要的并不是Benchmark本身,而是 被改出来的新Agent没有停在实验终点,而是重新站到了下一轮研发的起点。 修改、测试、保留、继续修改,由此具备了连续运转的结构。 DGM仍然留着一个关键缺口。它的archive怎样维护、版本怎样选择、整体搜索怎样组织,仍由外部框架规定。换句话说,它证明了AI可以不断改出新的Agent,却还没有证明 新Agent越强,它继续开发下一代Agent
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱