智能AI
morning
「人类造的最后一个AI」还有多远?一张图看懂OpenAI、Anthropic等大厂的RSI进度
摘要
机器之心发布 「人类造的最后一个 AI」还有多远?OpenAI、Anthropic 等头部厂商进度如何?定义中国 RSI 的 roadmap——前沿 AI 研究机构 Theseus Labs 结合 72 家产业实践,推出「RSI 五级框架」 刚结束的周末,在海外 AI 圈有篇来自中国的 RSI 行业分析报告引起热议。发布仅 10 小时达到百万浏览,binyuan hui、jiachen liu 等...
RSI
HCI
Theseus
Labs
OpenAI
Anthropic
2026
100
roadmap
Recursive
2026-09-15
1 阅读
约10分钟阅读
机器之心
字号:
机器之心发布 「人类造的最后一个 AI」还有多远?OpenAI、Anthropic 等头部厂商进度如何?定义中国 RSI 的 roadmap——前沿 AI 研究机构 Theseus Labs 结合 72 家产业实践,推出「RSI 五级框架」 刚结束的周末,在海外 AI 圈有篇来自中国的 RSI 行业分析报告引起热议。发布仅 10 小时达到百万浏览,binyuan hui、jiachen liu 等多位顶级 AI 研究者与行业 KOL 主动转发推荐,热度还在持续上升中。 海外知名 AI 媒体 DAIR.AI:自我迭代智能体是当下最热门的研究方向,这份报告是该领域一份清晰的全景地图。 未来主义者 Dr Singularity 评价:中国研究者绘制了通往真正递归自我改进的路线图,探讨「人类构建的最后一个 AI」如何成为可能。 RSI(Recursive Self-Improvement,递归式自我改进)正是今年 AI 圈最热关键词之一。 OpenAI 在组建 RSI 团队,Anthropic 发布《When AI Builds Itself》,Google DeepMind 用 AlphaEvolve 优化自家芯片,Meta 用 AIRA2 做自动研究,腾讯混元用 Hyra 做经验驱动搜索,字节 Seed 让模型进入评测、数据、训练全环节。 全球头部玩家的路线选择已经明显分化: 有人从模型权重和训练规则切入,有人从 Harness、记忆和技能库入手,还有人把赌注押在评估器与奖励机制的持续演化上……谁能率先抵达完全体 RSI? 这篇全面定义 RSI 完整路径的 roadmap,出自一家全新的 AI 前沿实验室:Theseus Labs。 核心创始人周煊赫 , 上海交大计算机学院最年轻 AP(97 年),博士毕业于清华大学。 上海人工智能实验室双聘助理研究员,面壁智能联合技术开发,智源青年学者,微软学者。 研究聚焦大模型数据治理、自进化理论与智能体记忆,主导多篇近五年 NIPS、VLDB 高被引论文。 获 ACM Jim Gray 博士论文提名奖(大陆高校首位),清华特奖、字节跳动奖学金、微软学者奖学金得主,入选 2026 年人工智能全球最具影响力学者榜单。 研究成果入选卡耐基梅隆大学、康奈尔大学等高校课程,多项项目成果被 OpenAI、字节跳动官方博客引用。 难得的是,Theseus Labs 没有把 RSI 写成一场「智能爆炸」的哲学畅想,而是集合 OpenAI、Anthropic、Google DeepMind、Meta、腾讯混元、字节 Seed 等 72 家公司与团队的公开材料里,一家一家地拆,一条一条地比,最后才给出这套从 L1 到 L5 的自主权路线图。 换句话说,这不是一篇「坐在书桌前想出来的报告」,没有在谈宏大的智能爆炸。 Theseus Labs 联合清华大学、字节跳动、面壁智能(ModelBest)、小红书超级智能团队、Humanlaya、Agent-Native Research Lab、上海 AI Lab、衔远科技等多家学术与产业机构,发布《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》。 首次用「改进循环」作为分析单元,系统梳理了 RSI 的技术路线、产业实践和评估挑战。 一句话总结:RSI,终于被拆成了可分级、可度量、可工程化的路线图。 文章:http://arxiv.org/abs/2609.11873 01. 先用一把尺子,量出 AI 的「能力余量」 为了客观评估当前大模型离真正的自主还有多远,Theseus Labs 构建了一个新指标:Headroom-Closed Index( HCI,即「能力余量闭合指数」 ) HCI 衡量的是:相较于某项评测最初的前沿水平,模型填补了多少通往满分的差距。计算时,以该评测首次纳入数据集那一年模型得分的第 90 百分位作为基准,按「 HCI=(当前得分-基准得分)÷(100-基准得分)×100 」计算。例如,基准为 60 分、当前为 80 分,HCI 就是 50,表示原有提升空间已被填补一半。汇总某个领域时,先取各评测每年 HCI 的第 90 百分位代表当年前沿水平,再按参与模型数量的平方根加权平均,兼顾覆盖度,同时避免规模最大的评测主导结果。 他们汇集了 2023 年至 2026 年间,覆盖 10 大能力领域的 393 组模型与基准测试观测。 通过将各基准首年前沿设定为 0 分、满分设定为 100 分,HCI 统一了不同测试的量纲,回答了一个最本质的问题: 在各大领域,模型距离人类天花板究竟还差多少「剩余空间」? 数据结果给出了一个极具反差的图景: 截至 2026 年,前沿数学的 HCI 已达 86.4,研究生级科学为 85.8,广博知识 77.2。 然而,法律推理仅 64.5,多模态推理 62.2,前沿学术广度 60.4。 坦言说: 模型在「标准化考试」上快摸到顶了,但在「真实任务执行」上才刚刚起步。 HCI 的用意并非给模型排座次,而是作为一张诊断图,指明哪些领域的「剩余空间」最丰厚,也正是 RSI 未来最应该发力去啃的硬骨头。 02. 五级自主权:从执行到递归继承 基于此,Theseus Labs 按 AI 在改进循环中承担的责任, 发布 RSI 五级框架,首次系统定义「递归自我改进」。 L1 执行自主: 人类投入 ——设计任务、设计试验环境、设计更新策略; 智能体闭环 ——执行任务、更新。 L2 策略自主: 人类投入 ——设计任务、设计试验环境; 智能体闭环 ——执行、设计更新策略、更新;更新策略由系统持久化沉淀。 L3 经验获取自主: 人类投入 ——设计试验环境; 智能体闭环 ——规划经验获取、执行、设计更新策略、更新;经验设计由系统持久化沉淀。 L4 环境适应自主: 人类投入 ——设定边界; 智能体闭环 ——规划经验获取、与环境交互、设计更新策略、更新;环境适应由系统持久化沉淀。 L5 递归继承自主: 人类投入 ——设定边界; 智能体闭环 ——改进改进系统、设计经验获取、与环境交互、设计更新策略、更新;改进系统设计由持久化沉淀。 沿着这五级阶梯看, 大厂目前主要集中在 L1–L2,如: OpenAI Symphony、Anthropic Agent Skills 为任务衔接与技能复用提供支撑,减少重复操作; OpenAI GPT-Red 的攻防自博弈、Anthropic Claude 的工具优化,以及微软 Agent Lightning、DeepSeek R1,则进一步将策略改进纳入自动化闭环,让人工逐项调试转向批量试验与反馈驱动的优化,提高改进效率与能力上限。 向 L3 迈进的:腾讯 R-Zero 自主出题、求解,开始减少对人工准备学习任务的依赖。 到了 L4,Factory Signals、作为候选的 OpenAI 自改进税务智能体,着力把部署中的失败转成后续更新,缩短「发现问题—修复—验证」的链路。 至于 L5,Meta HyperAgents、Sakana Darwin Gödel Machine、Weco AI
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱