开发者生态
morning
被热议的RSI,39 年前就已诞生?现代人工智能之父复盘RSI的漫长探索
摘要
作者 | Jürgen Schmidhuber 翻译 | 林绮蓓 最近一段时间,RSI(递归自我改进)成为人工智能领域的热门话题。 近期,OpenAI首次通过内部量化数据,系统披露RSI项目的实际推进情况;谷歌团队又发布论文《Deam-RSI:通过演化世界实现递归自我改进》,提出了一种新的递归式自我改进框架。 随着众多大模型公司纷纷加码RSI,围绕这一方向的讨论也持续升温,有不少人发出警告的声音。...
RSI
Jürgen
递归自我改进
Machine
Sakana
1987
Schmidhuber
林绮蓓
最近一段时间
成为人工智能领域的热门话题
2026-09-18
1 阅读
约10分钟阅读
Jürgen Schmidhuber
字号:
作者 | Jürgen Schmidhuber 翻译 | 林绮蓓 最近一段时间,RSI(递归自我改进)成为人工智能领域的热门话题。 近期,OpenAI首次通过内部量化数据,系统披露RSI项目的实际推进情况;谷歌团队又发布论文《Deam-RSI:通过演化世界实现递归自我改进》,提出了一种新的递归式自我改进框架。 随着众多大模型公司纷纷加码RSI,围绕这一方向的讨论也持续升温,有不少人发出警告的声音。 OpenAI首席科学家Pachocki发文指出,RSI可能成为未来科学发现的核心路径;但他认为目前尚无任何实验室真正解决AI对齐问题,并呼吁在推进相关研究的同时放缓步伐、建立统一的安全标准。 就在这一背景下,被誉为“现代人工智能之父”的Jürgen Schmidhuber发布了一篇长文,系统回顾并详细披露了自己研究RSI的历程。 文章中,作者系统梳理了几条主要研究路线:1987年的元进化与元强化学习;1994年以来基于自修改策略的强化学习;1991—1992年通过快速权重和自指神经网络实现的神经网络元学习;2002年提出的能够复用既有知识、逐步解决新问题的OOPS课程学习方法;以及2003年提出的,在数学意义上实现自我改进最优性的Gödel Machine。此外,文章还讨论了人工好奇心、内在动机与RSI的结合,以及近年来快速权重、MetaGenRL、VS-ML、SRWM和基于LLM的Gödel Machine等进展。 Jürgen Schmidhuber最后强调,软件层面的自我改进只是RSI的一部分。如果要实现真正的人工智能,必须将其与机器和机器人所处的物理世界结合起来。 Sakana AI的联合创始人兼首席执行官David Ha转发文章并表示,当前大模型头部实验室所谓的引领前沿的技术措施并非能够真正的提供安全保障。当下真正的风险也并非是超级智能,而是两家公司控制前沿人工智能技术带来的权力的集中。他认为唯一真正保障的,是建立一个健康的独立实验室生态系统和强大的开源社区。 以下是Jürgen Schmidhuber发布的文章内容: 递归自我改进(RSI),始于1987年 摘要 截至 2026 年,包括 Anthropic、OpenAI、Sakana AI 和 SpaceX 在内的每个人都在讨论递归自我改进(Recursive Self-Improvement,RSI)或元学习(Meta Learning,即“学习如何学习”),一些初创公司甚至明确将自己定位为 RSI 企业。然而,RSI 的历史远比这更为久远。 1987 年,当时的计算成本约为今天的10⁸倍,我在毕业论文中发表了第一批具体的 RSI 算法。我还为论文封面绘制了一个能够自我引导程序的机器人形象(见上图)。该论文是我长期开展 RSI 研究的一系列成果中的第一篇。这一研究方向在 2010 年代逐渐受到广泛关注, 2020 年代则更甚。 本文总结了我们在以下方面开展的 RSI 研究:自1994年以来关于具有自修改策略的强化学习(RSI)的研究;自1992年以来基于梯度下降的人工神经网络中的RSI研究;自2002年以来针对课程学习的渐近最优RSI;自2003年以来通过自指性的 Gödel Machine 实现数学上最优的RSI; 自 1990 年/1997 年以来,将RSI与人工好奇心和内在动机相结合的研究;以及2020年以来有关RSI的最新研究。 另请参阅有关 RSI 的视频推文。 " 如今,计算成本已经大幅下降,基于软件的 RSI 也变得切实可行。然而,要实现完整意义上的 RSI,仅有能够自我改进的软件还不够,还需要现实物理世界中能够自我改进的硬件。 目前,应用最广泛的机器学习算法大是由人类发明和设计的。那么,我们能否构建元学习算法,使其能够学习更好的学习算法,从而构建真正意义上的自我改进型人工智能,而不受计算能力和物理极限之外的任何限制?自 1987 年围绕这一主题撰写毕业论文以来,这个问题一直是推动我开展研究的重要动力。 首先需要指出的是,元学习有时会被误认为只是将一个训练集上学到的知识迁移到另一个训练集上 (参见 N(eur)IPS 2016 演示文稿) "。然而,即便是标准的深度前馈神经网络(NN),也可以通过在其他图像数据集上进行预训练,更快地学会识别新的图像,从而实现迁移学习,例如 [TRA12] "所示。 真正的元学习和 RSI 远不止于此,也远不止于学习调整进化策略中的突变率等超参数。 真正的 RSI,意味着使用一种通用编程语言来编码初始学习算法,例如将其编码在循环神经网络(RNN)中,并赋予其能够以任意可计算方式修改自身代码的基本指令。随后,我们再用一个递归框架包围这段具有自指性、能够自我修改的代码,确保只有“有用的”自我修改才能够保留下来,例如本文第 2 节和第 5 节所述的机制。 元学习可能是机器学习领域最具雄心、同时也最值得投入的目标之一。一个优秀的元学习系统能够学会任何东西。在适当情况下,它可以通过类比、组块化、规划、生成子目标,或将这些方式结合起来进行学习——只要能够想到的学习方式,都有可能成为其学习对象。 1、元进化与 PSALMs(1987) 1987 年,我们发表了 [GP87] " [GP] "。据我所知,这是第一篇关于遗传编程(Genetic Programming,GP)的论文之一,研究如何在通用编程语言中进化生成任意长度的程序。 同年,我的毕业论文第 2 节进一步将这种遗传编程方法应用于其自身,使其能够递归地进化出更优的遗传编程方法。该系统不仅包含一个元层级,还包含元元层级、元元元层级,依此类推。我将这种 RSI 方法称为元进化(Meta Evolution)。 毕业论文的第 4 节还提出了用于收益最大化或强化学习(Reinforcement Learning,RL)的元学习机制,即原型式自指关联学习机制(Prototypical Self-Referential Associating Learning Mechanisms,PSALMs)。这是元元强化学习,或者说基于强化学习的 RSI 的一种早期形式。 这项工作将 I. J. Good 在 1966 年关于通过自我改进的“超级智能”产生“智能爆炸”的非正式推测性论述具体化了。需要指出的是,Good 当时并没有提出具体的 RSI 算法。此外,这项工作也与 Bellman 在 1967 年关于“元策略(metapolicies)”的思考有关。 https://people.idsia.ch/~juergen/genetic-programming-1987.html 2、基于自修改策略强化学习的RSI(1994 年至今) 1994 年,我提出了另一种元强化学习或 RSI 形式,称为增量式自我改进(Incremental Self-Improvement) [METARL2] ",适用于具有单一生命周期(即一次终身试验)的通用强化学习机器。 也就是说,与传统强化学习不同,该方法不假设存在可重复且相互独立的试验,强化学习智能体也不会被重置。它由一个自修改策略(Self-Modifying Policy,SMP)驱动。 SMP 是一种可修改的概率分布
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱