首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

离开OpenAI和Google后,两位大模型核心负责人决定卷下一代架构

摘要

机器之心编辑部 曾经最相信强化学习的人之一,如今却认为:强化学习没有把我们带到 AGI。 Jerry Tworek 曾是 OpenAI 内部坚定的「强化学习最大主义者」。在 GPT-3、GPT-4 之后,他一直相信,大模型缺少的最后一块拼图就是大规模强化学习。只要把这条路线真正推到极致,剩下的问题或许都会被解决。2024 年时,他甚至判断,AGI 可能会在 2025 年到来。 后来,他真的站到了这...

Jerry AGI GPT 模型一代代变强 Rohan Transformer 补充数据 机器之心编辑部 曾经最相信强化学习的人之一 如今却认为
2026-08-05 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心编辑部 曾经最相信强化学习的人之一,如今却认为:强化学习没有把我们带到 AGI。 Jerry Tworek 曾是 OpenAI 内部坚定的「强化学习最大主义者」。在 GPT-3、GPT-4 之后,他一直相信,大模型缺少的最后一块拼图就是大规模强化学习。只要把这条路线真正推到极致,剩下的问题或许都会被解决。2024 年时,他甚至判断,AGI 可能会在 2025 年到来。 后来,他真的站到了这场实验的中心。 模型一代代变强,评测分数不断上涨,复杂推理能力也迅速提升。但 Jerry 看到的另一个事实是:实验室里的进展,并没有完整转化为现实世界中的可靠能力。训练任务越来越难,模型越来越会考试,却仍然无法适应大量模糊、变化且从未被预先定义的问题。 这让他开始怀疑,问题可能不只是强化学习还不够大,而是今天的模型根本缺少一种更基础的能力: 它们不会在进入真实世界后继续学习 。 带着这个判断,Jerry 与 Rohan Anil 共同创办了 Core Automation。Rohan 曾是谷歌 Gemini 的预训练负责人之一,也长期研究优化算法、模型架构和底层计算系统。一个来自大规模强化学习,一个来自预训练与优化,两人的经历几乎覆盖了当前大模型的两条核心路线。 但他们决定不再沿着这两条路线继续加码。 当整个行业仍在扩大 Transformer、增加推理算力、追逐更强的编程智能体时,他们选择追问一个更根本的问题:如果模型只能在实验室中完成学习,需要人类不断收集数据、重新训练和发布新版本,它真的能够走向 AGI 吗? 在最近的一次对话中,两位创始人系统解释了他们对当前 AI 路线的判断:为什么大规模强化学习没有成为通往 AGI 的最后一块拼图?为什么从经验中学习不等于强化学习?Transformer 真正缺少的能力是什么?以及,一个能够在部署后持续学习的下一代架构,可能是什么样子? 视频地址:https://www.youtube.com/watch?v=2RJiaf0SY8s 模型一代代变强 问题却出在实验室之外 强化学习确实让模型变得更强。它提升了复杂推理和任务执行能力,也让模型能够掌握越来越多预先定义好的工作流程。 但 Jerry 逐渐意识到,训练任务和标准评测往往只是「一枚硬币的两面」:研究人员根据希望模型掌握的能力设计训练数据,再用相近的任务检验效果。只要持续训练,模型自然可以在这些指标上取得进步。 真实世界却没有如此清晰的边界。用户的问题往往更模糊,环境不断变化,不同任务还会形成训练数据中没有覆盖的新组合。即使研究团队已经很难找到足够有挑战性的训练题,也不代表模型已经覆盖了现实世界的全部复杂性。 这暴露了当前训练方式中的根本矛盾: 模型在实验室里,根据预先收集的数据、设定好的环境和反馈完成训练;训练结束后,它才被部署到一个更开放、更混乱的世界。 强化学习可以让模型更好地完成研究者已经定义的任务,却无法保证它面对训练分布之外的问题时,也能自行适应。每当模型遇到新的失败,人类仍需要收集案例、补充数据,再把它送回实验室完成下一轮更新。 因此,真正承担学习工作的,依然是实验室,而不是模型自身。 强化学习没有失效,但它让缺失的那部分变得更加清晰:下一代模型不仅要在训练阶段变强,还必须在进入真实世界之后继续学习。 「学习」的第三种可能 在 Jerry 看来,当前模型最根本的问题,不是掌握的知识还不够多,而是学习几乎只发生在部署之前。 预训练负责吸收海量数据,强化学习负责塑造模型的行为方式。完成这些步骤后,模型被交到用户手中,但参数基本已经固定。此后即使外部环境发生变化,出现新的工具、代码库或任务,模型也不会像人一样在使用过程中自然更新自己。它或许可以暂时适应,却很难把这些新经验稳定地转化为长期能力。 这意味着,模型的价值始终依赖训练数据是否提前覆盖了现实需求。遇到没有见过的问题时,常见做法仍然是收集失败案例、补充数据,再由实验室重新训练。 模型表面上在帮助用户完成任务,真正负责学习和更新的却仍是背后的研发团队。 现有系统并非完全没有部署后的适应能力。第一种方式是上下文学习(in-context learning):用户把新信息写进提示词或上下文,模型便能在当前对话中利用这些信息。它不需要修改参数,也不容易造成灾难性遗忘,因此相对灵活。 但这种「学习」容量有限。上下文窗口再长,也只能保存一定数量的信息,而且内容一旦被压缩、删除或开启新会话,模型获得的经验就很难继续保留。Jerry 以编程工具为例:使用一段时间后,上下文就需要被整理或压缩。如果模型只能记住最近几十分钟发生的事情,这还不能算真正意义上的长期学习。 第二种方式是持续微调,也就是根据新数据不断更新模型参数。它看起来更接近真正的学习,却会带来另一组问题。模型在吸收新知识时,可能破坏此前已经掌握的能力,这就是灾难性遗忘;与此同时,微调往往需要大量数据和计算,无法像人类那样根据少量经验迅速调整。 因此,当前两条路径各有明显局限:上下文学习足够灵活,却难以跨越较长时间;微调能够改变模型,却不够稳定,也不够高效。研究者长期尝试解决这些问题,至今仍没有找到简单可靠的办法。 Jerry 希望寻找的是第三种可能:做元学习,把「如何学习」本身写进模型架构,让系统能够在部署过程中根据用户、数据和真实任务持续更新,同时避免轻易遗忘原有能力。 这也是他为什么把问题指向架构,而不只是训练规模。 一个需要被反复送回实验室重新训练的模型,可以成为越来越强大的工具,却仍然缺少智能系统最重要的特征之一 —— 在环境中积累经验,并因此发生长期改变。 从经验中学习,不等于强化学习 如果模型需要在真实世界中持续学习,那么一个自然的问题是:强化学习能否承担这一任务? Jerry 的判断是,强化学习很重要,但它只是「从经验中学习」的一种方式。它通常让模型在环境中尝试行动,根据结果获得奖励,再通过大量重复调整行为。围棋、星际争霸、Dota 以及如今的编程任务,都可以用这种方式训练:模型生成自己的经验,再从成功与失败中更新策略。 但当前强化学习往往依赖大量并行试验。研究者让模型在许多相似环境中同时尝试不同方案,再比较结果,以降低训练中的不确定性。这种方法能够有效利用计算资源,却与人类学习经验的方式并不完全相同。 人通常无法同时进入成千上万个平行世界,也不会对每个问题都进行大规模试错。 更重要的是, 人类面对不同任务时,采用的学习方式并不相同。 学习踢球时,人会反复尝试,根据球是否飞向预期方向微调动作。这种过程很接近强化学习:行动、反馈、修正,再次行动。 学习数学时,过程却完全不同。一个人可能通过阅读定义、比较概念、在头脑中反复推演,直到原本分散的信息建立起联系。这里未必存在明确的外部奖励,也不需要重复成千上万次动作,但学习同样发生了。 两种过程都属于从经验中学习,却依赖不同的机制。前者更接近试错,后者更接近理解、压缩和重组知识。Jerry 因此认为, 大脑中很可能并不存在一种包办所有任务的单一学习算法,而是多种机制相互配合。 这也解释了为什么单纯扩大强化学习,未必足以解决持续学习问题。现实中的经验并不总能被整理成明确的动作、奖励和回合。有些反馈延迟严重,有些任务没有唯一正确答案,还有些学
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱