智能AI
morning
机器人GPT-3时刻震动硅谷!0行代码,看一遍秒会,黄仁勋李飞飞参投
2026-08-22
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 8 月 19 日,宇树科技在科创板敲钟上市,市值约 610 亿元。 同一天,英伟达 CEO 黄仁勋的女儿黄敏珊飞抵北京逛 WRC 世界机器人大会。 而就在第二天北京时间凌晨,硅谷机器人公司 Generalist AI 发布了新一代基础模型 GEN-1.5。 两个月前,斯坦福教授李飞飞刚以个人身份投了 Generalist AI 的 4 亿美元融资,同轮天使投资人还有小米联合创始人林斌和 Zoom 创始人袁征。英伟达也是股东。聪明钱和聪明人同时涌向同一个方向。 GEN-1.5 给出了它们投资的理由:给机器人看一段 3 到 12 秒的动作演示,不训练、不微调,当场执行,10 个操作任务平均成功率 59%。 以前教一个机器人拧瓶盖,工程师要编程三个月。现在需要的全部投入是一段三秒钟的演示,和零行代码。 多位顶尖研究者将这一刻类比为 2020 年 GPT-3 的发布,认为具身智能走到了自己的 GPT-3 时刻。 完整官方演示视频: https://www.youtube.com/watch?v=1cllCVK-9lo 没人教过的策略 从预训练中涌现 GEN-1.5 最让研究者震动的能力不是模仿,关键在于即兴发挥。 Generalist AI 做了一个实验:用 5 分钟的人类演示数据 (只做了 1 个梯度步骤的微调) ,教机器人用刷子把积木扫进碗里,然后替换工具。 给它一根香蕉,它把香蕉当成刷子,横扫积木入碗——这不奇怪,香蕉的形状和接触策略与刷子类似。 给它一个簸箕,它放弃了「扫」的策略,用另一只手把积木推上簸箕,抬起簸箕,把积木倒进碗里。 「扫」和「铲起来倒」是两种完全不同的接触序列,训练数据里没有教过这套动作。 Generalist AI 用最近邻语言搜索在约 189 万段预训练场景中检索,没有找到类似的簸箕用法。 没有人在任何阶段告诉模型应该这样做。 类似的即兴行为在测试中反复出现:碗被一张纸盖住了,模型自己掀开纸再放积木,有时还会把纸盖回去,但训练数据里没有这个场景。 一块乐高积木粘在机械手指尖上,模型用另一只手把它拨下来。 训练数据只演示了用一只手旋转罐盖,模型在某些尝试中自发切换到双手操作,采用了完全不同的抓取和旋转策略。 一个只被训练放一块积木进一个碗的模型,开始自发按颜色分拣多块积木。 这些能力有一个共同来源:大规模预训练。 GEN-1.5 已经连续预训练超过 8 个月,经历了三个训练阶段。 Generalist AI 公布的验证集曲线显示,模型的「下一步动作预测误差」持续下降,至今没有出现收敛的迹象。 用大语言模型领域的术语说,这就是 具身智能的 Scaling Law (缩放定律) :随着物理交互数据的规模增大和训练时间的延长,模型的泛化能力在持续增强。 一个反直觉的发现 让这条线索更加清晰 :微调的梯度步骤越少,即兴发挥能力越强。 Generalist AI 的解释是,轻度微调让模型更接近预训练积累的广泛行为库,保留了更多可调用的「物理经验」。 10 个梯度步骤只改变了模型参数的 0.15%。 Generalist AI 的说法是:这已经接近于「提醒模型一些它几乎已经知道的事情」。 GEN-1.5 还跨越了两道长期困扰机器人领域的鸿沟。 在模拟器里录制一段演示 (尽管预训练数据中不包含任何仿真数据) ,塞进上下文窗口,真实机器人直接执行任务,并且能泛化到不同的机械手和新的物体位置。 在部分测试中,一个人直接用自己的双手在机器人摄像头前演示动作,机器人随后用机械手复现了任务。 Generalist AI 表示,所有这些能力都不是刻意设计的结果:没有专门促进上下文学习的架构改动,没有元学习循环,没有鼓励即兴发挥的辅助训练目标。 这些能力从大规模物理数据的预训练中自行出现。 「操作学习的圣杯」 其他研究团队此前也展示过类似的上下文学习能力,但仅限于少数任务类型,GEN-1.5 的新颖之处在于覆盖面;所有结果均为 Generalist AI 自行报告,尚未经过独立验证。 任务本身是简单的短程操作 (拧瓶盖、拉拉链) ,距离真实场景中的长程复杂任务仍有很大距离。 GPT-3 发布于 2020 年 6 月,从 GPT-3 到 ChatGPT 过了两年半 (是的,两年半) 。 GEN-1.5 现在的位置与 2020 年的 GPT-3 类似:能力粗糙但方向明确,任务简单但 Scaling 趋势清晰。 Generalist AI 在官方博客中写了一段引人深思的话: 过了某个预训练阈值之后,适配一个新任务的成本变得可以忽略不计。 涌现的上下文学习、几秒钟的数据、或者一个梯度步骤加一分钟的演示,已经不再是传统意义上的任务特定训练,更接近于提醒模型一些它几乎已经知道的事情。 如果具身智能的 Scaling 曲线确实没有收敛的迹象 (Generalist AI 说他们还没有看到) ,那么下一轮竞争的核心资源就变成了谁拥有足够多的物理交互数据来喂给这台引擎。 这和 2021 年大语言模型进入数据争夺战的剧本,如出一辙。 看一遍就能学会 59% 和 83% 两组数字背后的拐点 2020 年 6 月,OpenAI 发布 GPT-3。 这个模型做了一件当时没人做到的事:不需要重新训练,只要在对话框里给几个例子,它就能完成新的语言任务——给一组「红→苹果,黄→香蕉」的例子,再问「绿→?」,它能答出「西瓜」。 这种能力叫 in-context learning (上下文学习) ,是大语言模型从「专用工具」变成「通用平台」的分水岭。 GEN-1.5 把同样的事搬进了物理世界。 Generalist AI 称之为 Physical Prompting (物理提示) 。 操作方法很直接:一段真实的动作演示 (包含传感器数据和动作轨迹) 塞进模型的 30 秒上下文记忆窗口,剩余空间用来接收实时环境观测。 模型立刻尝试执行,整个过程没有任何训练步骤。 这里需要解释一个对理解 GEN-1.5 至关重要的概念:梯度步骤 (gradient step) 。 传统做法中,教机器人学新任务需要数万步梯度下降,每一步都是对模型内部参数的一次微调——这个过程通常需要大量数据和大量算力。 GEN-1.5 的 one-shot 模式 (只演示一次的模式) 跳过了全部梯度步骤,模型参数纹丝不动。 Generalist AI 在 10 个不同的操作任务上测了 GEN-1.5 的表现:拧开玻璃罐盖、拉开笔袋拉链、从钱包里取钱、叠纸、叠杯子、翻手机、用刷子扫积木、打开书本封面、撕开真空垫、清扫垃圾。 结果分两组: one-shot (看一遍,零梯度步骤) :10 个任务平均成功率 59% (标准差 ±10%) 。 few-shot (少样本,5 分钟数据、约 50 次演示、10 个梯度步骤) :平均成功率 83% (标准差 ±9%) 。 2020 年 GPT-3 在语言任务上的数字拿来对照:one-shot 约 45%,few-shot(约 100 个例子)约 65%。 两组数字的结构高度相似。 这组数字的含义可以这样理解:在大语言模型出现之前,让 AI 做一个新的语言任务 (比如翻译一种没见过的格式) ,需要专门采集数据、训练一个新
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱