首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI evening

三榜第一,完胜GPT-6!中国物理RSI杀出黑马

摘要

新智元报道 早晨,你还没睁眼,厨房里已经传来轻微的碰瓷声。 推门出去,机器人管家X1站在餐桌旁,你没说话,它就把把椅子轻轻拉开了一点。 你把门一关,它转身走向客厅,捏起那根逗猫棒。 猫伏低身子,尾巴一下一下拍地。逗猫棒上的羽毛刚晃到半空,猫就蹿起来扑了过去。 最后一瞬,X1把手臂一抬,猫爪擦着空气划了过去。它的手腕又轻轻一抖,羽毛荡回猫鼻尖,猫翻身再扑,它再躲开。几个回合下来,它已经摸透了这只猫的...

机器人 一教就会 请换鞋 加速3 机器人学完 GPT Embodied 新智元报道 你还没睁眼 厨房里已经传来轻微的碰瓷声
2026-09-24 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 早晨,你还没睁眼,厨房里已经传来轻微的碰瓷声。 推门出去,机器人管家X1站在餐桌旁,你没说话,它就把把椅子轻轻拉开了一点。 你把门一关,它转身走向客厅,捏起那根逗猫棒。 猫伏低身子,尾巴一下一下拍地。逗猫棒上的羽毛刚晃到半空,猫就蹿起来扑了过去。 最后一瞬,X1把手臂一抬,猫爪擦着空气划了过去。它的手腕又轻轻一抖,羽毛荡回猫鼻尖,猫翻身再扑,它再躲开。几个回合下来,它已经摸透了这只猫的脾气。 晚上你推开门,一句「我回来啦」还没落地,X1已经夹着拖鞋迎上来,送上专属问候:「公主,请换鞋。」 这就是大家梦寐以求的个性化家庭服务——一个能够适应你的习惯、理解你的家庭环境、为你量身定制服务的机器人管家。 但逗猫的手法、回家的「迎接仪式」——每家每户都不一样。这些东西出厂时预装不了,也穷举不完。 最简单的办法,是你亲自演示一遍给它看。看完,它就会。 为此,诺因(Knowin)发布了生成式学习框架GLOW(Generative Learning of World)。 原文链接:https://knowinai.com/tech.html 他们认为机器人能否走进千家万户,关键在于机器人「 理解人的技能、泛化执行 」。 这背后就是他们独特的判断: 家庭场景的商业化不会从通用能力开始,而会从有限、高频、可验证的任务集合切入。 而且家中有老人、儿童、宠物,有明火和化学品,安全是进入家庭的准入门槛,而不是加分项。 话不多说,我们先看一下「一教就会」效果如何。 「一教就会」,这才是你想要的专属管家 诺因公布了四组实机对照,每组左边是人的操作过程,右边是机器人学完之后自己做。 第一组是开盒收纳。 人示范的时候收的是一样东西,但机器人执行的时候,要收的物品换了另一种。 它先开盖,并且能够泛化识别物品和位置发生变化,再把东西放进盒子,最后合盖,一气呵成。 左:人展示开盒收纳;右: 机器人 换了物品照做(加速4.5倍) 请注意,动作只教了一次,机器人需要利用现场反馈完成每个阶段,成功将收纳这一动作泛化到多种物体和位置。 第二组是浇花。 人用的是黑色细嘴壶,但机器人手边只有一把绿色浇水壶。 壶的大小、颜色、位置发生变化,但它能够准确认出,把从人的操作中学到的抓持、朝向和倾斜关系用到这把壶上,浇完再放回去。 左:人用黑色细嘴壶 浇水 ;右: 机器人 换成绿色浇水壶照做(加速3.5倍) 也就是说,机器人学会的是执行浇花这一任务,而不是简单重复看到的教学动作,能够适应场景中的变化。 第三组是擦桌子,也是最有意思的一组。 人拿着抹布,沿心形轨迹擦了一遍,机器人学完,也擦出了一个心形。 左:人沿心形轨迹擦桌;右: 机器人 复现(加速3.5倍) 它把「擦桌子」这个目标和「怎么擦」这个人的习惯一起学走了。「公主,请换鞋」这种梗,靠的就是这个。 第四组是调酒。 桌上摆着好几个杯子,人先按顺序倒了一遍,让机器人看清先倒哪杯、再倒哪杯。 机器人学完,虽然位置顺序变了,但准确识别物品,依次取杯、倾倒、回正、放回,把多个步骤接成了一套完整的流程。 左: 人依次取杯调酒 ;右: 机器人 复现完整流程(加速12倍) 四组任务,模型权重没有动过一个参数。看过人的操作过程,机器人就能上手,一教就会,并且能泛化到更多位置、物品和场景。 在任务中,AI要协同调用多种能力:识别对象与动作,定位操作目标,判断交互结果,规划下一步。 此外,模型还要具备对物体和位置的泛化能力。 在诺因测试中,GLOW能力斩获三个榜单第一,用数字也证明了其泛化能力之强。 在RoboDojo的18项复杂任务里,GLOW平均成功率62.2%,而 GPT-6(Robocurve)是22.2%,提升了40个百分点。 在专治「背题」的LIBERO-Pro上,GLOW成绩为86.7%,GPT-6 Astra只有58%,单模型这一档86.7的平均分排第一。 在 Embodied Arena 的 2D-Embodied QA Benchmarks 榜单中,在 20 个具身模型中,GLOW以 65.62 的综合得分勇夺第 1,脱颖而出。 核心解密:原生自回归才是行业最优解 机器人观看人的操作视频时,用一个技能编码器把连续的视觉经验压成一份可复用的技能上下文。 它提取的是任务结构,也就是哪个东西是操作对象、要放到哪个区域、动作的先后顺序是什么,以及做到什么样才算完成。 浇水的六个阶段。 上排是人用黑色细嘴壶浇水 ,下排是 机器人 把抓持、 朝向 、倾斜的关系映射到绿色浇水壶上 执行时,这份上下文和当前画面、语言指令、机器人状态拼在一起,逐token生成判断和动作。 GLOW还能结合当前的实时观察,把你昨天的「教学」融入当下的自回归生成中。 它会自主规划路线,避开茶几上的水杯,打开盒子。你还可以用语言随时调整目标和做法。 能这么干,前提是大脑和双手在同一个模型里。 行业里常见的VLA路线,把视觉大模型当个编码器,外接一个动作模块,中间要做复杂的表示转换。 WAM路线则要先生成一段未来的「逼真视频画面」,再输出动作,计算开销很大。 GLOW的核心KnowinGlow是一个原生统一的自回归模型,把视觉、语言、动作编织进同一条序列。 BrainSkill负责空间理解和语义落地,ActSkill负责闭环动作生成,原来分开的「大脑」和「双手」,现在是同一个模型里的两项技能。 它的上下文里装着相机的实时RGB-D画面、你说的那句指令、机械臂当前的关节角度和夹爪开合,以及刚才一秒执行了什么动作、得到了什么反馈。 GLOW把这些物理世界的信息像文字一样连缀成一篇「长文章」,然后顺理成章地续写出下一个动作。 物理推理测试。图中彩色线条是候选动作轨迹,问「为了烹饪番茄该选哪组顺序」,模型答:切番茄、打开炉火、揭开锅盖、倒油、放入番茄 续写出来的也不是「move_to(cup)」这种模糊指令。 模型直接生成末端执行器的三维位姿、相对平移与旋转增量,以及夹爪的开合控制,精准到毫米。 目标点定位测试。左:「把橙色积木放到绿色积木上」,模型给出目标点[[368,664]];右:「在蓝色杯子与青色碗之间的空闲区域标出位置」,模型给出[[534,800]] 而诺因选择这条路线,看中的不只是「教一遍就会」,还有统一建模与持续学习的长期价值。 而GPT-6 Astra在操作机器人上的最新进展,则进一步佐证了诺因长期坚持的自回归技术路线。 Harness系统与闭环反馈:给机器「痛觉」和「记忆」 学会了,还得做得成。真实的物理世界里,抽屉可能卡住,杯子也可能从夹爪里滑出去,光有计划不够。 这一点上,诺因直接把刚被Brockman叫作AGI的GPT-6 Astra拉进了同一个仿真厨房。 结果,号称AGI的GPT-6,卡在了一个抽屉上。只因它不知道自己的手有没有被挡住。 但GLOW知道。它有一套叫Harness的任务运行系统,每做一个动作都会拿到一份执行回执。 比如系统下达「向柜体走24.3毫米」,回执显示实际只走了1.6毫米。 位移残差一出来,系统立刻明白遇到物理阻力了。这个「受阻」结果连同夹爪状态和新画面一起进入下一轮上下文。 大脑随即决定,是继续用力,还是换个姿态重来。 同样的任务、同样的起点,让GLOW和GPT-6 Astra
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱