首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

机器人是具身大模型的「用户」:超维动力如何打通从人类经验到机器人行动?

摘要

编辑|杨文 今年 WAIC,最热闹的区域之一,是超维动力展台的一张乒乓球桌。 球桌对面,一台全尺寸人形机器人盯着迎面飞来的球,在很短的时间内判断落点、调整身体和步伐,再挥拍回击。视觉感知、轨迹预测、动作规划和全身控制,必须连续完成。 展台上还有一项看起来并不起眼的演示:一台双臂机器人打开易拉罐。 接到指令后,机器人先拿起饮料、调整罐体角度,再把开瓶器伸进拉环,将罐口撬开。动作幅度不大,但要求机器人...

KAI Bot WAIC 个自由度 最热闹的区域之一 是超维动力展台的一张乒乓球桌 球桌对面 一台全尺寸人形机器人盯着迎面飞来的球 在很短的时间内判断落点 调整身体和步伐
2026-08-03 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|杨文 今年 WAIC,最热闹的区域之一,是超维动力展台的一张乒乓球桌。 球桌对面,一台全尺寸人形机器人盯着迎面飞来的球,在很短的时间内判断落点、调整身体和步伐,再挥拍回击。视觉感知、轨迹预测、动作规划和全身控制,必须连续完成。 展台上还有一项看起来并不起眼的演示:一台双臂机器人打开易拉罐。 接到指令后,机器人先拿起饮料、调整罐体角度,再把开瓶器伸进拉环,将罐口撬开。动作幅度不大,但要求机器人持续判断开瓶器、拉环和罐体之间的相对位置。末端偏离几毫米,任务就可能失败;如果没有一次对准,机器人还要识别偏差并重新调整。 这项演示在 WAIC 四 天展期内保持了 「零失误」 。 但相比完成一次开罐,更值得关注的是机器人如何学会这个动作。 它所使用的经验并不主要来自机器人真机,其中 90% 来自人类第一视角数据。模型先从人类操作中理解任务流程,再将人的观察视角和动作转换为机器人能够使用的表示,最后通过真机数据学习精细操作和失败纠正。 这条链路涉及的不只是模型。 人的头部相机会随着视线移动,机器人的相机位置和视野却不完全相同;人的肩、腰和手腕可以自然配合,机器人的关节结构和动作范围则由具体本体决定。 模型理解了「打开易拉罐」这项任务,并不意味着机器人就能准确执行。从人类经验到机器人动作,中间还隔着视角、身体结构、动作空间和物理反馈。 超维动力同时布局人形机器人 KAIBot、灵巧手 KAI Hand、数据采集设备 KAI Halo、世界模型和 AI 基础设施,就是在试图打通一条完整链路: 让人类经验转化为机器人可以学习、执行和持续迭代的能力 。 超维联合创始人、香港大学计算与数据科学学院教授、科研副院长罗平将超维动力定位为: 「我们是一家具身智能大模型公司。」 一家大模型公司,为什么必须亲自造机器人?带着疑问,我们跟罗平聊了聊。 大语言模型服务人,具身模型服务机器人 罗平类比大语言模型进行了解释。 大语言模型在云端完成训练和更新,再通过统一接口向用户提供能力。未来的具身模型也可能形成类似的平台,为不同尺寸、不同构型的本体提供感知、规划和行动能力。 区别在于, 大语言模型主要直接服务人,具身模型的调用者和执行终端则是机器人。 「语言模型的用户是普通人,具身大小脑的用户是机器人。」 从这个定义来看,超维动力的终点并不是出售全尺寸人形机器人 KAI Bot,而是 建立一套能够适配不同机器人的模型和训练平台 。KAI Bot 是超维动力的参考本体,用于采集数据、开发算法和完成真机验证,也可以被视为这套具身模型最早的一类「用户」。 但让同一套模型进入不同机器人,远比通过统一 API 调用语言模型复杂。 每种机器人的身高、关节拓扑、相机位置、动作空间和动力学特性都不一样。同一条「向前伸手」的指令,落在不同本体上,可能对应完全不同的关节组合,也会产生不同的运动结果。 因此, 一个具身大模型平台至少需要解决两个层面的问题 :一是让模型理解物体、空间、任务和动作结果;二是将这种理解转换为具体本体能够执行的动作。 据介绍,WAIC 现场展示的乒乓球系统已经被部署到 KAI Bot、宇树 G1、智元远征 A3 等不同本体上。不同机器人都需要在短时间内完成乒乓球的球路判断、轨迹预测和动作生成,但机器人具体的全身控制仍需根据本体进行算法的适配。 在罗平看来,这可以被视为一次早期的跨本体验证。下一步更关键的问题是,模型中有多少能力可以直接复用,适配一种新本体需要多少数据和工程工作。这些指标将决定,一套具身模型能否真正形成规模化的平台。 「云端大脑」也不意味着机器人要把所有决策交给云端。乒乓球、平衡控制和碰撞响应等高频任务,对时延和稳定性要求很高,需要在机器人端实时完成。云端则更适合承担数据聚合、模型训练、能力更新和高层任务规划。 机器人在端侧完成感知和执行,云端系统负责学习和迭代 ,这是超维动力设想的具身模型形态。 「超维动力要做的,不只是一台机器人,而是让不同机器人持续获得新能力的具身智能基础设施。」 本体是模型接触世界的接口 模型最终必须通过本体进入物理世界。 本体的尺寸、关节和传感器,不只是硬件参数,也决定了模型能够执行什么任务,以及哪些人类数据可以被有效利用。 超维动力为此选择了全尺寸、高自由度和高拟人的本体路线。 KAI Bot 身高 173 厘米、体重约 70 公斤, 拥有 117 个全身自由度 ,约 80% 的体表覆盖触觉皮肤。除去单手 37 个自由度(其中 20 个为主动自由度、1 个为被动自由度、16 个为柔顺自由度),躯干约有 43 个自由度。与常见的全尺寸本体相比, 超维动力新增的自由度主要集中在头颈、双肩和腰部 。 罗平表示,高自由度是为了服务于两个目标: 进入以人为尺度设计的环境,以及尽可能完整地承接人类全身动作数据 。 「人类操作物体时,很少只移动手腕。」视线变化会带动头部转动,向桌面深处取物时,肩膀和腰部会一起前倾;搬运较大的物体时,人还可能用胸口、大腿和手臂共同提供支撑。 如果机器人只能对应人类手臂末端的轨迹,那么人类数据中的观察意图、重心变化和全身协作,就可能在迁移过程中丢失。 KAI Bot 的颈部自由度用于复现人类操作时的视角变化,肩部结构扩大手臂向前伸展的范围,腰部则让机器人能够前倾,触达更深的桌面区域。接近成年人的身高和臂展,也使其能够直接使用现有的桌面、货架、工具和门把手,减少对环境的额外改造。 高拟人本体由此承担了两种角色, 既是模型的执行端,也是连接人类数据和机器人动作的转换接口 。 当然,自由度越多,控制空间越大,硬件成本、标定难度、潜在故障点和算法复杂度也会随之增加。「更像人」有利于承接人类动作,并不天然等于更高的任务效率。 超维动力采用的办法是逐步解锁关节。算法开发早期先锁住部分新增自由度,让基础任务运行起来,再逐步开放颈部、肩部和腰部能力,以降低一次性控制 115 个自由度的难度。 这些新增关节最终能够为任务成功率和数据迁移效率带来多大提升,仍然需要通过具体任务验证。但从超维动力的路线来看, 高自由度的核心价值并不只是动作更拟人,更在于减少人类经验迁移到机器人时的信息损失 。 触觉,让机器人从「看见」走向「接触」 高拟人不仅体现在关节,也体现在触觉。 在 WAIC 现场,超维动力进行了两种类型的演示。 展台一侧,工作人员用木板直接冲击正在运动的 KAI Hand 灵巧手,受到冲击后,手指仍能继续活动。这项演示主要检验灵巧手的结构可靠性和柔顺控制能力。 另一侧,KAIBot 正在展示其触觉皮肤。工作人员从侧面轻拍 KAIBot 的肩膀,KAIBot 能够感知到日常触碰的轻微力,并作出对应的反馈。这项演示针对的是机器人的全身触觉能力,也就是类人的「皮肤」。 罗平将不少机器人演示概括为「生人勿近」 ,即使机器人只在桌面工作,人也不会轻易把手伸进它的运动范围。一个重达数十公斤的金属本体突然摆动手臂,可能直接对周围的人造成伤害。 但如果机器人未来进入家庭、医疗和商业空间,身体接触将无法回避。搀扶患者、帮助老人翻身或搬运大型物品,都要求机器人判断接触发生在哪里、力有多大,以及压力如何分布在身体不同部位。 视觉可以估计距离,却容易受到身体和物体遮挡,也无法完整还原接触力。 全身触觉
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱