首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

比李飞飞的T-Rex更进一步:戴盟给机器人装上了「物理交互脑」

摘要

机器之心发布 "The dexterity of a hand is mostly about the brain, not the hand." 这是 “全球机器人灵巧操作之父” Matthew Mason 写在个人主页上的一句话: 灵巧操作在 于脑 ,而不在手。 Matthew Mason 为卡内基梅隆大学教授,他开创了研究机器人操作领域的研究,门下学生遍布全球机器人研究机构与行业巨头。图片来...

Daimon TWM Matthew Mason hand the 物理交互脑 换句话说 机器之心发布 The
2026-08-11 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 "The dexterity of a hand is mostly about the brain, not the hand." 这是 “全球机器人灵巧操作之父” Matthew Mason 写在个人主页上的一句话: 灵巧操作在 于脑 ,而不在手。 Matthew Mason 为卡内基梅隆大学教授,他开创了研究机器人操作领域的研究,门下学生遍布全球机器人研究机构与行业巨头。图片来源:www.ri.cmu.edu 这句话正好解释了今天具身智能的关键问题:机器人正在拥有越来越复杂的手,但当机器人真正进入现实世界, 这双灵巧手却并不等于真正的灵巧操作 。 问题或许从来都不只在 “手” 上。 具身真正缺乏的,是一个懂物理、懂交互、能够驱动这双手的 “脑” 。 8 月 10 日,戴盟机器人正式发布 全球首个触觉锚定世界模型 Daimon-TWM (Tactile-grounded World Model),以原生触觉贯穿物理认知、推演决策和瞬时反应全阶段。这个 “ 物理交互脑 ” 不仅能理解正在发生的物理接触,还能预测下一步交互会发生什么,并根据瞬息万变的反馈及时修正动作。 Daimon-TWM demo 演示 在多类高难度的接触密集型任务中,Daimon-TWM 平均成功率达到 64.0%,位姿调整类别任务成功率稳定在 80% 以上;在扰动环境中,Daimon-TWM 的操作成功率更是高出 π0.5 十倍。换句话说,这个新模型不仅把标准动作做得漂亮,而且 当现实世界开始 “不按剧本运行” 时,它更能随机应变 。 模型惊艳能力的背后,是一支全球顶配触觉研究军团 —— 戴盟机器人。 这家成立于 2023 年的具身智能公司,以让机器人具备在真实世界中的灵巧操作能力为终极目标。创始人兼首席科学家 王煜 正是机器人灵巧操作之父 Matthew Mason 的首位博士生,深耕机器人操作领域 40 年,同时也是香港科技大学机器人研究院创院院长。另一位创始人兼 CEO 段江哗 则是王煜的学生,从十年前已经深入机器人操作研究。 如何做出一个能够驱动灵巧操作的模型?他们给出的答案是: 让触觉真正成为这个 “物理交互脑” 的入口 。 Daimon-TWM 技术与架构介绍 都知道触觉重要, 为什么机器人还是 “摸” 不懂? 触觉是机器人操作能力的关键 —— 这在今年已经成为行业共识。例如不久前李飞飞署名的论文 T-Rex,证明了触觉可以提高机器人的操作能力。 这里的逻辑其实不难理解。拿起一个纸杯时,眼睛可以告诉我们杯子在哪里、是什么形状,却无法直接告诉我们该用多大的力。 视觉负责看见世界,触觉才负责与世界进行交互 :杯壁是否发生形变,杯子有没有滑动,手指施加的力量是否足够,继续用力会不会把杯子捏扁…… 任何与物理世界的真实交互,最后一厘米都要交给触觉。 那为什么触觉仍未大规模应用到具身模型?因为 “手感” 是出了名的说不清。 当我们描述拿起一个杯子的手感时,需要 涉及软硬、摩擦、形变、滑移等多个维度 。拿软硬来说,“软” 和 “硬” 只是两个极端, 真实世界更多是 “很软”“偏软”“较硬” 这种连续的程度区分 —— 这种细微差异难以用语言描述,照片也拍不出来,却直接决定操作的成功率。 视觉相似的物品,模型必须学会通过触觉判别其物理属性 因此,戴盟首先解决的并不是 “让机器人怎么动”,而是 让机器人真正读懂触觉 。 Daimon-TWM 学习了覆盖上万种物体、跨不同材质的 1000 多万组物理交互数据,将原始触觉中的受力、形变、摩擦等复杂变化转化为模型可理解的统一物理语义。 更重要的是,它不满足于让模型 “猜答案”,而是训练模型 依据触觉完成 “感知 — 比较 — 结论” 的推理过程 。这种能力在视觉与触觉发生冲突时尤其重要 —— 视觉可能把橡胶判定为塑料、可能把带图案的光滑表面判定为粗糙纹理,只有真正懂触觉的模型,才能准确判断物理属性与物理状态,从而规划下一步的操作。 Daimon-TWM 能够根据触觉推理物体的物理属性(滑动查看更多) 换句话说, 机器人获得的不再只是简单的触觉模态输入,而是一套关于物理世界的常识 。效果直接反映在成绩单上:Daimon-TWM 在物理认知九项核心指标全部第一,综合得分达到 60.1 分,不仅领先触觉专用模型 SToLa 12.6 分,更领先 GPT-4o 24.7 分。 Daimon-TWM 在物理认知多项核心指标上均取得最优成绩 这也揭示了一个容易被忽视的问题:通用大模型读过海量文字、看过无数图片,却从未真正 “摸” 过一个物体 —— 但 真实的物理智能,最终还要从一次次接触中生长出来 。 从预测下一帧画面,到预测下一刻交互 如果说物理常识是地基,那 Daimon-TWM 真正的杀手锏,是 预测 。 在李飞飞的 T-Rex 中,触觉可以在接触发生后帮助模型及时纠偏。然而, 现实世界的物理交互没有 Ctrl+Z ,齿轮怼歪了、杯壁捏裂了,就再也回不去了。真正灵巧的机器人不能等错误发生之后再纠正,而是 应该在交互的动态过程中提前看到风险,通过预测进行最优规划 。 这正是 Daimon-TWM 更进一步的地方。当全行业都在用世界模型预测下一帧画面时, 戴盟把世界模型的能力迁移到了触觉 :交互还未发生,模型已经提早一步推演出未来的动态变化。 双齿轮装配任务中,预测触觉信号(上)与实测触觉信号(下)高度相似;图片来源:参考技术报告 [2] 通过统一触觉表征、触觉思维链(T-CoT)以及由粗到细的未来触觉预测机制, Daimon-TWM 能够围绕接触阶段、接触状态和潜在失败风险进行推演 。更精妙的是,Daimon-TWM 并不是让机器人永远盯着触觉,而是 当机器人真正碰到物体、接触变得密集时才调整各表征的权重 ,让触觉成为判断下一步动作的关键证据。 在结果对比里,模型预测的触觉变化与实际测量值几乎完全重合。凭借 “未卜先知” 的能力,Daimon-TWM 完成了 双齿轮装配 这一高难度任务 —— 不仅要依次插上两个大小不同的齿轮,还要让齿牙严丝合缝地咬合。对纯视觉模型来说,这几乎是不可能完成的任务。 想得更远,也要反应够快 现实中的物理交互可能会遇到各种扰动,变化往往发生得非常快,模型除了预判能力,还必须 能在瞬间接收反馈,及时调整动作 。 为此,Daimon-TWM 采用了 “ 慢规划、快纠偏 ” 的分层机制:上层负责理解任务,并预判给出整体策略;底层的触觉 - 动作控制器则以 100Hz 高频伺服,根据实时触觉反馈对动作进行毫秒级修正。 Daimon-TWM 模型架构图 三大模块协同互作, 形成了从指尖感知到大脑推理,再返回脊髓控制的 “触觉神经系统” ,由此形成完整闭环: 理解当前接触 → 预测未来变化 → 规划下一步动作 → 实时感知结果 → 高频修正动作。 戴盟公布的消融实验证明了这是一套系统性优势,去掉任何一项都会导致成功率下滑。随模型发布的接触密集型操作 demo,更把这套能力翻译成了肉眼可见的画面。 消融实验:以 USB 插拔成功率验证 Daimon-TWM 的系统性优势 比如 USB 插入 时,视觉负责寻找大致位置,但真正插入时,必须依靠触觉判断是否对齐。如
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱