智能AI
morning
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
摘要
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜 Jay 2026-08-25 10:22:01 来源: 量子位 Jay 发自 凹非寺 量子位 | 公众号 QbitAI 一觉醒来,机器人大脑的SOTA,易主了。 这次,原力灵机的DM0.5, 登顶了具身「珠峰」——RoboDojo 。 要知道,这可是RoboDojo啊。。。 魔鬼级的具身评测,由香港大学多媒体实验室联合...
DM0
Jay
量子位
说实话
具身大满贯还全开源
原力灵机DM0
5登顶RoboDojo
且clone且珍惜
2026
凹非寺
2026-08-25
1 阅读
约9分钟阅读
Jay
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜 Jay 2026-08-25 10:22:01 来源: 量子位 Jay 发自 凹非寺 量子位 | 公众号 QbitAI 一觉醒来,机器人大脑的SOTA,易主了。 这次,原力灵机的DM0.5, 登顶了具身「珠峰」——RoboDojo 。 要知道,这可是RoboDojo啊。。。 魔鬼级的具身评测,由香港大学多媒体实验室联合加州大学伯克利分校、清华大学等 全球近20所顶尖学术机构共同发起 。 这些顶尖学府的「品控」有多严格? 这么说吧,截至2026年7月, 仿真榜单头部模型平均成功率仅8.80% ,真机榜单仅12.8%。 是的,仍在个位数挣扎。 反正就是难度和真实性极高,专治实验室闭门造车的偏科生。 如今,DM0.5拿下了第一—— 此外,仔细看了下表格,发现这个模型有个极其突出的强项—— 记忆。 具体可以看这个Cover Blocks任务: 机器人先从左到右盖住随机排列的红、绿、蓝三个积木。当颜色被完全遮挡后,再根据此前观测,按红、绿、蓝的顺序依次揭开。 DM0.5在 三次随机考试中,都取得了100%成功率。 反映在数据上也很直观,RoboDojo榜单中的 Memory维度,DM0.5直接猛砍了47.74分 ,显著领先。。。 绝对是助力其登顶,最关键的绝杀了。 这还没完。 其他权威评测,DM0.5也都打爆了。 LIBERO: 综合成功率99.0% RoboTwin 2.0: 简单和复杂场景下成功率分别达到 93.6% 和 93.3%, VLA-Arena: 不同难度设置下的成功率分别达到 89.0%、53.6%、44.1%。 RoboChallenge Table30 v2: 综合得分54.42,成功率43%。 而这个SOTA级别的大脑—— 早已开源。 一个基模,六类场景全通过 榜单数字终究是抽象的。DM0.5的真实能力到底如何,还得看demo。 而原力灵机,大概是当前场景demo最丰富的基础模型厂商。 抗干扰、拼积木、学黄瓜、分拣快递……给我看的眼花缭乱。 但回过头来仔细一样,这些看似分散的demo,其实指向同一件事: 基模的泛化能力。 我们一个个说。 1、 人类示教。 这是我觉得最有意思的demo。 DM0.5化身卡卡西, 人类示教一次,它便能光速复制粘贴。 说实话,这项技能点其实并不陌生,大家都在做这个方向。 毕竟物理世界场景稀碎,你模型做得再好,总有泛化性覆盖不到的长尾任务,这类场景下鲁棒性会骤降特别多。 这就永远到不了具身的ChatGPT时刻。 目前业内的共识解法是:不追求预训练解决一切,而是在落地环节引入Human-in-the-Loop。让人类工作者拍摄一段示范视频,机器人便能像开了「写轮眼」一样即时对齐并跟随完成复杂任务。 让教机器人,变得像教徒弟。 原力灵机做的便是这件事。 而开头提到的「记忆」,则是解法的关键。 DM0.5原生支持 最长60秒的记忆能力 ,机器人能深度记住并连贯审视自己此前做过的所有动作序列。 基于这份长记忆,模型可以直接跨越语言限制, 理解人类演示的视频片段 。 2、 精细操作。 原力灵机选择的场景,是积木。 其实今年7月我在上海WAIC看过这个demo,说实话,比视频里的精彩得多。 原力灵机联手阶跃,搁展区里拼了个长城。。。 是的, 6台机器人,耗时15小时 ,用 81920块微型积木 拼出 长3.5米的长城模型 。 现场也是挤爆了,钻都钻不进去。 但这绝对不是个「情绪价值」demo。 积木拼装,最小的组件宽度不到1厘米,机器人必须在 0.1到1毫米的尺度内完成抓取和扣合 。这个精度,已经超越了人手约0.3到1毫米的自然抖动极限。 与此同时,微型积木存在工艺公差,直接大力出奇迹的话,极易错位卡死。 所以如果仔细看视频,你会发现个蛮有意思的细节。 这哥们会寸劲儿啊! 机器人会先对准,再轻轻一震、抖动下压,把积木扣住。 当然, 自动纠错的能力也很关键 。 毕竟是模型嘛,高精度任务确实没法追求把把zero-shot,还是得靠Loop保证稳定性。 柔性物体则更需要自动纠错 了。 比如这个削黄瓜的demo,一刀下去,黄瓜形态会变。模型需要实时闭环调整。 刀深几分、力道几何,如何削得干净又不伤果肉……全在毫厘之间的拿捏。 你以为黄瓜到这就完成它的使命了? 不,原力灵机还在继续鞭打黄瓜(bushi)。 但这次侧重点有所不同,是用灵巧手切。 模型通过后训练驾驭高自由度,也是对DM0.5泛化性的展示吧。 3、 长程稳定高节拍。 从这开始,demo就和场景紧密结合起来了。 今年北京亦庄的WRC,原力灵机将快递流水线搬到了现场,直击物流中转站最大痛点—— 单件分离。 传送带不停,每个包裹的尺寸、材质、摆放姿态都不一样,传统机械方案根本干不了这类任务。 DM0.5不依赖预设脚本,纯靠实时视觉识别和决策, 平均3秒一单,准确率超99%。 上周我也是在现场近距离看过这个demo的。 说实话,论论情绪价值,我个人觉得还得是工业场景,超解压啊,跟看清洁直播一样。 至少是能看得下去的,不会慢的要死,捡个枕头都一卡一卡的。。。 ADHD患者强推打卡(bushi)。 4、 抗干扰。 真实世界不是实验室,相机随时可能骤变视角,人类随时可能「空降」捣乱。 DM0.5的解法是 分层双系统 ,即业界主流的 System1与System2架构 。 Sys2是深思熟虑的高阶大脑。负责理解、拒绝与大局预判,剑指zero-shot; Sys1则是动作专家网络。就像人类的直觉反射,负责handle长程复杂任务中的琐碎细节。 在这套架构加持下,即便外部视点剧烈变化,DM0.5 通用Picking的鲁棒性依然极强 。 哪怕人类强行打断任务,机器人也能准确理解当前实际状态,自适应修正后续动作。 六类场景,从毫米级到传送带,从刚性到柔性,从执行到模仿。 同一个模型在如此差别很大的场景中都表现优秀,是很少见的。 现在大家都冲百万小时数据,但光看数据量,或许并不符合第一性原理。 如果 基模没有强泛化 ,每个场景都单独训一个模型,demo再多,也不过是一堆散落的珍珠。 偏科是没法的Scaling Up的。 这也是我觉得DM0.5最有意思的Takeaway吧,具身模型本身的能力正在被看见,并且上限可以做到很高。 数据、架构、效率全面升级 说了这么多,原力灵机究竟是怎么做到的? 这方面,团队也早把他们的经验,毫无保留地全盘托出了。 答案分为三层,也是具身绕不开的 三个核心变量:数据、架构、延迟。 先看数据。 数据决定智能上限 ,这也是整套具身工程中,最重要的一环,没有之一。 DM0.5的数据资产,主要分为三类。 1、真机: 5万小时高精度操作 ,覆盖100+种丰富动作,实现秒级精细指令动作对齐。 2、Ego: 10万小时场景视频 ,支持毫米级高精度3D Landmark生成,实现精准标注。 3、仿真: 100万平空间数据建
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱