首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

具身智能规模化落地,大概率从这样的模型开始

摘要

机器之心发布 具身智能行业正在经历一次评价标准的切换:过去几个月,Demo、融资、单点落地案例最能吸引眼球;但当行业进入深水区,真正决定一家公司能否穿越周期的,从来不是某一次展示够不够惊艳,而是能力能否被 复制、部署、持续优化 — 也就是有没有一个开发者可以长期依赖的基础模型底座。 原力灵机发布的具身基础模型 DM0.5 ,正是对这个命题的回答。它不是为某一次演示准备的模型,而是一个面向未来规模化...

DM0 原力灵机 shot 100 机器之心发布 具身智能行业正在经历一次评价标准的切换 过去几个月 Demo 单点落地案例最能吸引眼球 但当行业进入深水区
2026-08-07 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 具身智能行业正在经历一次评价标准的切换:过去几个月,Demo、融资、单点落地案例最能吸引眼球;但当行业进入深水区,真正决定一家公司能否穿越周期的,从来不是某一次展示够不够惊艳,而是能力能否被 复制、部署、持续优化 — 也就是有没有一个开发者可以长期依赖的基础模型底座。 原力灵机发布的具身基础模型 DM0.5 ,正是对这个命题的回答。它不是为某一次演示准备的模型,而是一个面向未来规模化落地的能力底座:不追求 “做出更好看的 demo”,而是要把具身基础模型从少数团队的研究资产,变成开发者真正用得起、用得上的基础设施。 一句话概括: DM0.5 用可复现的训练部署门槛、贯穿仿真与真机的全科成绩、以及数量级的推理加速,第一次把 “规模化进入场景” 从口号变成了可验证的能力。 DM0.5 全科优秀,开源、可复现 原力灵机 DM0.5 首先解决的是 “能不能用” 的问题:它支持在一张 4090 消费级显卡上完成微调训练,最快 18 小时即可完成一个下游任务的部署,微调成本下降 60%。具身模型正在从 “可展示” 走向 “可开发”,更多开发者因此有机会真正参与到模型能力的验证和扩展中 —— 这是 DM0.5 的第一层意义。 第二层意义则在于榜单表现和全科能力上的系统优势。当前具身智能行业一个常见现象是:很多模型会在某一项任务、某个 benchmark 或某种机器人平台上表现突出,但一旦切换到不同任务形态、本体结构和评测设定,优势就很难延续。DM0.5 展现出的恰恰是较为少见的 “全科型” 能力结构,且这种优势并不局限于仿真环境,而是贯穿真机与仿真、操作与导航、多任务与多本体。 在公开 Benchmark 侧,DM0.5 同样展现出较强的全科优势:LIBERO 综合评测达到 99.0%,并刷新 RoboTwin 2.0、R2R 和 RxR 等多项公开评测成绩。这里更值得强调的不是 “拿到更好的分数”,而是这些评测本身覆盖了桌面操作、长程任务、导航理解等不同能力维度 —— DM0.5 并非只在某一子项上做强,而是在多个核心维度上同时建立优势,这种 “榜单全科优势” 对基础模型而言尤为关键。 在面向真实工业与生活场景的 RoboChallenge Table30 V2 真机评测中,DM0.5 以 43% 的成功率和 54.42 的总得分位列榜单第一。该评测覆盖 ARX5、UR5、ALOHA 和 Dexmal-Mirror 四种机器人平台,包含单臂与双臂形态,任务涉及目标定位、精细抓取、多步操作、工具交互与双臂协同等复杂场景。能在这样的真机评测中拿到第一,说明 DM0.5 的优势并非只停留在实验室条件下,而是已经具备一定的跨平台、跨任务和跨执行形式泛化能力。 从代际提升来看,相比 DM0,DM0.5 的 Zero-shot 成功率提升 31%,Few-shot 提升 45%,Fine-tuning 提升 20%。这说明它的进步并不局限于某一条能力路径,而是同时覆盖了 “直接泛化”“少样本适配” 和 “下游微调部署” 三种不同使用方式。对于真实场景而言,这种全面提升比单一指标更有意义,因为真实机器人系统几乎不会只考察一种能力。 DM0.5 在复杂、精细、长程任务方面的表现 数据与架构双轮驱动,具身原生夯实模型底座 支撑这套能力的,是具身原生理念下更大规模的数据和更贴近真实世界需求的模型设计。 原力灵机 DM0.5 采用 4B 参数规模,基于 15 万小时多源高质量数据训练,数据量相比上一代模型提升 400%,参数量提升 100%。数据来源包括 5 万小时高精度真机操作数据、10 万小时 Egocentric 场景视频,以及覆盖 100 万平方米空间的场景重建数据:前者提供真实操作经验,后者帮助模型学习更丰富的空间关系、物理变化和环境先验,再结合高精度场景重建,进一步缩小 Sim2Real 间隙。 在架构上,DM0.5 引入了上下文抽象层、具身思维链任务和轨迹对齐层。上下文抽象层让模型原生支持最长 60s 的时序记忆,不再局限于 “走一步看一步”;具身思维链任务让模型不仅生成动作,还对 “指令、本体、环境” 进行联合建模,提升任务规划和状态理解能力;轨迹对齐层则把动作学习从简单的逐点监督升级为更稳定的轨迹对齐,增强复杂动作学习中的一致性与鲁棒性。对具身模型而言,这些能力决定的不是某次演示是否漂亮,而是模型能否在开放世界中长期、稳定、可靠地运行。 DM0.5 在相机干扰下的优秀表现 系统化推理加速,让模型真正可用 对于真实机器人系统而言,速度从来不只是工程优化指标,更直接关系到模型能否进入连续作业、实时交互和高频任务场景。 原力灵机 DM0.5 单卡推理延迟从 534.04ms 降至 57.49ms,实现 9.29x 加速,API 延迟 p50 为 67.75ms、p90 为 70.01ms。这意味着具身模型从 500ms 级执行进入 60ms 级推理、70ms 内在线响应。 这套加速不是停留在优化某个 kernel,而是让整套 VLA 推理系统快了一个数量级:联合优化 Vision TensorRT、Tuned FlexAttention、FP8 E4M3 Tensor Core Prefix MLP、Triton Suffix 融合算子,以及启动期 CUDA Graph,将在线执行压缩为 “静态数据搬运 + 一次 graph replay”,不再需要请求时反复 capture。 DM0.5 模型全面开源 原力灵机 DM0.5 全面开源开放,已经在 GitHub、Hugging Face 等生态入口,并逐步释放模型、文档和实践参考,降低开发者上手门槛。同时也已经向 LeRobot 社区贡献核心代码,更多模型权重、跨平台部署案例和应用实践将陆续开放。 GitHub:https://github.com/dexmal/opendm https://github.com/dexmal/opendm/blob/main/README.zh-CN.md HuggingFace:https://huggingface.co/collections/Dexmal/dm05 基于 DM0.5 的最新 Demo—SO101 抓取方块任务监督微调(SFT),展示了 DM0.5 强大的 Few-shot 与 Fine-tuning 能力。模型能够快速适配 SO101,并同步开源相关模型、数据集及完整 LoRA SFT 训练工作流,为开发者提供可复现、可扩展的实践参考。 视频: 规模化不会从 demo 里自然长出来。尤其在当前阶段,行业更需要的不是继续堆叠单点展示,而是先把基础模型、开发门槛、推理效率和跨场景泛化能力做扎实。DM0.5 的意义也正在这里:它不是在宣称具身智能已经完成规模化落地,而是在用一套更完整的模型能力、更强的榜单表现和更友好的开发者路径,为 “规模化进入场景” 提前铺底。 从这个意义上说,DM0.5 的发布不只是一次模型更新,更像是一次行业路线的明确表达:具身智能要真正走出 demo 时刻,第一步不是做更多单点展示,而是先做出一个开发者愿意用、能够用、用得起,也确实在真机和公开榜单上展现全科优势的基础
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱