智能AI
morning
WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线
摘要
WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线 量子位的朋友们 2026-08-25 09:46:56 来源: 量子位 8 月 19 日下午,世界机器人大会分论坛“具身智能大模型的进化之路:从技术分级到产业落地”在北人亦创国际会展中心举行。生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军发表主旨演讲,发布团队最新研究成果,并系统阐述通用世界模型的...
2026
World
架构与算力
Vidu
WRC
生数科技发布最新研究成果
提出通用世界模型五级发展路线
量子位的朋友们
量子位
日下午
2026-08-25
1 阅读
约9分钟阅读
量子位的朋友们
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> WRC 2026|生数科技发布最新研究成果,提出通用世界模型五级发展路线 量子位的朋友们 2026-08-25 09:46:56 来源: 量子位 8 月 19 日下午,世界机器人大会分论坛“具身智能大模型的进化之路:从技术分级到产业落地”在北人亦创国际会展中心举行。生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军发表主旨演讲,发布团队最新研究成果,并系统阐述通用世界模型的五级发展路线。 朱军表示:“从大模型发展的视角来看,我们希望构建的,不只是服务于某个任务或场景的专用模型,而是一个能够理解世界、预测未来并采取行动的通用基座模型。” 从第一性原理出发,定义通用世界模型 世界模型已经延伸到视频生成、环境模拟、机器人决策和动作控制等方向,但行业对“什么样的世界模型才称得上通用”仍缺少共识。 人在学习骑自行车或开车时,会从最初的不协调逐渐变得稳定、准确。其重要原因,是大脑在与外部世界持续互动的过程中,形成了一个关于世界如何运行的“内部模型”。 通用世界模型同样需要三项彼此关联的能力: 理解世界 :看懂环境,判断当前状态; 预测未来 :预测接下来可能发生什么,以及不同动作会带来怎样的结果; 采取行动 :影响数字或物理环境,并利用真实反馈修正理解和预测。 “通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统。” 朱军强调,行动不仅是模型的输出,还会改变环境、产生新信息,并进入下一轮理解、预测和决策。 数据、架构与算力:构建通用世界模型的三大要素 要想构建通用世界模型,仍然离不开大模型的三个基本要素: 数据、架构与算力。 在数据方面, 通用世界模型需要一个由观察逐步走向行动的多层数据金字塔 :从海量网络视频开始,逐步扩展到特定领域视频、第一视角人类视频、带动作记录的人类示范,以及真实机器人交互数据。 越靠近底层,数据规模越大、覆盖面越广;越靠近顶层,数据虽然更稀缺、成本更高,却能更直接地建立任务、动作与物理结果之间的联系。合成数据可以贯穿金字塔的每一层。同时,“不完美数据”同样具有重要价值:失败尝试、纠正动作和恢复过程都包含有效的学习信号,能够帮助机器人学习如何从失败中恢复。 在架构层面,通用世界模型需要统一处理图像、视频、语言和机器人动作等不同模态信息。MoT(Mixture-of-Transformers)通过为不同模态配置专属参数,并以共享注意力实现跨模态信息交互,使环境理解、世界状态预测与动作生成能够在同一模型中协同完成。生数科技的世界动作模型 Motubrain 正是基于这一架构,将理解、预测与行动统一建模,打破传统分模块方案的能力割裂,同时提升异构数据的利用效率和跨任务迁移能力。 算力则同时影响大规模预训练和实时部署。离线视频生成可以容忍一定等待时间,但实时交互和机器人控制必须在环境发生变化之前完成预测和决策。因此,训练基础设施、推理加速、模型蒸馏和高效注意力机制,都是通用世界模型走向实际应用的重要支撑。 通用世界模型如何进化?五级路线图明确进阶方向 从通用基座模型的目标出发,通用世界模型可以划分为五个逐级演进的层级。它们并不是彼此割裂的产品方向,而是随着对世界的理解不断加深、与世界的交互不断增强,模型自主性持续提升的过程。 过去几年,生数科技的研发与落地实践已经覆盖其中前三个层级。 L1:世界生成(World Generation) 第一步,是让模型学会生成连贯的世界演化过程。视频正是这一阶段最典型的载体,它帮助模型学习对象、运动、空间关系和时序变化,为进一步理解和预测世界奠定基础。 2024 年,生数科技推出视频生成大模型 Vidu ,通过持续提升视频质量、时序一致性和世界动态建模能力,完成了 L1 阶段的初步实践 。 L2:与世界交互(Interactive World) 在生成能力之上,模型开始接收实时输入,并根据语言、语音或控制信号持续改变后续内容,从“一次生成”走向“持续互动”。 2026 年 7 月发布的 Vidu S1 将这一能力推进到实时交互阶段。用户可以通过语音实时介入生成过程,持续影响接下来发生的内容,让模型能够根据外部输入动态演化世界。 L3:在世界中行动(Actionable World) 再往前一步,模型开始从数字世界进入物理世界。此时,环境理解、未来预测和动作生成需要真正统一起来,让模型不仅能判断世界发生了什么,还能直接生成机器人可执行的动作,并根据真实反馈持续修正。 Motus 和 Motubrain 标志着生数科技从视频生成进一步走向物理行动。 Motus 于 2025 年 12 月发布并全面开源 ; 2026 年 4 月发布的 Motubrain ,则进一步将环境理解、世界状态预测和动作轨迹生成统一到同一个模型中,推动通用世界模型从“视觉推演”迈向“物理决策”。 相较 Motus, Motubrain 的推理速度提升约 10 倍 ,适配新的机器人本体时, 仅需 50 至 100 条人类示范数据 。在 RoboTwin 2.0 基准测试中,其成绩 达到 96.1 分,位居榜首 。目前,Motubrain 已在包括银河通用、星尘智能、千寻智能等近十种本体上完成验证,展现出在 长程任务、多任务场景和不同机器人形态 之间的泛化能力。 L4:自主世界智能体(Autonomous World Agent) 具备真实行动能力之后,模型还需要进一步走向自主决策,能够围绕长期目标主动感知环境、拆解任务、探索未知状态并持续规划行动。 L5:世界组织者(World Orchestrator) 在更高层级上,模型不再只控制单个智能体,而是能够统筹机器人、数字智能体、人类、工具及其他资源,完成更复杂的任务分配与多智能体协作。 从 L1 到 L5,能力层层递进。没有对世界演化规律的学习和预测,就难以形成稳定、连续的交互;没有真实行动带来的环境反馈,也很难进一步发展出自主学习、长期规划和复杂协同能力。 面向 L4、L5,还需突破六项关键挑战 目前,L1 至 L3 已经形成较为具体的技术实践,但距离更高阶的世界智能仍有差距。视频模型仍需持续提升生成质量、可控性与时空一致性;世界动作模型则需要在更复杂、更开放的真实环境中,进一步提升稳定性、泛化能力与执行效率。 继续迈向 L4 和 L5,还需要突破六项关键挑战: 建立覆盖理解、预测、行动和迁移能力的联合评测体系; 学习接触、摩擦、作用力和干预后果等真实物理规律; 形成持久且可修订的记忆; 通过真实交互实现在线学习和自我进化; 完成满足现实延迟与资源约束的高效闭环部署; 进一步强化安全性与可控性。 围绕这一方向,生数科技将持续强化 世界生成、与世界交互、在世界中行动 三个层级,并进一步补齐目标形成、主动探索、持续学习和长期记忆等能力,为更高阶的自主世界智能体奠定基础。更长远的目标,是构建一个能够 持
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱