首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

五大高校联手发榜!首份机器人三视角世界模型评测结果出炉,榜单持续更新中

摘要

五大高校联手发榜!首份机器人三视角世界模型评测结果出炉,榜单持续更新中 允中 2026-08-11 08:46:23 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 近日,由北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起的 TriWorldBench Challenge ,正式公布首周榜单更新结果。 作为首个面向机器人三视角世界模型的评测榜单,T...

view wrist TriWorldBench 视觉生成 量子位 世界理解 生成视频 理解世界 head left
2026-08-11 1 阅读 约9分钟阅读 允中
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 五大高校联手发榜!首份机器人三视角世界模型评测结果出炉,榜单持续更新中 允中 2026-08-11 08:46:23 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 近日,由北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起的 TriWorldBench Challenge ,正式公布首周榜单更新结果。 作为首个面向机器人三视角世界模型的评测榜单,TriWorldBench旨在建立更加全面的具身世界模型评价体系,推动世界模型从“视觉生成”迈向“世界理解”。 榜单综合评估模型在三视角一致性、任务执行、物理空间理解等方面表现,面向全球相关研究团队开放参与,目前已收录多个公开评测结果,后续将持续更新评测结果。 (榜单地址:https://www.triworldbench.com/#leaderboard) 第一周的比赛中,来自CASIA-DRL的WoVR_Plus模型、来自TONGJI Spatial Intelligence Team的BetaBWM模型、以及来自Fysics AI的Fysiverse-Video模型占据了榜单的前三席。 从“生成视频”到“理解世界”,具身世界模型的新评价标准得到参赛者认可 TriWorldBench自发布以来,网页总访问量已 破万 ,测评工具下载量超200,网页日访问量逾千;短短一周时间已经有14个正式参赛队伍。 这表明,三视角世界模型的竞争焦点已从单一视图的视觉保真度,转向多视角(head view、left-wrist view、right-wrist view)间的时空一致性与物理逻辑自洽性。 当前排名差异主要源于模型在多视角几何对齐、任务执行准确性及物理动态理解等维度的表现,而非单帧图像的感知质量。 TriWorldBench旨在建立一套系统化评估框架,对上述多维能力差距进行精确量化与可解释性分析,从而推动世界模型从“视觉生成”向“具身认知”范式演进。 如何判断一个世界模型,是否真正理解了机器人所处的世界? 该榜单聚焦机器人操作场景中的 head view(头部视角)、left-wrist view(左腕视角)、right-wrist view(右腕视角) 多视角视频生成与理解能力,希望建立更加全面的世界模型评价标准,推动具身世界模型从“视觉生成”迈向“世界理解”。 从“生成视频”到“理解世界”:具身世界模型新的评价标准 过去,视频生成模型的评价更多关注: 但对于具身世界模型而言,仅仅生成一段“看起来真实”的视频远远不够。 机器人需要面对的是一个动态、连续、具有物理规律的世界。 在真实机器人系统中,一个任务通常由多个摄像头共同观察: 头部摄像头负责提供整体环境信息,帮助机器人理解任务状态; 腕部摄像头贴近操作区域,可以捕捉抓取、接触等细节。 不同视角之间并不是简单的信息重复,而是共同构成机器人对世界的完整认知。 因此,一个真正可靠的具身世界模型,不仅需要生成单个视角下合理的视频,还需要保证: 多个摄像头看到的是同一个世界。 这也成为当前世界模型评测体系中亟待解决的新问题。 TriWorldBench:面向具身世界模型的三视角评测体系 针对多视角一致性这一核心挑战,TriWorldBench Challenge提出了一套面向机器人操作场景的综合评测体系。 相比传统单视角视频评价方式,TriWorldBench更加关注模型是否具备真实世界理解能力。 多视角一致性:三个摄像头是否描述同一个世界? TriWorldBench首先关注三路视角之间能否相互对应。 模型生成的头部、左腕和右腕视频,不仅要各自合理,还需要保证: 换句话说,三路视频不能只是分别“看起来合理”,还需要共同描述一次完整、连贯的机器人操作过程。 任务执行能力:机器人是否真的完成了任务? 对于机器人而言,视频生成不是最终目标,完成任务才是核心。 TriWorldBench进一步评估模型对于机器人操作过程的理解能力,包括: 其中,头部视角主要用于判断任务指令、机械臂轨迹和最终结果;腕部视角则进一步检查抓取是否稳定、是否发生滑移,以及夹爪与物体之间的局部交互是否正常。 这意味着,画面看起来足够清晰、流畅,并不代表机器人真正完成了任务。 TriWorldBench希望让世界模型评价从“看起来像”进一步走向“真正可用”。 物理世界理解:模型是否真正理解三维空间? 机器人面对的是三维物理世界。 因此,世界模型不仅需要生成视觉内容,还需要理解: TriWorldBench希望通过多视角评测,进一步探索世界模型对于真实环境的理解能力。 不只是排名:TriWorldBench更希望成为帮助研究团队优化模型的诊断工具 对一个榜单来说,排出名次只是第一步。 更重要的是,它能否解释模型为什么得分高或低,并把清晰的改进方向反馈给研究者。 TriWorldBench因此没有把三路视频压成一个简单平均分,而是建立了从同步数据、动作状态到多层结果的完整评测链路。 从数据到指标:TriWorldBench如何全面评估模型能力 基准包含500个三视角同步episode,覆盖50个机器人操作任务。 系统围绕三视角一致性、任务对齐、物理与3D一致性、运动质量、时序一致性和视觉质量六个维度,汇总19项评测信号,并以TWB-Score作为榜单总分。 三个视角如何共同判断机器人任务状态 三视角一致性被放在整个体系的中央。 每个生成视角先与对应的真值相机进行对照,再通过head-wrist语义判断和联合三视角问答,检查机械臂状态、动作阶段、接触关系以及目标物体是否相互兼容。评测并不要求视角差异巨大的头部画面与腕部画面在像素上相同,而是判断它们能否共同解释同一次操作。 与此同时,指标会被分配到证据最可靠的相机。头部视角更适合判断任务指令、全局进度、机械臂轨迹和最终结果; 腕部视角更适合观察接触、抓取稳定性、滑移和局部几何。 这样既不会让腕部遮挡影响全局任务判断,也不会让清晰的头部画面掩盖夹爪附近的失败。 STATE让评测知道何时该动、何时该稳 TriWorldBench从参考机器人轨迹中构建STATE标注,识别当前动作阶段、活动机械臂,以及每个视角预期处于运动还是静止。 该动的腕部如果长时间冻结会被扣分,不该动的相机出现多余运动同样会被识别。 由此,稳定不再等同于“全程不动”,运动丰富也不再天然代表模型理解了任务。 总分用于排名,细粒度结果用于诊断 画质和美学分数也不会脱离任务单独决定胜负。 当头部轨迹错误,或三路视频在机器人和物体状态上发生冲突时,系统会对视觉质量进行任务约束后的修正,避免一段精致但错误的视频凭借“好看”获得不合理优势。 在VLM语义评测中,评测协议还会先与人类专家的打分和排序进行对齐,再冻结规则用于正式测试。 榜单除了报告TWB-Score,还保留六大维度、单项指标、逐视角、head-wrist配对和联合三视角结果。 研究团队因此不仅能看到排名,
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱