开发者生态
morning
人人都在造世界模型,HappyWorld‑Bench 试着给出一张统一考卷
摘要
你有没有看过一个视频,里面有一个机器人在表演,机械夹爪伸向桌面,夹住托盘,向上抬起,它动作流畅,画面逼真,看起来没什么问题。 但如果暂停视频,仔细看托盘底部:你会发现托盘根本没有离开桌面。夹爪抬起来了,托盘也跟着“移动”了,两者之间该有的物理结果并没有发生。模型完成了一段视频,却没有完成这个动作,这是一个视频,但不是现实。 这正是世界模型今天面临的尴尬。大家已经很会“生成”一个“看起来像世界”的东...
HappyWorld
Bench
看得爽
说了不算
你有没有看过一个视频
里面有一个机器人在表演
机械夹爪伸向桌面
夹住托盘
向上抬起
它动作流畅
2026-09-23
1 阅读
约10分钟阅读
于曦
字号:
你有没有看过一个视频,里面有一个机器人在表演,机械夹爪伸向桌面,夹住托盘,向上抬起,它动作流畅,画面逼真,看起来没什么问题。 但如果暂停视频,仔细看托盘底部:你会发现托盘根本没有离开桌面。夹爪抬起来了,托盘也跟着“移动”了,两者之间该有的物理结果并没有发生。模型完成了一段视频,却没有完成这个动作,这是一个视频,但不是现实。 这正是世界模型今天面临的尴尬。大家已经很会“生成”一个“看起来像世界”的东西,但假的真不了。汽车撞上障碍物,应该停下或者变形;杯子被放进抽屉,关上抽屉后它不能凭空消失;把一辆黑车改成红车,旁边的楼不该跟着换颜色。现实世界里,这些事情不需要解释,因为世界有因果,世界是物理的。 但在生成模型中,每一件都可能出错,每一件都可能是幻觉,但带给大家更大的幻觉是,现在大家都说自己在做世界模型。 Google DeepMind 的 Genie 3 在生成可探索的视频世界,World Labs 的 Marble 尝试重建三维空间,具身智能公司则希望机器人先在模型里“想象”动作后果,再决定下一步怎么做 。 一个像导演,一个像建筑师,还有一个像机器人教练。他们从不同角度构建世界模型,也共享着世界模型的概念 三类选手参加三种比赛,用三套规则,最后各自拿着成绩宣布领先。 世界模型行业有点像一所没有统考的学校:每个科目独立出题排名,但是否能被行业应用录取,最终需要综合成绩进行排名。 今年云栖大会上发布了 HappyWorld-Bench,它想把试卷统一起来。 急着造宇宙,托盘还没“抬”起来 HappyWorld-Bench 没有从“什么技术路线才算世界模型”开始争论,而是换了一个更实用的问法:一个模型,至少要会做什么,才说明它真的掌握了一部分世界规律? 表征,是记住这个世界里有什么。桌上有一个杯子,门后有一把椅子,刚才有人把钥匙放进了抽屉。视角变了、物体被挡住了,但这些东西也绝对不能从模型的“记忆”里消失,这是物理;预测,是知道动作会带来什么后果。推箱子和抬箱子不一样,向左转和向右转也不一样。模型不能只是让画面动起来,而要让变化与动作对应,这是因果;交互,则是在事情发生之后更新状态。门已经打开,后面的世界就要建立在“门是开的”这个事实上继续运行。不能下一秒又假装什么都没发生,这是现实。 你以为做起来很简单?并不。 HappyWorld-Bench 把世界模型的能力分成 W1 到 W6 六级。 W1 先考“看见”:语义别错,空间别乱,短时间内保持连贯;W2 开始考“动手”:智能体采取一个动作,物体和环境要给出合理反应;W3 考记性。一个东西被遮住了,换个视角再回来,它还应该在那里;走过的房间、移动过的物体、已经发生的事件,都必须要继续留在世界状态中;到了 W4,用户可以主动修改世界。让晴天变成雨天,让黑车变成红车,甚至改变某种行为规则。改动要生效,但不能影响无关内容;W5 更远。世界可以继续扩展,多个智能体生活在里面,互相通信、合作,也可能争抢资源;W6 则是目前最接近“终极大题”的一级:生成、仿真、交互和规划被放进同一个系统,模型能够跨环境、跨任务、跨模态运行。 简单说,就是:看得见,推得动,记得住,改得了,扩得开。最后,才谈得上一个通用世界。 不过,这次公布的 1692 个评测案例主要覆盖 W1 到 W5。W6 已经写进能力框架,但还没有真正被这套数据充分测量。它更像试卷最后那道暂时没人能完整作答的题。托盘,还是不一定能“抬”起来。 “看得爽”说了不算 给语言模型判卷,很多时候还能找到一个标准答案。给世界模型判卷,麻烦得多。一段视频是否“好看”,人很容易判断。但它是否遵守物理规律、保存了历史状态、正确响应了操作,“看得爽”说了不算。 所以,HappyWorld-Bench 保留了视频、空间重建和具身三条赛道,同时用相同的能力层级去描述它们。 每个测试案例都要经过构造输入、匹配能力等级、人工复核和编写判据几个步骤。重点在最后一步:不能只写“机器人成功抬起托盘”,而要继续说明,画面的哪个区域、哪个时间点,应该出现什么结果。 托盘离开桌面后,底部应该出现间隙。 这才是判据。 类似地,把黑车改成红车,不只是检查车身颜色。评测还要看道路、背景建筑和其他车辆有没有被误改。模型如果完成了命令,却顺手重建了半条街,也不能算成功。 目前,这套 Benchmark 设置了 29 个评测维度,涉及感知、状态保持、因果推演、可控交互和反事实等能力。它也没有强行把所有结果塞进一个总分。 一部分评测来自 HappyWorld-Arena 中的匿名。两两比较和 Elo 排名,回答“人更喜欢哪个”;另一部分来自针对具体能力的自动化指标,回答“模型究竟在哪一步出了错”。项目说明(Github 链接: https://github.com/LivingFutureLab/HappyWorldBench)也特意把总体偏好与能力分数分开。 " 因为好看和可靠,确实不是一回事。有些世界第一眼很惊艳,住进去可能处处穿帮。有些世界没那么华丽,但门能打开,路可以走,刚放下的东西不会消失。后者也许更有用。 排名出来了,但“第一名”没那么简单 HappyWorld-Bench 公布了三条赛道的结果。 现在,视频世界模型赛道中,HappyOyster 2.0 preview 整体领先,但 Genie 3 紧随其后,并在运动约束、镜像对应和开放交互等项目上表现突出。 重建赛道更像一场偏科生大赛。 GPT-6-Astra 擅长编辑和扩展,可以把黑车改成红车,把晴天变成雨雾,同时尽量不碰无关区域;Marble 的基础场景构建更稳定,桌面支撑、物体接触等细节处理得更好;HYWorld-2.0 则在物理连通性上领先,导航网格覆盖率达到 82.7%,Marble 为 53.6%。 假如只是想搭一个可以看的空间,答案可能是 Marble;如果智能体需要在里面走动,导航区域是否连通就更重要;如果需要频繁修改世界,又是另一个选择。 没有最强,只有特质。 具身赛道里,MiniMax-H3 取得领先,在单步操作、连续动作和成对反事实项目上表现较好。但即便如此,它在 W4 成对反事实任务上的得分也只有 88.62。 所谓成对反事实,是给模型相同的起点,只改变一个动作:一次向上抬,一次向左推。模 型需要生成两个不同结果,而且差异必须准确来自那个被改变的动作。 这比让物体动起来难得多。因为模型不能靠“生成一段合理运动”蒙混过关,它得知道为什么动,以及换一种动法之后会怎样,又回归了表征、预测、交互的链路。 世界模型没有真正的全能冠军。 有人擅长造景,有人擅长改景,有人记性比较好,也有人已经开始摸到因果关系。 有点哲学,也有点玄学。 既是出题人,也是考生 和 HappyWorld-Bench 一起发布的,还有 HappyOyster 2.0 preview。 传统视频生成更像点外卖:写下 Prompt,提交,等待,最后拿到一段成片。不好吃就重新点一次。 HappyOyster 老想把这个过程改成现场做菜, 生成已经开始,用户仍可以继续输入指令,人物可以换动作,物体可以被移动,场景也可以改变,世界不在第一次生成后结束,而是顺着新的操作继续发展。 模型得记住前面发生过什么;刚移动
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱