首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

让AI Agent「试玩」世界模型,长程目标评测有了新基准PlayWorld

摘要

本文第一作者为香港大学博士生丁凯欣。团队成员包括香港大学博士生陈汐、徐致远、汪逸阳、陆宇翔、李俊奕,香港中文大学蔡明宏,浙江大学陈书扬,以及快手可灵团队的高远、陶鑫和万鹏飞。通讯作者为香港大学助理教授赵恒爽。 世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。 例如,在虚拟世界中绕房子一周,回到原点后检查场景是否一致;走入水中,观察是否激起水花;或在不同房间之间来回穿梭,看看每次返回时,...

Agent PlayWorld Player https kxding github Evolution 本文第一作者为香港大学博士生丁凯欣 团队成员包括香港大学博士生陈汐 徐致远
2026-08-24 1 阅读 约9分钟阅读 机器之心
分享:
字号:
本文第一作者为香港大学博士生丁凯欣。团队成员包括香港大学博士生陈汐、徐致远、汪逸阳、陆宇翔、李俊奕,香港中文大学蔡明宏,浙江大学陈书扬,以及快手可灵团队的高远、陶鑫和万鹏飞。通讯作者为香港大学助理教授赵恒爽。 世界模型应该如何评测?答案是:像真实用户一样去 “玩” 它。 例如,在虚拟世界中绕房子一周,回到原点后检查场景是否一致;走入水中,观察是否激起水花;或在不同房间之间来回穿梭,看看每次返回时,客厅里画画的人是否取得了新的进展。然而,要完成这些 “长程操控目标”,不同模型所需的操作序列并不相同。 为此,来自香港大学、香港中文大学、浙江大学和 快手可灵团队的研究者使用 Agent Player 操作世界模型:只给定 “场景” 和 “长程目标”,由 Agent Player 在交互过程中观察生成视频的几何一致性、交互正确性和事物演化的合理性。他们对多个 SOTA 模型进行了系统评测与分析,并已开源评测集和代码。 论文标题: PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives 论文链接:https://arxiv.org/abs/2608.13552 项目主页:https://kxding.github.io/project/PlayWorld/ 测评集:https://huggingface.co/datasets/jocelynd/playworld-bench 开源代码:https://github.com/kxding/PlayWorld 为什么固定动作轨迹不够公平? 人类试玩世界模型时,通常不会关心 “是否严格执行了三次右转”,而会关心 “是否完成了绕场一周并回到原来的地标”。这两种评测思路看似接近,实则回答的是不同问题。以 “围绕中心雕塑转一圈” 为例,固定轨迹只能保证所有模型收到相同的按键,却不能保证它们都到达相同的视角。如果模型并未真正到达目标视角,后续的几何一致性评分就失去了可比性。 PlayWorld 因此把评测单位从 “固定动作序列” 升级为 “场景相关的长期目标”:所有模型面对同一个初始世界、同一个目标,但允许 Agent Player 根据实时观察作出必要调整。 图为围绕中心雕塑转一圈,再观测雕塑形状有无改变: 核心创新: 会观察、会调整、会喊停的 Agent Player Agent Player 由多模态模型与接口转换器组成。每一步,它都会查看生成帧、已执行的动作、场景描述和长期目标,再从五种决策中选择一种: Keep:按计划继续当前动作,或进入下一个动作; Stop:目标视觉状态已经出现,提前结束当前动作; Extend:运动还不够,延长当前动作的持续时间; Correct:当前状态偏离基础动作序列,修正下一步; End:目标已经达成,且所需观察已完成,结束本次评测。 接口转换器则将 WASD 代表的当前 action 序列转换为各个模型自适应的输入形式。考虑到 Agent 的决策需要一定时间,研究者不要求 Agent 从零规划整条轨迹,而是让它基于共享先验进行针对性修正。这套设计既保留了基础动作序列带来的可比性,又能适应不同模型的动作粒度。 四大维度: 从 “看起来不错” 走向 “世界真的成立” PlayWorld 为每个场景设计了任务相关的 VQA 问题,并从四个核心维度评估世界模型: 1. 几何一致性(Geometry Consistency) 模型在移动镜头、绕行和重访之后,能否保持物体身份、数量、纹理、材质、颜色以及相对位置?例如,完成 360° 旋转后,原来的建筑、文字或雕塑是否仍然位于正确位置,还是被重新 “生成” 成另一个版本? 2. 交互保真度(Interaction Fidelity) 用户的动作是否产生符合物理规律的反馈?例如,人物走入水中时是否会激起水花和涟漪;从水塘岸边走向深处时,水位是否会逐渐升高;撞向障碍物时是否会合理停下,而不是直接穿模或悬浮。 3. 视野外演化(Out-of-sight Evolution) 目标离开画面后,世界是否仍在继续演化?当镜头再次转回,目标是否保持身份与位置,并呈现符合因果关系的状态变化,而不是恢复原状、突然消失或被另一个物体替代?例如,正在写字的人书写的内容是否会增多,火箭腾空后是否会持续上升,倒出的液体是否会持续增多。 4. 视野内演化(Insight Evolution) 在长达 60 秒的持续观察中,人物或过程是否真正向前发展?例如,远处爆竹响起时,周围的人是否会四散离开;夜市上的行人是否会突然静止;收银台前的顾客结账后是否会离开,而不是重复动作或长时间停留在原地? PlayWorld 测试集针对每个评测维度人工筛选共 171 个样本并且设计 820 余个问题。其中几何一致性样本强调可重访的视觉锚点,例如文字、壁画和标志性建筑;交互样本则覆盖人物与水、火、悬崖、草地和障碍物等的交互;视野外演化关注削苹果、制作甜品、绘画等在遮挡期间仍应继续进行的过程;视野内演化则关注排队结账、摆盘等持续可见的长时过程。 实验结果: 世界模型仍待进步 发现一:持续世界演化仍是最明显的瓶颈 几乎所有模型在视野内与视野外持续状态演化维度上的得分都较低。一个正在进行的过程可能长时间静止、反复循环或突然重置,也可能在目标离开视野后不再继续。这表明当前模型更擅长维持短时间的局部外观连续性,却仍无法稳定维护跨时间、跨遮挡的语义状态。 发现二:长时重访暴露全局空间不一致 单帧看起来合理,并不代表整个世界在三维空间中成立。实验中,当视角环绕泰姬陵等地标旋转 360° 时,模型可能在不同视角反复生成多个 “新地标”。每一帧都足够逼真,但从完整轨迹来看,空间唯一性已遭到破坏。 发现三:能到达目标,不等于理解世界 轨迹验证通过率与世界模型的综合能力并不总是一致。例如,SANA-WM 的总体轨迹验证通过率达到 80.4%,说明它通常能够到达目标区域;但其四项 rubric 的总体得分仅为 1.48。这意味着模型即使能够 “走到那里”,仍可能无法维持记忆、空间关系或物理交互的一致性。 总结 PlayWorld 将世界模型评测从 “执行相同按键” 推进到 “完成同一长期目标”。通过 Agent Player 的闭环观察与在线修正,让不同控制粒度、不同交互接口的模型得以在更贴近真实用户体验的条件下进行公平比较。 更重要的是,PlayWorld 揭示了当前世界模型最关键的能力边界:生成清晰、流畅且可控的画面只是第一步;一个真正可靠的世界模型,还必须在经历长时间交互、视角变化与遮挡后,持续维持空间结构、物体身份、物理反馈与因果状态的一致性。 © THE END 转载请联系本公众号获得授权 投稿或寻求报道:liyazhou@jiqizhixin.com 平台地址: http://www.jintiankansha.me/t/Jr04ZdC0Dc
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱