智能AI
morning
AutoWorldModel-Bench:以国家为中心的自动化世界模型研究基准
摘要
arXiv:2608.11216v1 Announce Type: new Abstract: World modeling is an unsettled field: architectures, training objectives, and state representations interact in complex ways, and no single recipe domin...
and
which
state
coding
agents
the
benchmark
new
modeling
environments
2026-08-13
1 阅读
约1分钟阅读
Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri
字号:
arXiv:2608.11216v1 公告类型:新 摘要:世界建模是一个不稳定的领域:架构、训练目标和状态表示以复杂的方式相互作用,并且没有单一的方法可以跨环境占主导地位。这使得它成为人工智能编码代理作为自主研究人员的理想测试平台——在这种情况下,改进方向不会提前指定,这与主导当前代理基准的工程规范任务不同。我们引入了 AutoWorldModel-Bench,这是一个闭环基准测试,其中前沿编码代理在固定的计算预算下自主改进提供的世界模型启动器。该基准测试跨越八个游戏环境,采用统一的结构化状态表示(从每个游戏中提取并通过共享张量格式使用的真实实体状态),将动态建模与感知隔离,并实现每次运行几分钟的迭代。在 64 个会话中,Codex-5.4 和 Claude Opus 4.6 在 63 个会话中改进了它们的启动器;在 91% 的会议中,获胜的编辑是一项重要的研究风格修改——新的目标、表示、推出程序或架构更改——而不是超参数调整。我们的基准测试提供了一种设置,可以在开放式研究而不是工程规范问题上评估前沿编码代理。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱