开发者生态
morning
李飞飞首个多模态世界模型 Atlas 正式发布:从零开始预训练,几张图就能构建世界
2026-09-03
1 阅读
约10分钟阅读
李冬梅
字号:
李飞飞的 Atlas 来了 一张照片能够告诉 AI,房间里有一张桌子。但如果把镜头移到桌子背后,那里应该是什么样?如果机器人伸手推动桌上的杯子,接下来又会发生什么? 识别物体、生成画面和理解空间,是相互关联、却不能直接画等号的能力。李飞飞创办的World Labs,正在尝试跨越它们之间的距离。 昨晚,World Labs 发布新一代世界模型 Atlas,这是一款全域模型,团队从零开始预训练,使其能够原生处理文本、图像、视频和 3D 数据。Atlas 它将用于后续 Marble 及其他产品,目前面向部分合作伙伴开放早期访问,而非全面上线。 这款备受关注的多模态世界模型的亮点是什么? 按照官方披露,Atlas的主要能力包括世界生成、重建和模拟等广泛任务: 可控运镜:Atlas 可利用像素级相机控制,从一张或多张图像生成图像和视频,输出长达 1 分钟的 1440p 视频。 空间重建:Atlas 可以根据一张或数十张输入图像重建真实世界场景。它既可以生成来自新视角的图像帧,也可以生成明确的 3D 输出,其性能优于目前最先进的 3D 重建专用模型。 时空模拟:Atlas 通过输入视频对空间和时间进行建模,重新构建视频以获得戏剧性的视觉效果,并为机器人实现真实到模拟的工作流程。 图像生成:Atlas 可以根据文本生成图像和 360 度全景图;它可以遵循复杂的提示,渲染文本,并生成各种各样的视觉风格。 提示词:“一张极具电影感的超写实广角镜头,展现了一座被丛林吞噬的寺庙中,一座巨大的石头女神端坐于宝座之上,下方是瀑布、探险者和碧绿的水池。” 提示词:“一张宽幅室内设计照片,展示了一间以淡蓝色鲸鱼为主题的儿童卧室,卧室里有一张可爱的鲸鱼床,床下是一幅海底壁画。” 提示词:“一张逼真的过肩特写照片,展现了花店老板在温暖的灯光下用牛皮纸包装一束粉色牡丹花。” 提示词:“一张 20 世纪 60 年代法国新浪潮电影海报,将地球仪和复古机器人以撕裂的照片蒙太奇形式层叠在一起,并以红色、蓝色和黄色的字体加以点缀。 Atlas采用多模态自回归扩散Transformer:序列元素逐个生成,每一步参考已有上下文,而视觉输出通过去噪产生;相机位姿和深度也是模型处理的数据类型。 这套设计的重要性,可以用一个拍摄任务来理解。 “让镜头向左移动”是一句意图描述;指定相机在空间中的位置和朝向,则是一组可检验的约束。前者需要模型猜测用户想要什么,后者允许创作者检查镜头到底有没有到达指定位置。 对于需要反复修改、衔接不同镜头的制作流程,差别不只是控制更细,是用户能否把同一个环境当作可重复使用的场景,而非每次重新抽取一段视频。 重建与生成也有类似关系:证据充分的区域,应当尽量还原;没有拍到的区域,只能依据已有信息推测。一个模型同时承担这两种任务,意味着使用者必须清楚,哪些部分来自观测,哪些部分来自补全。 但这里需要值得注意的是,生成得合理,不代表它就是现实中原本的样子。 即便如此,Atlas 的生成效果也足够令人惊叹。 而更耐人寻味的是,交出这份答卷的并不是 OpenAI、Google 这类资源无上限的巨头,而是李飞飞在 2024 年才创办的 World Labs。那么,为什么做出这款多模态世界模型的是她的团队? World Labs的故事,不能只从 Atlas 开始讲。 李飞飞 1999 年获得普林斯顿大学物理学学士学位,2005年获得加州理工学院电气工程博士学位。她推动的 ImageNet 及相关竞赛,是现代计算机视觉发展的重要基础;她也曾于2017年至2018年担任谷歌副总裁及Google Cloud AI/ML首席科学家。 为啥要把她的履历再介绍一遍,因为把她一直在做的事放在一起看,可以发现问题的延续性。 ImageNet 时代,一项核心任务是让机器识别照片里的内容。空间智能则把问题推进了一层:不仅要知道“这是什么”,还要知道它在哪里、从另一个方向看是什么样,以及它与周围物体存在什么关系。 例如,“这是一把椅子”是类别识别;判断机器人能否从椅子和墙壁之间穿过去,则需要尺度、几何和行动后果。语言可以描述这个问题,但文字描述本身不能替代空间判断。 2024年9月,World Labs 公开亮相。早期投资方 Radical Ventures 当时披露,公司从起步阶段就将目标设定为感知、生成和交互三维世界,并计划先从创作者能够使用的虚拟空间切入,再扩展能力。 因此,今天的机器人方向并不是看到具身智能升温后突然增加的一条业务线。更准确地说,创造空间是较早可以交付的入口,而让机器在空间中行动,是更难兑现的长期目标。 创始团队的构成,也能解释这条路线。World Labs由李飞飞与Justin Johnson、Ben Mildenhall、Christoph Lassner共同创办,几人的积累集中在视觉、图形学和三维表示,而不只是语言建模。 Ben Mildenhall 于2020年在加州大学伯克利分校获得博士学位,之后在 Google Research 工作。他是 NeRF 论文的共同第一作者之一。这项研究利用神经网络表示场景,并从已有照片合成新视角,是理解这支团队技术背景的重要线索。 Justin Johnson 的研究涉及视觉推理、视觉与语言、图像生成和三维推理,博士毕业于斯坦福。 Christoph Lassner 则长期研究高效的场景表示和渲染,开发过后来成为PyTorch3D球体渲染后端的Pulsar。目前 Lassner 已公开宣布退出日常职位,继续担任顾问。 这些经历并不能证明 Atlas 直接采用了某项早期研究,但能解释团队为什么会执着于同一件事:画面背后的空间,能否被稳定地表示、重建和调用。 从 Marble 到 RTFM:先让世界存在,再让世界持续生成 回看公开研发节点,World Labs 并不是一开始就拿出了今天这套完整能力。 2024年12月,公司首先展示可在浏览器中探索、具有持续性的三维世界。2025年9月,展示重点转向更大、更精细的环境,Marble也进入早期测试。 到2025年11月12日,Marble正式向所有用户开放。 Marble的意义,是把研究结果变成能够继续加工的资产。 用户不仅可以从文本、图像、视频和粗略三维布局生成世界,还能编辑、扩展、合并场景,并导出高斯泼溅、网格或视频。对于创作者来说,这比一次性生成结果更接近工作流:生成之后,还能修改和交付。 与此同时,团队在 2025 年 10 月公开了另一条研究线:RTFM,即 Real-Time Frame Model。 据官方博客透露,RTFM的设计围绕三个关键原则: 它探索的是“学习出来的渲染器”。传统图形系统先建立几何、材质、光照,再计算画面;RTFM则从已有画面预测新视角,不必先建立显式三维模型。官方当时将目标定为在单张 H100 上实现交互式帧率,并通过优化架构、蒸馏和推理系统达到这一目标。 这里最难的,不只是速度,而是记忆。 假如用户先进入客厅,再走到厨房,最后回到客厅,模型不能重新“发明”一间客厅。但如果把用户看过的所有画面都放进上下文,计算与存储开销又会不断增加。 RTFM的解决思路是给画面绑定空间位置:生成新视角时,检索附近的相关帧,
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱