智能AI
morning
李飞飞发布:全球首个多模态世界模型
摘要
李飞飞发布:全球首个多模态世界模型 鱼羊 2026-09-02 09:07:13 来源: 量子位 鱼羊 发自 凹非寺 量子位 | 公众号 QbitAI 「全球首个」 多模态世界模型 ,来了! 来自李飞飞World Labs。 World Labs对这个名为 Atlas 的新一代世界模型,用词可谓毫不克制,「全球首个」之外,slogan也明确强调出,这一次,可不只是生成一段可互动视频了哟: 建模世界...
量子位
全球首个
Atlas是一个
这样一来
Transformer
李飞飞发布
全球首个多模态世界模型
2026
凹非寺
公众号
2026-09-02
1 阅读
约8分钟阅读
鱼羊
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 李飞飞发布:全球首个多模态世界模型 鱼羊 2026-09-02 09:07:13 来源: 量子位 鱼羊 发自 凹非寺 量子位 | 公众号 QbitAI 「全球首个」 多模态世界模型 ,来了! 来自李飞飞World Labs。 World Labs对这个名为 Atlas 的新一代世界模型,用词可谓毫不克制,「全球首个」之外,slogan也明确强调出,这一次,可不只是生成一段可互动视频了哟: 建模世界,移动相机,模拟空间和时间。 就是说,Atlas能够以像素级的相机控制生成图像和视频帧,并完成3D重建。并且 空间 和 时间 都能理解。 李飞飞本人将其视作World Labs的「里程碑式」成果,直接一手置顶: Atlas为 从视觉特效到机器人 的众多应用场景打开了大门。 飞飞高徒、英伟达机器人主管Jim Fan也来捧场,指出:这是机器人领域Real-to-Sim的一大步。 具体来说,Atlas是一个 多模态自回归扩散Transformer ,它的能力包括: 相机控制生成 :仅需一张图片,Atlas即可生成具有像素级相机控制的图片和视频,最高可输出1分钟、1440p的视频。 空间重建 :Atlas可以基于一张到数十张输入图像,重建真实世界场景。既可以生成新视角下的图像帧,也能输出显式3D表示,其效果超过当前专门针对3D重建训练的最先进模型。 时空模拟 :Atlas可以根据输入视频同时建模空间和时间,可以转换已有视频中的观察视角,制作具有戏剧性的视觉效果,同时支持机器人Real-to-Sim工作流。 图像生成 :Atlas可以根据文本生成图片和360°全景图,能够遵循复杂Prompt、准确渲染文字,并生成大量不同的视觉风格。 对于 机器人模拟 ,仅需喂Atlas几张照片,它就能生成逼真的RGB和深度数据。这样一来,机器人就能在更多不同的模拟空间中进行训练和测试。 从头训练的多模态世界模型 技术细节上,Atlas是一个 全能模型 (omni model)。 它的目标,是在一个统一的模型架构中,同时处理多任务、多种输入和输出数据。 与此同时, 空间控制是整个模型的核心 。 为了实现这些目标,李飞飞团队设计了一种全新的基础架构,来作为未来世界模型的基础—— 多模态自回归扩散 Transformer 。 文本、图像、视频、3D数据……各种输入都会被锚定在三维空间中,从而形成一个 空间上下文 。 然后,Atlas会根据这个上下文生成多模态输出。 这样一来,比如把 两张毫无关系的参考图片 放进同一个上下文中,再分别指定它们在3D空间中的位置,Atlas就能把它们缝合成一个空间自然、连续的世界。 更具体地拆解一下, 多模态 ,指的是Atlas可以原生处理多种不同的数据类型,包括 文本、图像、相机位姿、3D深度图 等。 视频则被表示为 图像序列 。 每一张图像和每一幅深度图,都对应一个明确的相机位姿。 自回归 ,指Atlas操作的是一系列元素组成的序列,序列中的每一个元素都可以属于前面提到的某一种数据模态。 Atlas每次生成一个新的输出,都会以前面已经存在的序列内容作为条件。 这种灵活的设计天然适用于各种不同任务。 每一种任务,本质上都只是一种不同类型的序列——前面是输入,后面是输出。 扩散模型 ,指Atlas是一个Rectified Flow(校正流)模型,通过逐步去噪来生成输出。 扩散模型尤其擅长对图片和视频这种高维连续数据进行建模。同时,在推理时,只需要改变去噪步骤的数量,就可以实现速度和质量的平衡。 而 Transformer 不必多说,在世界模型领域,Transformer也被证明是非常稳健的基础架构。 也就是说,Atlas实际上融合了大语言模型和视频模型中的大量思想。 Atlas既可以利用大量原本服务于LLM推理和加速的技术,包括KV Cache、缓存感知路由、解耦式服务等等。 另一方面,它又和现代图像、视频生成模型一样,是一个潜空间扩散模型,可以利用扩散蒸馏、无分类器引导、移位噪声调度等算法,并引入更先进的VAE架构。 研究团队在相机控制生成和3D重建两个关键任务上对这个新一代世界模型进行了定量评估。 在相机控制生成上,结果显示,Atlas优于SOTA视频模型。 并且相机轨迹越复杂,Atlas的优势越大。 在根据稀疏输入视角进行3D重建的任务中,Atlas同样超过了表现最好的专业开源3D重建模型。(分数越低表现越好) 值得一提的是,Atlas从设计之初就为Scaling做好了准备。 李飞飞团队表示,已经看到了非常有利的证据,证明 Atlas的能力会随着规模扩大而继续提高 。 目前,Atlas正在向部分合作伙伴开放早期访问。 也可以在官网申请访问权限。 具身智能Real-to-Sim的关键一步 李飞飞新世界模型一出,关注的焦点,还是汇聚在 具身智能 上。 把今年World Labs的动作联系起来,Atlas的意义也更加明朗。 今年6月,李飞飞亲自下场定义世界模型,将其分类为渲染器、模拟器、规划器。 并明确指出,「最关键的是模拟器」。 因为模拟器承担的是世界本身的几何、物理和动力学,是渲染和行动共同依赖的基础。 紧接着,7月21日,World Labs收购机器人仿真公司SceniX。 7月28日,公开Real-to-Sim-to-Real系统,强调机器人最大瓶颈是缺乏廉价、可控、可规模化的训练经验。 现在,Atlas来了。 从真实照片/视频,到3D空间,再到机器人传感器视图和可变化的模拟环境,这一条路径被打通了。 World Labs官方表示,接下来,Atlas会成为未来版Marble以及World Labs其他产品的底层模型。 参考链接: https://www.worldlabs.ai/blog/atlas 版权所有,未经授权不得以任何形式转载及使用,违者必究。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱