首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位

摘要

前脚友商还在为你追我赶生成几秒钟的「电子榨菜」视频卷到头秃;后脚李飞飞创办的 World Labs 微微一笑,把桌子掀了—— 就在刚刚,全球首个多模态世界模型 Atlas 正式登场! ▲官方博客🔗 https://www.worldlabs.ai/blog/atlas 按照官方定义,Atlas 是一款面向空间智能的 omni world model,从零开始完成预训练,可以原生处理文本、图像、视频...

Atlas World Labs 对比之下 Spatial 前脚友商还在为你追我赶生成几秒钟的 电子榨菜 视频卷到头秃 后脚李飞飞创办的 微微一笑
2026-09-02 1 阅读 约10分钟阅读 莫崇宇
分享:
字号:
前脚友商还在为你追我赶生成几秒钟的「电子榨菜」视频卷到头秃;后脚李飞飞创办的 World Labs 微微一笑,把桌子掀了—— 就在刚刚,全球首个多模态世界模型 Atlas 正式登场! ▲官方博客🔗 https://www.worldlabs.ai/blog/atlas 按照官方定义,Atlas 是一款面向空间智能的 omni world model,从零开始完成预训练,可以原生处理文本、图像、视频、相机位姿与 3D 深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。 先来看最直观的炸场操作: Camera Controlled Generation(相机控制生成)。 以前大家玩视频生成模型,多少有点玄学抽奖。我们在 Prompt 框里卑微敲下:「镜头缓慢向左拉升、绕着人物微仰角旋转」,回车之后全凭老天保佑。 对比之下,Atlas 的做法是:直接把「相机位姿参数」当作底层原生输入。 你要什么角度、什么轨迹、走多快? 直接给坐标! 只要丢进去 1 到 6 张普通照片,定好运镜轨迹,Atlas 就能生成最长达 1 分钟、1440p 分辨率 的大片。 画面不崩,空间几何丝滑一致,堪称外挂级运镜。 更夸张的是它的空间「脑补力」。 输入一张只拍到机器人正面的照片?Atlas 能把人家背影完完整整脑补出来; 给一张泳池边角照?它靠着脑子里的「世界常识」,默默帮你把隔壁没拍到的草坪和远山给修好了。 从官方放出的 Demo 来看,Atlas 在镜头运动和空间一致性上确实比普通视频生成模型更进一大步。 不过,镜头一旦进入原图没有拍到的区域,Atlas 实际上仍然需要依赖模型先验去猜,视角跨度越大、生成路径越长,局部几何漂移、物体形状变化和纹理闪烁也越容易暴露出来。 换句话说,它生成的更像是一个视觉上合理的三维世界,未必就是原来那个世界的精确数字复刻。 而种种操作的背后,也绕不开一个名为 Spatial Context(空间上下文)的行业术语。 大语言模型看上文接下文,Atlas 则是给每张图片绑死三维坐标和深度,在脑子里搭出一个带轴网的房间。 说得更直白一点,Atlas 很多能力的底层,其实都绕不开多视角合成。 它会把来自不同角度、不同机位的图片和视频,一起塞进同一个三维空间里,先判断它们彼此之间的相对位置,再补足没拍到的区域,继续生成新的视角。 单张图输入时,它更多依赖模型先验去「脑补」世界;输入视角一旦变多,它就更像是在做一次带空间约束的多视角融合,把零散画面慢慢拼成一个连续、可漫游的三维场景。 甚至你随便抓两张八竿子打不着的照片往空间里一扔,Atlas 都能强行给你脑补出走廊、大门和房间,把俩场景无缝焊在一起。 导演系同学看到这里,战术沉默,缓缓打出一个问号:合着以后运镜不用实拍,直接在电脑里「云开机」就完事了? 除此之外,Atlas 还有第二张王牌:Spatial Reconstruction(空间重建)。 传统的 3D 高斯泼溅(3D GS)或者点云扫描,得扛着专业设备围着目标转几十圈,拍几百上千张照片,费钱又费腿。 但 Atlas 再次露出神秘的微笑:一边去,哪来这么多的规矩。 官方直接甩出了一个斯坦福大学 Main Quad 案例,只需把 2 到 25 张游客视角的地面平拍照片塞进去,就能轻松还原草坪、拱廊以及纪念教堂外墙的全部细节。 镜头随后直接拔地而起,来了一段上帝视角航拍的漫游。 在 DTU、ETH3D、ScanNet 等一堆公开数据集上,专门测稀疏视角重建误差(AbsRel ×10⁻³):Atlas 拿下了 25.3 的分数(分数越低越好)。 对比之下,Pi3X 是 28.7,Depth Anything 3 飙到 39.3,MapAnything 更是高达 47.7。 而且输出直接对接点云和 3D Gaussian Splatting,能无缝接进 World Labs 自家的 Marble 平台,高帧率即时渲染。 更绝的还有「子弹时间」式的 Reframing Video。 不用好莱坞几百台相机的环形阵列,研究员拿三五个普通手机、运动相机随手一架,塞进背包带走; 拍一段日常打闹,Atlas 就能在虚拟空间里随意切换视角,原地复刻《黑客帝国》。 当然,李飞飞和她旗下的公司 World Labs 折腾这一大出,终极目标肯定不是为了跟好莱坞抢特效饭碗。她的星辰大海,是这代 AI 最大的痛点: 具身智能与机器人。 现在搞机器人训练的朋友都知道,具身智能的最大痛点其实就是「虚拟训练场不够用」。 让机器人真的去工厂、仓库和家庭里反复试错,数据采集速度慢,成本也高;换到仿真环境里训练,又得先花大量人力搭建 3D 场景、材质、光照和物体。 业内甚至有一种估算,如果完全依靠传统方式收集足够规模的机器人训练数据,最终成本可能达到 100 万亿美元的量级。 Atlas 给出的 Real to Sim 路线,相当于直接省掉了中间大量人工搭建仿真世界的工作。 拿手机拍两段 24 帧的工厂或房间视频,喂给模型;Atlas 原地吐出一个高精度的 3D 物理空间,机器人就可以钻进这个孪生空间里疯狂「跑图」试错。 甚至机器人走到哪,Atlas 就当场渲染出机载摄像头应该看到的 RGB 图和深度图。 机械臂碰一下刚性箱子、拉一下铰链柜门、捏一下软体海绵,Atlas 统统能模拟出受力反馈。 只要录一段真实现场,就能衍生出千万种光照、摆放和障碍物条件。 技术底座上,World Labs 这次掏出了一套极其硬核的组合拳: Multimodal Autoregressive Diffusion Transformer,多模态自回归扩散 Transformer。 拆开来看,它兼采了当前两大主流范式的长处: Multimodal:原生融通文本、二维图像、相机位姿与 3D 深度; Autoregressive(自回归):像语言模型预测下一个词一样,在时空序列中逐级预测新的空间状态; Diffusion(扩散机制):基于 Rectified Flow 逐步去噪,确保连续高维信号的画质与几何精度; Transformer:以最成熟的矩阵乘法结构为底座,无缝适配现有大规模算力集群。 这套架构让 Atlas 能够同时享受到 LLM 领域的 KV Cache、分布式推理优化,以及扩散模型的采样蒸馏与先验引导。 在针对镜头运动控制的真人 Blind Test(盲测)里,战况简直是一场单方面的骑脸输出: 面对 MiniMax H3,Atlas 胜率 75%;面对 Gemini Omni Flash,胜率 81%;面对 FLUX 3,胜率直接冲上 93%;面对 Seedance 2.5,胜率达到凶残的 94%! 除了世界生成和空间重建,Atlas 还顺带具备了不错的图像生成能力。虽然这不是它的主攻方向,但复杂 Prompt、文字渲染,以及写实、电影感、油画、漫画等多种风格,它都能处理。 更有意思的是,Atlas 还能直接根据文字或图片生成 360° 全景图。相比普通文生图只要保证一个固定画面成立,360° 场景还要处理前后左右的空间连续性,对模型的空间理解要求更高。 值得一提的是,除了性能,World Labs 在 Atlas 身上强调的
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱