游戏
morning
Atlas用3D重建开路,世界模型进入可测量的新阶段
2026-09-15
1 阅读
约10分钟阅读
机器最前线
字号:
文 | 机器最前线 2026年,世界模型逐渐从学术概念走向产业落地。 World Labs收购了机器人仿真公司SceniX,英伟达的Cosmos绑定算力主攻仿真,谷歌的Genie系列持续迭代。国内Manifold AI发布自研世界模型WorldScape登顶多个榜单,摩尔线程开源全栈仿真平台MT Lambda完成Sim2Real真机验证。 各大玩家都在加速布局,但路线分歧也越来越明显,这些号称能“理解世界”的模型,到底是在生成好看的画面,还是在搭建可用的空间? World Labs在九月发布了全球首个多模态世界模型Atlas,恰好提供了一个可供剖析的样本。它的设计思路和取舍,或许能帮我们看清这条赛道的真实走向。 几何重建,让训练场从专业级走向消费级 Atlas发布后,很多人会联想到Sora。两者都建立在生成式模型架构之上,输出内容也都以视觉画面呈现,从表面看确实有相似之处。但两者除了都涉及“生成”之外,几乎没有共同点。 Sora做的事情是视频生成。给它一段文字,它生成一段看起来合理的画面。它关心的是像素之间的连贯性、运动的平滑度、视觉上的逼真感。最终交付的产物是一个视频文件。 Atlas做的事情与它不同。当你给它几张照片,它能直接按照照片画面重建出一个相同的3D场景。这些照片被锚定在三维空间的具体坐标上,模型据此还原几何结构。它主要的关心在于空间坐标对不对、几何结构准不准、程序能不能直接读取。 最终交付的也不是画面,而是可供计算机直接解析的几何数据,例如点云、3D高斯泼溅,也就是一堆带坐标的空间点、一组带形状和颜色的椭圆体,两者都不是给人看的图片,而是机器能直接读取和计算的“0和1”,程序可以直接使用、机器人仿真器也可以直接导入运行。 换句话说, Sora交付的是“画面”,Atlas交付的是“世界”,一个机器人可以直接进去“干活”的数字空间。 从照片到三维空间,Atlas靠的不是像素拼接,而是一套对空间关系的重新理解。这个改变,正在重新定义机器人感知世界的底层逻辑。 1.空间上下文重塑视觉输入规则 传统视觉输入处理的是二维像素阵列,一张图就是一张图,没有深度,没有尺度,没有遮挡关系。Atlas的空间上下文则让每一帧图像都自带三维坐标,输入从“拍到了什么”变成了“从哪拍的、和周围什么关系”。 这个变化直接触及世界模型的底层结构。 一个世界模型通常分为三个模块:视觉模块负责把摄像头、麦克风这类原始信号翻译成模型能理解的内部格式;记忆模块负责学习环境的变化规律,根据当前状态推算下一步会怎样;控制模块则基于这些推算来决定具体怎么动。 Atlas做的事情,就是把视觉模型和记忆模型这两个环节往前推了一大步。 推动这一步的关键机制,是Atlas对空间上下文的理解方式。过去大语言模型用文字上下文来预测下一个词,把输入的文字编码成上下文,再基于上下文生成后续内容。Atlas的思路一脉相承,但是它用的不是文字,而是带着三维坐标的照片。每一张输入Atlas的照片都被固定在一个三维空间位置上,模型能够识别这张图是从哪个方向拍的,和其他照片之间是什么关系。 (图源:World Labs) 这个机制的效果,可以用一个简单场景来说明。想象你在一个房间里拍了五张照片,朝东一张、朝北一张、朝西一张。传统模型看到的是五张独立的平面图。但Atlas可以分析出这五张图来自同一个房间的不同角度,并把它们拼成了一张完整的三维房间地图。这不是在拼接画面,而是在还原空间。 2.空间重建降低3D场景构建门槛 3D场景构建的核心门槛,在于几何结构的还原精度。而Atlas仅需最少2张,最多25张普通照片,它就能输出一个完整的3D场景,这个3D场景可被仿真器直接导入,作为视觉环境的基础。 官方做过一个逐步构建的演示:一开始只给一张办公桌的局部特写,Atlas生成了一张室内全景图,画面中办公桌和电脑是准确的,但旁边的椅子和墙面全是模型“脑补”出来的。再加入第二张房间整体视角的照片,这一次办公桌和椅子都对了,但画面右侧的显示器区域仍然是空的。直到加入第三张侧面双屏工作台的照片,整个办公场景才完整对齐。 (图源:World Labs) 输入越多,需要“脑补”的部分就越少。 官方透露Atlas通常只需要两到三张图就能实现可用的重建,也能处理超过一百张输入图做精细建模。另一个案例是斯坦福大学主方庭,仅靠几张从地面拍摄的手机照片,Atlas就生成了从校园高空俯瞰的连续飞行画面。 这意味着,过去想要搭建一个给机器人训练用的3D场地,需要扛着专业设备围绕目标转几十圈,拍摄数百张照片,再花几天时间手工建模。现在一部手机,一段视频,几分钟就能完成。这个效率的提升,把3D场景生成从专业测绘的范畴,拉近了普通工程师日常工作的范畴。 3.时空模拟打通真实到仿真链路 当有了3D世界后,如何灵活地观察它,成为下一个需要解决的问题。 Atlas的相机可控生成能力允许用户输入1到6张参考图,再设计一条相机运动轨迹,模型沿着轨迹生成最高1440p、最长1分钟的视频。其本质是让用户不再“猜”下一帧长什么样,而是让用户用坐标告诉模型“从哪个角度看”,模型按坐标渲染对应的画面。 为了验证这项能力的实际效果,World Labs做了第三方盲测。测试中,Atlas以相机位姿作为原生输入来控制运镜,其他对比模型通过文本提示描述运镜方式。Atlas对MiniMax H3的胜率是75%,对阿里HappyHorse 1.1是86%,对字节Seedance 2.5是94%。胜率随着运镜复杂度增加而进一步拉大,说明当相机控制精度成为瓶颈时,Atlas的原生几何理解能力带来了优势。 (图源:World Labs) 从观察世界到让世界动起来,是Atlas的另一个延伸能力。这项能力被称为时空模拟。通过三五台普通手机同步录一段视频,Atlas就能实现时间冻结、多视角回看的效果,即能把时间暂停在某一帧,允许从任意角度回看同一个瞬间。过去这种效果往往需要几十台同步摄像机才能做到,而现在几台手机配合Atlas就能完成,大大降低了多视角捕捉的门槛。 不过对整个机器人行业来说,更重要的是Atlas时空模拟带来的仿真价值。 World Labs曾用手机拍摄了两个大型环境,各取24帧重建出3D场景,然后模拟不同机器人沿不同路径行走,Atlas能实时生成机器人传感器应该看到的RGB画面和深度数据。而且一个真实场景可以生成上千种变体,改变路线、挪动障碍物、调整光照,全都不需要重新搭建场地。 (图源:World Labs) 这意味着,数据采集的主体从真实机器人变成了虚拟机器人。物理世界的行走只需要一次,剩下的都在数字世界里完成。成本从“每次都要跑一趟”变成了“跑一趟,用无数次”。 但成本只是其中一面,生成的虚拟数据还需要跟真实世界对齐。 在传统流程里,环境重建和传感器渲染是两套系统,误差在接缝处累积。而Atlas把这两步统一在同一个模型里,消除环节之间的误差传递,让机器人能在虚拟环境中获得与真实世界高度一致的感知数据,训练效果更可靠。 整体来看,空间重建解决了“世界长什么样”,相机控制解决了“从哪个角度看”,时空模拟解决了“时间如何流动”。 这三项能力都附着同一个链条,先有几何结构,再有视角控制,最后推演时间的演化。 在这个链
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱