智能AI
morning
世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临!
摘要
鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI 牛大发了!3D生成,刚刚从 「造物」 一脚跨进了 「造世界」 ! 看过《盗梦空间》吗?造梦师只用挥挥双手,物理规律下街道能折叠,建筑随之升起。 现在,类似的一幕就出现在3D生成中: 随便上传一张场景图,2~3分钟后, 一个完整的3D场景直接生成 。 桌上的碗是可以单独拎起来的,椅子是可以旋转挪动的,不喜欢的家具也是可以随时随地替换的…… 不同于...
WorldGen
地瓜机器人
Sim
凹非寺
量子位
公众号
QbitAI
牛大发了
3D生成
刚刚从
2026-09-03
1 阅读
约10分钟阅读
鹭羽
字号:
鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI 牛大发了!3D生成,刚刚从 「造物」 一脚跨进了 「造世界」 ! 看过《盗梦空间》吗?造梦师只用挥挥双手,物理规律下街道能折叠,建筑随之升起。 现在,类似的一幕就出现在3D生成中: 随便上传一张场景图,2~3分钟后, 一个完整的3D场景直接生成 。 桌上的碗是可以单独拎起来的,椅子是可以旋转挪动的,不喜欢的家具也是可以随时随地替换的…… 不同于只能围观的三维画面,这里每个资产都 「活着」 。 再或者,除了牛来,我们还可以 马来 、 虎来 ! 踏出这一步的,正是3D生成头部玩家 影眸Hyper3D ,其正式发布世界生成模型 WorldGen ,把3D生成从单个资产推向完整场景。 相比业内宽泛的“世界模型”概念,WorldGen的定位更具体明晰—— 不是生成一个只能观看的世界,而是交付 可交互 、 可编辑 、 可进入真实生产环境 的3D场景。 就像拼乐高积木,既能往里面持续加模块,也能随时抽出、替换其中任意一块;每一块还自带物理属性,如果不小心抽走关键支撑物,周围的物体同样会发生位移或跌落。 简单来说,这里的每一项资产都不会和背景彻底锁死,资产之间同样物理关系明确。 也正因为具体,它离 真实工作 也更近。 游戏需要关卡,影视需要片场,机器人需要训练环境……但它们现在都可以从WorldGen开始,其生成能力已经足以跑进真实生产场景。 这条路也不是凭空造出来的,早在去年,影眸Hyper3D就凭借自研的场景级生成技术 CAST 拿下国际图形学顶会 SIGGRAPH 2025最佳论文 。 同期获奖的商业公司只有谷歌和Meta。 而CAST,就是WorldGen的技术基座。 所以如果说AI 3D的第一步是回答物体长什么样,那么WorldGen回答的则是第二个问题: 多个物体如何带着空间关系和物理属性,组成一个场景。 一张图→一组资产→一个场景 且说当下绝大多数的 整体式场景生成 ,都有个通病: 好看,但中看不中用。 用户在场景内能做到的相当有限,基本就是走走看看。想改动?不好意思,只能推翻重来。 问题的根源出在生成方式上。用影眸Hyper3D创始人兼CEO 吴迪 的话来说: 传统做法直接将整个场景作为一个模型生成,所有内容容易被合并成不可拆解的整体,场景很难继续使用。 WorldGen的关键变化,是 把场景拆解为可单独操作的资产 ,同时保留它们之间的空间与物理关系。 整个 生成流程 拆开来看是这样的: 打开官网 (https://hyper3d.ai) ,选择WorldGen生成。 这里咱们上传一张卡通风格的厨房局部图。 系统会自动识别出图中的主要物体,也可以手动框选,单独指定要生成的部分。 接下来,每件前景物体将作为独立资产逐个生成,大约 2到3秒 就能出预览。 背景环境则用 3D Gaussian Splatting 补全,兼顾视觉完整性。整体可压缩至2到3分钟。 打开 SimReady模式 后,系统还会为每件资产补充碰撞体,并估计质量、摩擦系数、恢复系数等仿真所需的物理属性。 最终成功复刻 3D版胡闹厨房 。 场景初稿到手后,行业应用也不在话下。 先看数据需求最迫切的 具身智能 。 真实采集不仅要承担场地、设备和人员成本,火灾、坍塌等危险环境也无法被安全复现;传统仿真虽然可以补位,却又需要工程师耗费大量时间手把手搭场景,成本高还偏差大。 WorldGen则在二者当中达成了微妙的平衡。 以影眸Hyper3D、地瓜机器人、谋先飞在今年7月联合发布的闭环方案为例: WorldGen 负责从真实影像中生成可交互的三维场景,场景内的3D物品全部都具备仿真导入能力。 谋先飞 的MotrixSim引擎负责物理与并行仿真,让机器人在其中运动、抓取和交互。 地瓜机器人 提供算力和开发工具链。 三方整合,才形成 从场景准备、仿真运行到数据采集和策略验证的完整链路。 作为 NVIDIA Inception (初创加速计划) 的一员,影眸Hyper3D也正通过WorldGen实现英伟达全球仿真生态的进一步联结,将“单个资产用于Isaac Sim”拓展为 “整个场景用于Isaac Sim” 。 游戏圈 用法更直接。 过去拿到一张关卡概念图,美术和策划接下来还有一长串工作。 图生3D已经能缩短单件资产的制作时间,但这些资产最后仍要靠人一件件组装。 WorldGen试图把这部分工作进一步前置。 它先从概念图生成一版对象化场景,策划可以检查动线和空间,关卡设计师可以移动或替换道具,美术再决定哪些关键资产值得精修。 更方便的是 ,WorldGen生成后的独立资产能够直接进入Blender、Unity、PlayCanvas、团结引擎、Unreal Engine等DCC与实时引擎环境,进行材质调整、动画绑定、关卡编辑、性能优化等二次创作。 今年7月,影眸Hyper3D已经与 Unity中国 达成合作,合力构建打通从3D生成到实时游戏应用的工程闭环。 据团队介绍,WorldGen灰度测试期间,也已有多名游戏从业者对其表达了兴趣。 影视行业 则看中了它当 「导演台」 的潜力。 吴迪举过一个很具体的例子: 导演要把画面左侧盘子里的苹果移到右侧盘子,纯视频生成很难稳定控制; 用WorldGen建立可控3D基底,再用视频生成模型提升最终画面质量,这样则相当直接。 目前已经有创作者把 WorldGen 与 Seedance 2.5 结合: WorldGen提供3D场景,可以轻松完成镜头调度和构图调整,再交给视频生成模型,补齐人物表演、材质光影和最终风格。 WorldGen的 AI Render模块 则具备了AI渲染、自由运镜等功能,同一场景可以变换多种视觉风格,也为产品概念演示、空间导览等内容带来制作效率与品质的双重提升。 这套新用法,将让影视生成不必再在可控和好看之间二选一, 出手即是大片级 。 据了解,WorldGen如今已经进入实际影视项目的制作流程,相关作品将在完成后陆续上线。 XR与空间计算 则验证了它的通用性。 既然场景可以从任意视角观察,主要对象又能被替换和移动,一张普通照片便有机会变成可以进入、浏览和调整的沉浸式空间。 室内设计、沉浸式教育、空间展示 ,都可以成为它的潜在落点。 搭配Apple Vision Pro等XR设备,《头号玩家》照进现实。 当然,这些还只是WorldGen的一小部分用法,潜力无穷,等你来探索~ 从顶会最佳论文到产品化,WorldGen攒了整整一年 要理解WorldGen是如何一步“登天”的,还得从去年那篇 CAST 论文说起。 场景生成难在哪里? 不是把图生3D连续运行十几次就能实现的。单张图片天生缺少深度、真实尺度和物体背面的信息,还存在遮挡和透视畸变。 比如一个苹果被盘子挡住,模型要先补全看不见的部分;稍微生成大一点,摆回桌面时就可能穿进盘子;位置再偏一点,后续碰撞体和支撑关系也会跟着出错。 场景错误还会级联 ,一步错步步错,最后摊在产品里就是用户返工实打实的成本。 CAST的思路可以压缩成四步, 先看懂→再补全→然后放回去→最后做物理纠错 : Step 1 :模型把输入图片拆成对象,并估计相对深度,让一张没有结构的RGB图片变成对象清单和空间线
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱