游戏
morning
奥特曼、李飞飞、张一鸣齐押注,3D世界成AI竞赛新战场
2026-09-08
1 阅读
约10分钟阅读
AI价值官
字号:
文 | AI价值官,作者丨星野,编辑丨美圻 生成式AI的竞争,正在从图片、短视频等平面内容,快速延伸到更具想象空间的三维世界。 过去一周,四场重磅发布接连落地,三条技术底色完全不同的路线,不约而同在同一个方向上重兵集结——可实时交互的3D空间。 9月1日,Anthropic推出新一代旗舰Claude Fable 5.1,同一天李飞飞创办的 World Labs发布新一代原生世界模型Atlas。 9月3日,OpenAI 正式发布GPT-6 Astra,智能体直接操作专业软件生成3D交互场景的能力迅速引爆开发者社区。 9月7日,彭博社援引知情人士消息称,字节跳动正基于Seedance视频模型研发实时空间视频生成模型,创始人张一鸣亲自跨部门协调资源,最快10月推出,目标直指可响应用户动作、声音的实时虚拟环境,覆盖直播、互动短剧、游戏场景,并计划适配Pico VR头显。 三条技术路线正在逐渐清晰:OpenAI与Anthropic同属 LLM ,字节跳动Seedance代表 视频模型 ,World Labs则是 原生世界模型派, 三者起点各异,路径不同,最终却指向同一个产业拐点:内容产业的形态,正在转向 “可进入、可交互的空间”。 LLM的新角色,用通用智能驱动3D内容生产 OpenAI与Anthropic两家头部大模型公司,选择了相似的技术路径:依靠大语言模型的通用推理、任务规划与工具调用能力,切入虚拟内容的生产管线,把AI能力直接嵌入创作者沿用多年的专业软件体系,最终产出可编辑、可交互的3D场景。 这条路线上,GPT-6 Astra的表现最受瞩目。OpenAI将其定位为新一代通用智能体模型,能力覆盖计算机操作、编程、网络安全与科学研究,其中就包括对Blender、Unreal Engine等三维创作软件的完整操作权限。 在官方演示里,Astra能独立走完从概念到交付的全链路:给出一段文字描述后,模型先在Blender里完成建筑建模、材质贴图与光影渲染,再自动编写导出脚本,把成品导入Unreal Engine 5,生成一个可以自由漫游的交互场景,期间不需要人工分步介入。 Astra开放测试后,开发者社区很快涌现出大量实测案例。有人只给一张房屋照片,就能在Blender里还原出完整的室内空间,家具、电器等细节一应俱全,重建结果能以接近游戏的帧率在本地运行;也有人在虚幻引擎里逐街区搭建出可以自由漫游的城区场景,精细到每条街道;分钟级生成的城市白模、二十多分钟内搭出的城市漫游demo、当天成型的第一人称射击地图,也都在社区里流传开来。 游戏开发是反馈最集中的领域之一:有游戏工作室做过对照测试,让Astra从同一个灰模基础出发一次产出三款可玩原型,人工修复的工作量比传统流程减少了约一半;社区里同时也出现了多个经典游戏的复刻案例。 这些案例背后是Astra的Computer Use能力:它不依赖专属API或定制连接器,而是靠多模态视觉识别界面、模拟键鼠操作直接驱动软件,理论上人能在图形界面里完成的工作,它都能逐步学会——最终产出的还是可编辑的工程文件,能直接接入现有生产流程。 同样依托大语言模型的通用能力,Anthropic早在半年前就布局了MCP连接器生态,把Claude接入Blender、Adobe Creative Cloud等九款专业创作软件,通过Python API直接读写场景数据、批量处理素材。 与OpenAI需要通过Computer Use模拟键鼠操作不同,Anthropic的MCP方案直接嵌入了工具的内核,让Claude能更流畅地与专业软件协同。 Fable 5.1发布后,社区里同样跑出了大量3D游戏、场景建模的实测案例,模型能独立完成从素材检索到成品输出的全流程。 两家公司的思路高度一致:以LLM为核心,把智能体能力嵌进已经沉淀几十年的工业软件管线里,服务于专业创作者的既有流程,最终产出符合工业标准的可交互三维内容。凭借通用智能体调度全流程的能力,它们天然占据着3D内容生产链路的上游位置。 视频模型走向上游,从可视化内容到可交互空间 GPT-6 Astra发布没几天,开发者社区就跑出了一整套影视级工作流。开发者Higgsfield做了一次测试:只给Astra一句总指,在Blender里完成预演,再调用Seedance 2.5生成镜头,最后剪辑成片,全程保持角色与场景一致。 Astra接到任务后,先从零写出完整故事脚本,随后打开Blender,搭出一条日式街巷的简化3D白模,把两个角色放进场景,规划好不同镜头下的站位与走位,完成影视前期预演(Previs)。预演做完,Astra再敲定每个镜头的机位与运镜轨迹,导出对应参考帧,把角色形象、场景画面和动作参考一并交给Seedance 2.5去渲染成片。 这套组合玩法在社区刷屏的同时,也预示了一种行业趋势:如果视频模型只停留在画面渲染这一环,未来可能就会成为LLM的下游——创意、分镜、流程调度都由上游的大语言模型说了算。某种意义上,GPT-6的全流程能力越强,纯视频模型的位置就越被动。 这正是字节推动Seedance向上延伸的核心逻辑:不甘心只做视频生成器,而是要往空间理解、实时交互的上游走,直接产出可交互的虚拟空间,从“生成内容的工具”变成“承载体验的平台”。 彭博社9月7日独家报道称,字节跳动正在开发一款实时空间视频生成模型,项目由创始人张一鸣亲自跨部门协调,调集模型研发、云基础设施、Pico硬件与内容业务线的资源,算力优先保障,最快于10月推出。 和市面上已有的模型不同,这款产品瞄准的不是预先生成好的视频,而是能随用户声音、动作实时变化的虚拟环境:用户向前走,视角就同步推进;转过头,四周的场景依然连贯。应用场景直接指向直播、互动短剧和游戏,并计划适配字节旗下的Pico系列VR头显。 技术路径上,项目以字节已经成熟的Seedance视频生成能力为基础,把大量空间渲染计算放在云端完成,再把画面串流到终端设备,借此压低头显的硬件门槛。据报道援引的测试数据,模型可以按需生成每秒20帧的视频,端到端延迟约50毫秒。 这个数据在实时交互的语境中意义重大——50毫秒的延迟已经接近人类感知阈值,足以支撑流畅的沉浸式体验,而20帧/秒的生成速度则意味着云端渲染与流媒体传输的协同已经达到了可用的工程水准。 这条向上延伸的路线,其实早就埋下过伏笔。7月底发布的Seedance 2.5已经加入了Clay Render白模参考能力,支持基于3D白模生成贴合空间结构的画面,配套的Blender插件也在创作者群体中被广泛使用。 这次的实时空间模型,相当于把Seedance的能力往前推了一步,变成“实时生成可交互空间”,彻底脱离纯渲染工具的定位,转向承载体验的平台。 把这条路线放到LLM智能体派旁边看,差异会更清楚:一个面向生产端,一个面向消费端。OpenAI、Anthropic做的是替代人工操作软件,产出符合工业标准的工程文件,服务专业创作者的生产流程。 字节的空间模型直接产出可观看、可交互的体验,服务直播、短剧、游戏这类大众内容场景,离终端用户更近,还能倚仗抖音/TikTok的内容生态、即梦/小云雀等创作者工具和Pico的硬件终端,形成从生成到分发的完整闭环。 原生世
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱