首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
游戏 morning

一个持续活着的 AI 世界,到底难在哪?

摘要

在《黑客帝国》里,The Matrix最可怕的地方,不是它能生成一个逼真的世界,而是可以让这个世界一直运行。 红绿灯照常切换,汽车驶过街口,尼奥可以推开任意一扇门,走进任意一条街,只有当规则偶尔失效、系统露出破绽,人们才会意识到,眼前的现实其实是一套代码。 二十多年后,实时世界模型已经开始靠近这个想象的一部分。模型可以实时生成道路、建筑和人物,用户也可以进入其中移动、探索,甚至直接改变接下来发生什...

The PixVerse 黑客帝国 Matrix最可怕的地方 不是它能生成一个逼真的世界 而是可以让这个世界一直运行 红绿灯照常切换 汽车驶过街口 尼奥可以推开任意一扇门 走进任意一条街
2026-09-23 1 阅读 约10分钟阅读 虎嗅
分享:
字号:
在《黑客帝国》里,The Matrix最可怕的地方,不是它能生成一个逼真的世界,而是可以让这个世界一直运行。 红绿灯照常切换,汽车驶过街口,尼奥可以推开任意一扇门,走进任意一条街,只有当规则偶尔失效、系统露出破绽,人们才会意识到,眼前的现实其实是一套代码。 二十多年后,实时世界模型已经开始靠近这个想象的一部分。模型可以实时生成道路、建筑和人物,用户也可以进入其中移动、探索,甚至直接改变接下来发生什么。但今天的实时世界模型,还很难做到基础的一点:让这个世界持续存在。 爱诗科技最新发布的通用实时世界模型 PixVerse R2,值得关注的也在这里。它并不是简单增加某一种玩法,而是尝试把移动、改写、叙事和角色互动放进同一个持续运行的实时世界里。 上线后,PixVerse R2 迅速登上twitter 热度总榜第二名的位置,获得了海外用户极高的关注度 从用户能够感知到的体验看,大致可以拆成三层。 第一层是实时探索。 相比今年年初首发的PixVerse R1主要通过提示词改变后续画面,R2加入了方向移动、镜头控制、跳跃等更接近游戏的操作。比如在一段滑雪Demo中,人物可以持续向前滑行,也可以随时改变方向。随着视角和路线变化,远处的雪道、山体和环境继续生成。 第二层是实时改写世界。 用户不只决定“往哪里走”,还可以在世界运行过程中继续改变它。例如让R2生成一个繁华都市的街头夜景,用户可以临时要求下雪,也可以让一名路人出现并上前问路。模型需要尽量保留原有街道、人物和空间关系,同时把新的天气、角色和事件加入其中。 第三层是持续叙事和角色互动。 在互动Demo《Zero Mark - 零印法师》中,玩家可以在场景里漫游、召唤怪物、许愿,也可以与其中的角色直接交谈。模型不仅要决定下一帧长什么样,还要记住人物身份、剧情进度和此前发生过的事件。 为了支撑这些体验,R2还增加了一层更底层的能力:多模态、低延迟输入。文字、语音、图片参考、方向键和镜头控制可以共同进入系统,而不同信号对应不同的响应速度——转向、移动需要即时反馈,复杂文本指令则可以留给模型更长的处理时间。 这些能力单独看都不算新,真正的难点在于,它们要同时作用在一个持续的世界状态上。 这也是实时世界模型真正值得想象的地方。 如果一个生成出来的世界能够持续存在、接受人的输入,并根据新的行为不断往前演化,它就不再只是生产视频的工具,而可能成为一种新的数字环境。游戏不必预先写完所有地图和剧情,影视内容可以随观众选择实时展开,数字人、虚拟空间乃至机器人的训练环境,也可以从“被提前制作”变成“边运行边生成”。 The Matrix当然仍是遥远的科幻想象,但通往那种世界的第一步,或许并不是把画面做得更逼真,而是先让一个生成出来的世界真正“活下去”。 一个世界为什么很难既聪明,又跑得足够快? R2被定义为“实时世界模型”。 “实时”意味着,这个世界不是提前生成完再交给用户,而是跟着人的操作继续往前走;“通用”则意味着,它不只服务于某一种场景。用户可以在里面移动、转向,也可以临时改变天气、加入角色,或者让故事继续发展。 通用实时世界模型每生成一步,都要把刚刚发生过的事情带到下一步里,这条路在哪里、这个人是谁、刚才发生了什么、用户现在又想做什么。 时间越久,链路越长,技术上面临的难度就越大。 一方面是“一致性”。 模型需要记住越来越多过去的信息。一个角色不能走出镜头再回来就换了衣服,一栋建筑不能转过身就消失,已经发生过的剧情也不能被下一轮生成覆盖掉。前面的输出还是后面的输入,一个小错误如果没有被及时纠正,也可能一路积累下去。 另一方面是速度。 世界越复杂,需要同时维护的状态越多,计算量也越大。但实时交互留给模型的时间非常有限。生成视频慢十几秒,用户可以等;聊天模型停顿一两秒,也还能接受。但如果按下方向键后,几分钟人物才开始移动,这个产品就很难再被称为“实时”。 过去两年,不少团队都在模型能力和速度上做取舍。 Google DeepMind在2025年发布的Genie 3,已经可以用720p、约24帧的速度实时生成环境,并把一致性维持数分钟。用户也可以临时改变天气、加入物体。但DeepMind同时承认,它目前能够处理的动作空间仍然有限,多角色交互和更长时间运行也没有完全解决。 Odyssey选择了另一种方式。Odyssey-1最快可以做到约40毫秒生成一帧,并连续运行5分钟以上。为了让世界不那么容易在长时间生成中“跑偏”,团队主动把后训练的数据分布收窄了一些。但代价也很直接,模型更稳定了,但能处理的世界更窄。 World Labs在做RTFM时,要求单张H100上就要达到可以交互的帧率。但这个要求反过来影响了整个系统设计,它没有让模型无限读取此前所有画面,而是只调取与当前位置有关的空间记忆,以控制上下文和计算量。 这些方案技术上并不一样,但背后的逻辑是一致的:实时不是模型做好之后再考虑的性能指标,而是一条从一开始就存在的预算线。多少算力、多少延迟,基本决定了模型能记多久、世界能做多复杂、用户可以做多少事情。 很多时候,先决定的不是“世界能有多大”,而是“机器能不能跑得动”。 这也是为什么过去不少实时世界模型最终都会在某个地方做减法:缩窄场景、减少动作、限制持续时间,或者降低模型规模。这背后基本是同一个思路:把系统压进实时的计算预算里,再在剩下的空间中增加能力。 R2想尝试的是另一种解法。 根据爱诗科技公开的技术路线,它先扩大模型能够处理的任务、模态和时间尺度,再想办法把同一个模型压进实时运行的延迟范围,而不是一开始就针对某个场景训练一个更小、更窄的模型。 这并不意味着通用和实时之间的矛盾已经被彻底解决。R2在复杂场景细节、物理一致性和更长时间运行上,仍然有明显的提升空间。但它最起码验证了一件事,一个实时世界,不一定先要把自己做小。 R2没有缩小城市,而是换了建城的顺序 R2背后,爱诗做了一个反直觉的选择。与其一开始就在速度和能力之间找一个折中点,不如先把两个问题拆开:基础模型只负责把世界做得足够复杂;等模型学会了,再解决怎么让它跑得足够快。先穷尽能力边界,再攻克效率边界。 R2主要有两个核心训练阶段。 第一阶段是Omni Causal AR。爱诗先训练一个统一的因果世界模型,让它吸收更多视频、任务和交互轨迹,同时把文本、参考图、声音、WASD等性质差异很大的信号,放进同一套模型中处理。 这一阶段的核心是Scaling。R2的Scaling并不只发生在参数规模上,而是同时扩展五个维度:模型容量、数据、任务、控制信号和时间尺度。训练对象从几秒钟的独立视频,延伸到连续长视频和多轮交互;模型需要学习的,也从“下一帧长什么样”,变成“在此前已经发生这些事情之后,世界接下来应该如何变化”。 这首先会带来两个现实问题。 一个是,不同指令发生在不同的时间尺度上。按下方向键之后,几十毫秒内就需要得到反馈;但一句“让天空开始下雪”,影响的却可能是之后数秒的世界。如果把所有交互都切成相同长度的生成单元,要么简单动作响应过慢,要么复杂事件无法完整展开。R2因此引入Dynamic Chunk,让方向移动等简单操作使用更短的生成单元,完整事件则保留更长的时间窗口。 另一个问题是记忆。世界持续运行之后
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱