智能AI
morning
扶稳坐好,世界模型,元年已到
摘要
文 | 数字力场,作者 | 佘宗明 AI大佬杨立昆该偷着乐了——他断言的“LLM(大语言模型)只是过渡品,JEPA(联合嵌入预测架构)+世界模型才是通往AGI正途”,似乎正得到应验。 2026年被钉上“世界模型元年”的铭牌,即为印证。这不是我的“自定义”,而是很多实锤在现实墙面上砸出的标记。 2026年1月,谷歌DeepMind开放Genie 3公测,世界模型首次以可交互形态对普通用户开放;几乎同...
大语言模型
世界模型元年
腾讯开源混元3D世界模型2
世界模型
数字力场
佘宗明
AI大佬杨立昆该偷着乐了
他断言的
LLM
只是过渡品
2026-08-17
1 阅读
约10分钟阅读
数字力场
字号:
文 | 数字力场,作者 | 佘宗明 AI大佬杨立昆该偷着乐了——他断言的“LLM(大语言模型)只是过渡品,JEPA(联合嵌入预测架构)+世界模型才是通往AGI正途”,似乎正得到应验。 2026年被钉上“世界模型元年”的铭牌,即为印证。这不是我的“自定义”,而是很多实锤在现实墙面上砸出的标记。 2026年1月,谷歌DeepMind开放Genie 3公测,世界模型首次以可交互形态对普通用户开放;几乎同一时间,蚂蚁集团旗下灵波科技连续发布世界模型产品;4月,腾讯开源混元3D世界模型2.0;6月,蔚来向超70万用户推送世界模型驱动的端到端驾驶系统;7月,蚂蚁灵波在几天内连发六款模型,昆仑万维在WAIC上宣布2026年为“世界模型元年”…… 虽然时下“元年”二字已被滥用,可拐点是它最好的证明。众多迹象显示: 算力成本、模型连贯性、产业资本,三条此前各自爬坡的曲线,在2026年 正 同时跨过商用临界点。 说到这,有些人可能被动开启了“懵逼树上懵逼果,懵逼树下你和我”模式:什么大语言模型、世界模型、我秀我型? 让我用比豆包还直白还简单还不拐弯抹角的方式回答你:大语言模型“管”信息世界,最擅长跟咱们侃大山;世界模型“管”物理世界,能预判物体碰撞、行人动向、空间变化。 你让ChatGPT写出行车方案,它三两下搞掂,你让它预判出路边小孩突然横穿马路,它只能来上一句“臣妾做不到啊”。毕竟它能理解符号与文字,却不懂重力、碰撞、空间、时序。 而世界模型的核心能力,就是在数字空间复刻那套完整的物理规则。说人话就是:AI终于可以开始看懂我们身处的真实世界,明白原来牛顿的万有引力掌管着我们的日常。 被杨立昆、李飞飞们偏爱的世界模型,不算新概念,但2026年的特殊之处在于,世界模型不再是仅供演示的概念,而是三类普通人高频接触的产品标配:玩游戏时动态生成的无限开放世界、家用机器人提前预演的家务动作、自动驾驶车辆预判的千万种路况风险。 谷歌让普通人“创造世界”,蚂蚁让机器人“预演世界”,蔚来让汽车“预判世界”,这三件事接连发生,本就意味着:风,已经来了。 那,世界模型将如何改变我们的生活? 谷歌、蚂蚁、蔚来“让事情发生”的游戏、机器人、自动驾驶三个领域的变化,就可供我们窥斑见豹。 01 游戏,终于可以从“预制”变“现炒”了 如果你是个游戏老玩家,大概率都经历过“就这?”时刻:很多的所谓开放世界游戏,肝了200小时后,再无新鲜劲可言。二周目?不过是把同样的路再走一遍、跟同样的NPC说同样的话,。 没办法,当下游戏多是预制——包装得再精美,地图都是开发者提前设计的,NPC台词都是照剧本来的,咱们能走的路、能进的门、能看到的风景,都在设计文档里画好了边界。 我不是针对某款游戏,我是说绝大多数都是。 听到这,你是不以为凡游戏“预则无味,不预则废”? 谷歌拍了拍我们,说“来感受疾风吧”,顺带着就抛出了Genie 3。 年初的Genie 3开放公测,就第一次让普通用户用“一句话生成一个能交互的3D世界”,摸到了“生成式世界”的门槛。 生成一个世界不难,难的是生成的世界有基本的物理常识——角色不能穿墙,重力依旧存在。你离开某个场景再回来,它能像DM(地下城主)那样,还记得之前有什么。 这绝对是游戏玩家的福音:它意味着,世界模型驱动的游戏,我们玩三遍,三遍是三个不同的宇宙,它可以没有固定剧情,没有预设结局,整个世界根据我们的行为动态生长。在这个世界里放了一把火,下次回来,那片废墟还在冒烟。 担心无“国服”版本的玩家也不用担心。昆仑万维推出的开源世界模型Matrix-Game,算是平替:它也能模拟复杂建筑的玻璃反光,还能跑GTA风格的大地图自由探索。 腾讯开源混元3D世界模型2.0,则让游戏开发者也有了趁手工具:因为它能把文字、图片、视频直接变成3D世界资产,跟现有游戏工作流对接。这么一来,游戏开发者以后可能就不用再从零开始建模,没准对着AI说“我要一座哥特式城堡”,再拿着AI生成的草稿精修,就行了。 你要说现在的世界模型游戏有多能打,倒也未必。毕竟还是“幼詹形态”,场景连贯性只能维持几分钟,实时交互延迟还太高,画面精细度离3A大作往往差着十个《荒野大镖客》。 但它指向的方向很清晰,那就是从“开发者给你一个限定世界”变成“AI给你生成一个无限世界”。方向已定,接下来就等技术成熟了。 等技术成熟后,被颠覆的恐怕不只是游戏行业,任何需要“构建虚拟空间”的场景,比如建筑设计师在AI生成的空间里穿行,导演在AI生成的场景里提前预览镜头,都能让世界模型帮忙。 单就游戏来说,我觉得,在游戏将来“主打现炒”后,玩法也会更多样,以后再“读档”可能就不是再回到某个存档点了,而是让AI重新生成一个类似但不同的世界,让咱再试一次。想象一下,玩《黑暗之魂》,每次死亡后BOSS战的场景布局都不一样,咱是不就能喜提无限重玩的乐趣了? 02 机器人 , 从仿真到逼真再到……“如真” 生活不止眼前的游戏,还有远方的诗和田野+手头的琐事。游戏世界模型能让咱们“无限流体验”一时爽,机器人世界模型则能让咱们拥有建国后成精的Robot。 现在的机器人,虽然扭起秧歌来比“四肢残废”的我好太多,但要论懂其中的力矩、角动量、摩擦力、惯性、简谐运动等基础物理知识,它可能得喊我一声“大哥”。 事实就摆在那:机器人在仿真环境里可以是王虹是邓煜,到了真实世界里就是数学“学废了”的世另我。 数据可以佐证这点:机器人在仿真环境中操控成功率能达到89.4%,但落到真实家庭场景,暴跌至12.4%。业界将其从仿真到现实的鸿沟称作Sim2Real Gap,我则称其为“另一个马里亚纳海沟”。 原因无他:仿真环境堪比无干扰温室,光线均匀得像摄影棚,物体摆放得整整齐齐,桌面平整得像乒乓球台。真实世界呢,往往糙很多:阳光可能在桌面上切出光斑,桌面上可能还有水渍,旺财可能突然从桌子下窜出来。 这就导致,仿真环境里训练好的机器人,就像只在恒温泳池里练过游泳的选手,第一次下海就被浪拍懵了——乘风破浪不了一点。 机器人训练师不是没想过解法,但方式也很原始:让它在真实环境里反复试错。学开门就摔一千次门,学抓杯子就碰碎几百个杯子。 但咱就是说,为了训练一个端茶机器人,让它在客厅里搞一万次破坏,这成本……是不是太高了? 世界模型提供了另一种解法: 让机器人在虚拟世界里 “ 脑补 ” 无数次真实场景,学会应对各种意外,再回到现实。 那些试错不需要在真实世界里发生,世界模型帮它在脑子里跑完。预演完后,带着经验回到现实。 清华大学FIB-Lab的研究就认为,用合成数据训练的机器人策略,真实世界表现有显著提升。划重点:“显著提升”,以后要考。机器人表现从“真的难用”到“勉强能用”再到“十分好用”,产业才能实现实现指数级爆发。 国内在这条路上跑得最猛的,是蚂蚁集团旗下的灵波科技。虽然才成立才1年半,但它已经拿出了覆盖机器人从看到动的十余款模型。 上个月更是猛:灵波几天内连发六款模型,覆盖视觉、空间感知、VLA(视觉语言动作)、世界模型和世界动作模型。其中最值得关注的,是LingBot-World和LingBot-VA这对组合。 LingBot-World负责生成可交互的虚拟环境,第一代单次能生成接近10分钟的连贯视频。2.0版本更进一步,
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱