首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
游戏 morning

具身智能凭什么跑出比OpenAI更贵的公司?|AI100闭门会

摘要

现在谈商业化,还早。 “把‘世界模型’四个字遮住,然后具体说,你到底在做什么。” GPT-6、世界模型、VLA、自进化都在争夺机器人的“大脑”。但一颗真正能干活的大脑,到底靠什么长出来? 世界模型,正在成为具身智能最热的几个词之一。 做视频预测、仿真、机器人动作生成的都在谈世界模型。 另一边,GPT-6直接接上机器人做真机测试,大家开始讨论: 既然语言模型已经拥有很强的推理、记忆和规划能力,它能不...

世界模型 GPT 四个字遮住 VLA 在他看来 现在谈商业化 然后具体说 你到底在做什么 自进化都在争夺机器人的 但一颗真正能干活的大脑
2026-09-24 1 阅读 约10分钟阅读 虎嗅
分享:
字号:
现在谈商业化,还早。 “把‘世界模型’四个字遮住,然后具体说,你到底在做什么。” GPT-6、世界模型、VLA、自进化都在争夺机器人的“大脑”。但一颗真正能干活的大脑,到底靠什么长出来? 世界模型,正在成为具身智能最热的几个词之一。 做视频预测、仿真、机器人动作生成的都在谈世界模型。 另一边,GPT-6直接接上机器人做真机测试,大家开始讨论: 既然语言模型已经拥有很强的推理、记忆和规划能力,它能不能直接接管机器人的“大脑”? 投资人邱谆提了一个判断项目真正“含金量”的简单方法: “把‘世界模型’四个字遮住,然后具体看,它到底在做什么。” 能不能看懂物理世界、预测一个动作的结果?能不能做决策,并在真机上跑通?第一次失败以后,下一次能不能做得更好? 机器人大脑究竟怎样才算成立? 本期虎嗅AI100闭门会,我们邀请了: 章鱼动力世界模型合伙人 陈文科 华映资本海外合伙人 邱谆 域变换联合创始人、南京大学特聘研究员 吴昊 墨奇智能世界模型负责人、复旦大学可信具身智能研究院助理教授 吴桐 和主持人宋思杭,从模型研发、资本、自进化和学术前沿四个视角展开了一场讨论。 整场下来,有5个判断值得继续追踪: 1. 别只看“世界模型”名字,机器人大脑最终比的是干活能力。 2. GPT-6证明语言智能很强,但物理智能不能只靠语言长出来。 3. 比起Demo,预测、决策、真机闭环,才是大脑的三道真考试。 4. 越接近真实部署,大脑越离不开身体:模型、本体、控制必须协同。 5. 下一家高估值公司,可能来自现有玩家, 也可能来自一条新路线。 先遮住“世界模型”四个字 讨论一开始,第一个问题就是:世界模型到底是什么? 陈文科给出的定义相对底层。 在他看来,世界模型首先要和“世界”真正发生关系:它需要能够 预测未来世界 ,同时对时间上的因果关系进行推演。 比如:机器人推一个杯子,接下来杯子会往哪里移动;夹爪改变力度之后,物体状态会如何变化。 吴昊进一步把这件事提炼成三个问题: 1、能不能预测未来? 2、预测结果能不能帮助决策? 3、 决策最后能不能在真机上闭环? 如果只能生成一段漂亮的视频,却不能帮助机器人做下一步决定;或者模型能输出一个判断,却无法在真实机器上执行和验证,那么至少从具身智能角度,它距离大家真正期待的那颗“大脑”还有很长距离。 而邱谆的视角更加务实:在投资中,他并不太关心一家公司的技术是不是被归类为世界模型。 VLA、预测视频、预测行为、做因果建模都各是一条路线。 在今天行业里 有人把世界模型当作技术手段,有人把它直接当作最终目标,语境很容易混淆。 于是他提出: 先把“世界模型”四个字遮住。 近十年前看“元宇宙”也是类似逻辑。 一个宏大概念越试图覆盖所有东西,它本身提供的信息反而可能越少。 把这个大词拿掉,看下面究竟是在做 VR、游戏,还是区块链,才真正清楚。 世界模型也是一样。 吴桐从技术上补充,今天具身行业真正讨论的,更多是视觉世界模型,它大致分成两条路: 一类用视频预测动作对世界状态产生的变化、帮助训练和评估机器人的策略; 另一类让视觉预测直接参与动作生成。 但广义上来看,语言模型也可以被认为是一种世界模型。 所以更准确的问题是: 世界模型,到底给机器人大脑增加了什么能力,以及一颗机器人大脑到底需要什么? GPT-6很强,但机器人大脑不能只靠语言长出来 GPT-6让这个问题变得更加尖锐。 过去,大语言模型和机器人之间还有一道相对清楚的边界:语言模型负责理解和推理,具身模型负责动作。 但当通用大模型开始直接接入机器人以后,问题出现了: Language已经这么强了,还需要单独做具身大脑吗? 陈文科的回答,从底层出发: 语言到底离Action有多远? 他用三个字母拆机器人大脑:L、V、T。 L是Language,语言; V是Vision,视觉; T是Tactile,触觉。 经历过语言模型和视频生成模型的Scaling后,在他看来,GPT-6最重要的意义之一,是再次说明了一件事: 当模型Scale到一定程度,确实可能自然涌现出新的能力。 但这并不等于:Language Scaling可以直接换成Action能力。 (Scaling,指通过扩大模型、数据与计算等规模持续提升能力) 他举例:一个人伸手拿起水杯,不需要先在脑子里用语言描述一遍:“我要把手移动到杯子旁边,再抓住它。” 很多物理动作,本身不以语言作为最直接的中介。 因此,他判断, L更适合理解、规划和长程任务拆解;真正直接连接物理世界和机器人动作的,是V和T。 机器人首先得“看见”。 物体在哪里、姿态如何、动作以后环境发生了什么变化,都需要视觉持续反馈。 但只有视觉不够。抓一个水瓶时,力是不是太小、瓶子是不是正在往下滑、接触面发生了什么变化,这些都和触觉、力反馈有关。 所以真正进入物理世界以后,机器人大脑需要解决的不是一个单纯的“语言推理”问题,而是: L、V、T最终怎样共同作用于Action(动作)。 吴桐团队对GPT-6的真机测试,恰好给这个判断提供了另一侧的观察。 在她的体验里,GPT-6确实表现出了一些过去VLA或World Action Model很难获得的能力: 更强的指令泛化、In Context Learning,以及长程任务中的理解和交互。 它可以把一个复杂目标拆成若干步骤,做完一步之后重新观察,再继续判断下一步。 这是GPT-6非常强的地方。 但它的局限也同样明显。 第一是 实时性。 云端大模型可以慢慢推理,但机器人在现实中需要快速反应,不可能每执行一步都停下来长时间思考。 第二是 视觉反馈仍然不可替代。 吴桐在真机测试中观察到,当摄像头被部分遮挡,相当于把模型的“眼睛”蒙住以后,任务表现会明显下降。 GPT-6能够理解自己想做什么,却不意味着它有一个完整的“动作之后世界会如何变化”的物理模型。 因此,她认为,一个现实方向可能是: 大语言模型承担更高层、更低频的System 2; VLA或者World Action Model承担更快、更贴近动作执行的System 1。 这也让GPT-6真正带来的变化变得更加清楚。 它推进行业重新回答: 一颗机器人大脑里的理解、规划、视觉、触觉和动作,究竟应该怎样分工。 语言智能可以帮助机器人想明白。 但物理智能最终还得让它看见、感受到,并真正把事情做完。 从Demo到部署,“大脑”要自进化,也要数据和Infra 今天判断一个机器人是不是“聪明”,最直观的方法仍然是看Demo。 但最多证明: 它在这个环境里,曾经把这件事做成过。 但是在真实环境中,换一张桌子、材质、灯光,甚至本体之后还能不能做,Demo回答不了。 吴桐给出的技术标准很直接:如果是World Action Model(世界动作模型),就要看生成的策略能否在真实环境里稳定、安全、高成功率地运行;如果是世界仿真器,就看它有没有真正让后续的策略训练变得更好。 而吴昊提出真实世界非常长尾和开放,大脑在真实环境中的交互,难以通过单纯的模型预训练来解决。 大脑若想真的走向真实环境中的部署,需要在物理交互中持续进化。 吴昊所在团队做具身自进化,想解决的正是Demo和真实部署之间的断层。 他现场用了一个很直观的假设: 如果一个模型今天只有40分,
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱