智能AI
evening
模型路线趋同之后,Physical AI的胜负手变了
摘要
模型路线趋同之后,Physical AI的胜负手变了 杰西卡 2026-08-10 17:20:50 来源: 量子位 杰西卡 发自 凹非寺 量子位 | 公众号 QbitAI 新的物理AI瓶颈出现了。 过去一年多, VLA、世界模型、基座模型、数据闭环 等等,几乎都是头部智驾和具身智能公司频频提及的热词。 越来越多AI公司开始尝试让模型进入真实世界,让机器具备理解环境、预测变化和执行行动的能力。 不...
图片由AI生成
杰西卡
量子位
VLA
世界模型
模型路线趋同之后
Physical
AI的胜负手变了
2026
凹非寺
2026-08-10
1 阅读
约9分钟阅读
杰西卡
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 模型路线趋同之后,Physical AI的胜负手变了 杰西卡 2026-08-10 17:20:50 来源: 量子位 杰西卡 发自 凹非寺 量子位 | 公众号 QbitAI 新的物理AI瓶颈出现了。 过去一年多, VLA、世界模型、基座模型、数据闭环 等等,几乎都是头部智驾和具身智能公司频频提及的热词。 越来越多AI公司开始尝试让模型进入真实世界,让机器具备理解环境、预测变化和执行行动的能力。 不同技术路线各有侧重,最终穿透到技术底层,指向的问题却越来越趋同—— 那就是AI如何从真实世界获取数据,如何形成对环境的理解、把理解转化为行动,又如何根据行动结果继续学习。 这个问题,并不是今天才出现。 而当路线逐渐收敛,真正的瓶颈也开始浮出水面。 物理AI路线图收敛,暴露「断裂层」 智能驾驶兴起至今,研究对象曾历经多次变迁。简单梳理下来可分为三个阶段: 早期的驾驶系统,是一套 高度模块化 的软件系统。 感知 负责识别车辆、道路和行人, 预测 负责推测其他交通参与者的运动, 规划和控制 再决定车辆的具体行动。 每个模块解决一个相对明确的问题,也拥有相对独立的指标。 端到端模型 盛行后,行业开始减少人工规则和模块接口,让模型 直接从传感器输入生成轨迹或控制信号 。 △图片由AI生成 直到 物理AI 热潮席卷,又把研究对象向前推进了一步。 在这一目标下,行业逐渐分化出了不同的主流技术表达,当前已大致收敛成 两条明线加一条暗线 。 两条明线中,其一是 VLA (视觉—语言—动作),把视觉信息、语义理解和行动生成放进同一个模型体系,让AI看到环境、理解场景,直接作出行动。 理想、小鹏 都押在这一路线上。 另一条明线以 世界模型 为核心,重点学习环境如何随时间和动作发生变化。 世界模型进入场景生成、闭环仿真、数据生产和模型评测等环节,既可以帮助模型学习物理世界的演化规律,也能为其他行动模型提供训练和验证环境。 △图片由AI生成 华为WEWA、蔚来NWM 都是世界模型路线的代表。 而在VLA和世界模型之外,还有一条暗线是 物理AI基座 。 基座模型通过大规模物理世界数据预训练,学习环境变化、物体关系和世界运行规律,再通过少样本或后训练的方式适配不同任务。 △图片由AI生成 基座模型严格来说,与VLA、世界模型并不并列,而是两条明线共同奔赴的方向。 两条明线的边界肉眼可见地趋于模糊,二者间的关系已从路线选择走向能力协同。 △图片由AI生成 但结合现状来看,整合起来绝非易事。 当前,行业已经拥有这条链路中的大部分技术组件,然而各环节之间却还存在几层 “断裂” 。 第一层“断裂”发生在模型与数据之间。 物理AI需要海量真实数据,但数据规模扩大并不会自动产生对世界的理解。模型需要从数据中学习空间关系、时间变化、行为规律和行动后果。 模型在真实环境中暴露出什么能力缺口,又会决定下一轮需要收集、筛选或生成什么数据。 因此, 数据与模型之间需要持续反馈 ,由模型发现问题,数据系统补充相应场景,训练系统重新学习,再通过评测和真实环境确认模型是否获得了新的能力。 △图片由AI生成 第二层“断裂”发生在视觉与行动之间。 模型看见一个场景,甚至理解其中的关系,也不代表它能够形成稳定行动。 物理AI区别于传统AI最明显的一点,也正是视觉与行动之间的关系。 假设车辆识别出前方行人正在靠近路口,并判断对方可能横穿道路,接下来还有一系列问题需要解决,比如应该在什么位置开始减速,减速幅度多大,是否需要提前变道,周围车辆可能怎样响应,整个动作又能否在实时算力下平稳执行等等。 这一过程中,视觉和语义理解需要转化为连续、实时、可验证的动作。 VLA承担了连接认知与行动的任务,但这条连接仍然需要未来预测、策略训练、闭环评测和真实验证共同支撑。 第三层“断裂”位于模拟与真实之间。 世界模型和仿真系统可以低成本生成大量场景,用于训练、测试。 理论上,模型可以在虚拟环境中经历无限次测试,学习各种复杂情况,但真实世界的情况始终更加复杂。 交通参与者的行为往往具有不确定性,传感器会受到天气、光照和遮挡影响,大量长尾事件很难被仿真系统完整建模。另外,模型在虚拟环境中的提升,未必能够等比例转化为真实表现。 物理AI必须要建立起一条双向链路:真实世界中的问题进入仿真和训练,仿真中获得的能力再回到真实环境验证。 这些横亘在数据、认知、行动和真实世界之间的断裂层,横跨数据、算法、仿真、Infra、产品和工程团队,看似属于不同技术方向,实际上都指向同一个问题—— 物理AI需要一套能够持续学习和进化的系统 。 这已经很难由某一个独立模型解决。 由此,技术问题开始越过技术部门边界,延伸到技术如何被组织,放进同一个闭环。 弥合断裂层,消除接缝构建闭环 现下,物理AI公司的当务之急,就是如何弥合断裂层,把整条链路放进同一个研究闭环。 不过在建立闭环之前,还需要解决研发体系中的两层 「摩擦」 。 第一层摩擦发生在 技术之间 。 模型暴露出的不足,需要能够反馈给数据系统;真实环境中的问题,需要能够进入仿真和训练流程;训练后的能力,也需要重新回到现实场景接受检验。 真正的难点在于,这些环节并不是彼此独立存在的。任何一个环节连接不畅,投入再多的数据、算力和模型规模,也可能只带来局部指标的提升。 第二层摩擦体现在 研发组织内部 。 通常来说,一家公司的基础模型、VLA或世界模型、数据、仿真和AI Infra等内容会由不同团队负责。 每个团队拥有自己的专业目标和工作节奏,但矛盾就在于,完整闭环要求所有环节围绕同一个模型问题快速反馈。 现实中,这几个环节往往很难天然对齐。 所以, 技术闭环 说到底,最终需要对应的还是 组织闭环 。 在这一行业困局下, 国内首个面向物理世界基础能力研究的AI Lab——Superfluid Lab ,出现了。 实际上,Superfluid Lab并非师出无名,而是来自国内头部AI玩家、以智驾技术起家的深圳公司 元戎启行 ,且由 前DeepSeek核心成员、元戎启行首席科学家阮翀 带队。 实验室的名字其实很有意思。“Superfluid”意为 超流体 ,是一种完全没有黏性的奇特物质状态,可以理解为一种 “无视”摩擦力 的流体。 由于完全没有摩擦力,超流体可以在环状容器中永无止境地流动,而不会损失任何能量;也可以零阻力穿过极其微小的缝隙。 最先让Superfluid Lab出圈的,实际是元戎在7月29日发布的一篇名为 《对话Superfluid》 (以下简称《对话》)的文章。里面提到了名字两层意思: 其一,是 信息零阻力流动,协作零内耗 。 其二,是进入物理世界的智能,同样需要一种 零摩擦的底层架构 。 这恰恰对应研发闭环所需面对的两层摩擦。 据知情人士透露,Superfluid Lab今年5月就已在元戎内部成立,目前完成了基础设施重构等早期工作。实验室以 基座模型 为研究核心,重点探索 VLA模型 ,同时推进 世界模型和多模态理解 。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱