开发者生态
morning
机器人大脑之争进入深水区:为什么物理世界需要从头设计模型
2026-08-12
1 阅读
约10分钟阅读
华卫
字号:
作者 | 华卫 如果说今年WAIC最直观的变化是什么,具身智能的超强存在感无疑是其中之一。在H3馆内,超过200家具身企业的集中亮相,让这一领域第一次以成体系的方式出现,甚至被抬升至与智算并列的核心赛道之一。 与往年相比,一个重要的变化正在发生:“表演型机器人”不再是主角,搬运、巡检、分拣、整理等更贴近真实场景的能力展示显著增多。决定机器人从“可看”走向“可用”的关键变量,是那个不那么直观的部分:“机器人大脑”。 今年以来,围绕VLA与世界模型的技术路线讨论持续升温。此前,蚂蚁灵波首席科学家沈宇军提出过一个颇为直接的判断:将数字世界的视频模型通过微调迁移到机器人场景,本质上仍是一种路径依赖,更像阶段性的“捷径”,而非面向物理世界的终局解法。这一判断来自一位生成模型出身的研究者,也让“具身原生”这个概念有了更加具体的技术含义。 沈宇军的判断并不只是一句路线主张。本届WAIC前夕,蚂蚁灵波发布了全栈大脑 2.0,一次推出 6 款模型,覆盖从空间智能、灵巧操作到环境反馈的全链路,让机器人看得更清楚、想得更明白、干得更利索。其中,LingBot-VA 2.0 是行业首个具身原生世界动作模型。 按照沈宇军的解释,在终局架构尚未确定时,蚂蚁灵波选择先把感知、对齐、预测和行动等能力拆开验证,再寻找融合方式。“全栈”解决的是怎么拆问题,“原生”解决的是从哪里开始——数据、训练目标和模型架构,都要服务于机器人在物理世界中的感知与行动需求。 日前,蚂蚁灵波宣布启动融资,首轮拟募资15亿元,并计划于年底完成第二轮融资。消息一出,行业目光随之聚拢。蚂蚁灵波以“全栈大脑”践行“具身原生”的技术路线,也由此迎来更公开的行业检验。 下面是我们在WAIC现场与沈宇军展开的一场专访对话,试图追问几个更深层的问题:具身数据的标准为何迟迟没有收敛?VLA 和 VA路线并行探索的终极目标是什么?“具身原生”为何要从头开始? 以下是对话的实录整理: 具身数据的“新大陆”:难点、标准与数据飞轮 InfoQ:过去几年,大语言模型的发展依靠互联网几十年积累的数据红利,而物理世界的数据被您称为“新大陆”。那么要找到这片新大陆,当前最核心的难点是什么?目前行业有没有初步形成一些数据采集标准? 沈宇军:在具身智能赛道,数据还没有形成具体的标准。每一家公司想要的数据形式,包括包含哪些模态以及每种模态需要达到什么样的精度,都没有共识。例如,有的公司认为只需要头部一个摄像头就够了,有的走五指夹爪的路线,还有的采用遥操作。头部摄像头代表的模态是视觉。但即便是头戴式设备也分很多种:有些只配置上方两个摄像头,提供视觉和深度信息就足够了;有些则还需要增加更多摄像头,目的是获取头部位姿信息,会运行局部SLAM。 从头部的数据来看,我们到底仅需要视觉,还是也需要头部的位置信息?这是一个问题。关于手部,夹爪方案也面临同样的问题:到底只需要通过头部视觉看到手的骨骼就足够,还是还需要手本身的姿态信息,抑或进一步需要手部触觉?在模态尚不确定的情况下,很难谈得上形成标准化的数据采集方式并大规模落地应用。因此,数据采集目前仍处于行业共同探索哪种数据格式对机器人发展更优的阶段。 数据格式之所以还未形成共识,还有一个原因是技术路线本身也没有收敛。没有人确切知道大脑整个训练过程中到底需要哪些模态。第二,即使把模态确定下来,每种模态的数据到底需要达到什么样的精度或质量标准,也尚未确定。近期感受较深的是手部位姿这件事情,有的人要求毫米级精度,有的人要求厘米级精度,到底需要什么精度,目前大家也还在探索。可能大家普遍认为精度越高越好,但精度越高必然带来成本越高,成本越高就越难规模化。那么,如何在精度也就是数据质量和成本之间取得平衡?这是一个非常关键的问题。 整体而言,数据之所以难以收敛,原因在于数据迭代与模型迭代是高度耦合的。目前行业还存在一个断层:做数据或传感器的团队可能有自己的一套指标体系,但做模型的人对数据却有不同的关注维度。假设一个数据有十个维度可以优化,而模型可能只重点关注其中五个。理想情况下,如果数据要与模型健康共生发展,就应该重点优化那五个维度。但现在做模型的人也提不出哪五个维度是最重要的,因此做数据的人只能尽可能地把所有模态、所有指标都向前推进。但全面推动就会导致成本急剧上升。所以核心还是标准未定,因此很难做取舍,这是当前的一个现状。 InfoQ:目前机器人涉及的数据大概包括遥操数据、第一人称数据和仿真数据。蚂蚁灵波本身也在数据训练和采集方面有所布局,那么在这几类数据之间,您会如何做取舍?如何在数据质量和成本之间寻找平衡? 沈宇军: 我们当前主要采用的是真实数据,但真实数据不完全等同于真机数据。我们认为有两类真实数据更为关键。第一类是真机遥操作数据,因为无论模型优化到什么程度,这一类数据都很难绕过。机器人毕竟要在物理世界中执行任务,它的大脑必须熟悉自己的身体。熟悉身体最好的方式,就是直接获取从身体本身采集到的数据。这一类数据可能不需要体量非常大,但质量要求非常高。 另一类需要上量的是真实的无本体数据。例如通过第一人称设备采集的数据,或者现在很多人使用的夹爪采集的数据,未来可能还会有手套方案。这类数据同样比较珍贵,因为它代表了人类最真实的行为方式,也就是人如何去做一件事情。例如,在仿真中我们也会让机器人去执行任务,但机器人的动作方式与人的下意识反应有时并不相同。因此,这一类数据非常关键,而且它比真机遥操作数据更容易上量。 互联网数据可以作为打底的数据。但互联网数据在向物理世界迁移时,有些模态是无法补全的。不过互联网数据体量大,而且确实蕴含了一定的知识,这可能是我们在模型训练阶段会重点关注的数据类型。 InfoQ:行业最近也在大量讨论仿真数据。对于具身智能来说,仿真是否会成为解决数据问题的重要路径?对于希望做通用机器人的方向,仿真数据是否更有价值? 沈宇军: 我认为,如果解决的是一个具体场景的问题,比如自动驾驶领域,仿真用得比较多,因为这是一个场景相对明确、任务也比较清晰的领域。在这种情况下,为它专门开发一套仿真系统,包括物理引擎等,是划算的,目的就是把这一类场景做得非常扎实。从这个角度看,无论是将仿真数据引入训练,还是用仿真来做评测,都是非常合理的。 但灵波的定位是希望做通用机器人。对于通用机器人来说,如果希望它完成各种各样的事情,而为了每一类事情都去构建一套仿真环境,我认为就有些过于沉重了。短期内,还没有出现一个真正优秀的仿真引擎,能够支持完成所有任务。而且从成本角度来看,构建仿真并不一定比获取真实数据更划算。此外,在采集数据时,我们仍然关心人是怎么做一件事情的。比如打开一瓶水,人可以有很多种方式,但在仿真里很难模拟出人最真实的反应,也就是拿到一瓶水后下意识会做什么动作。所以从这个角度讲,从人出发或者说“以人为本”的数据,在模型训练尤其是预训练阶段可能更为关键。 InfoQ:大语言模型的发展证明了数据红利和scaling law释放了巨大潜能。但物理世界的数据更加碎片化。具身智能的数据飞轮什么时候可能出现?未来机器人是否有可能不需要针对每一个领域、每一个场景单独采集数据,就能够获得泛化能力? 沈宇军:从整体来看,我对此还是比较乐观的。乐观的原因在于,前面提到数据标准不
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱