首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

具身江湖志(四):它们,把机器人的大脑做实

2026-09-01 1 阅读 约10分钟阅读 脑极体
分享:
字号:
文 | 脑极体 越来越多的人,开始对机器人祛魅了。 过去两年来,在舞台上完成一套完整的表演,被认为是机器人技术的大进展。如今人们已经不会再轻易地被这些漂亮的机械动作打动,反而开始普遍追问:这些机器人到底能有什么用,动作是不是编好的,究竟能帮我做什么?恰恰说明具身智能行业正在进入一个关键的转换期。 成功跨越周期的企业,必须具备一个杀手锏:大脑。 在许多炫酷的赛场,我们都可以看到机器人是由人类工程师去遥控的,动作也是预设的。在预设框架内,再由AI策略自主执行,这已经是行业里比较先进的形态。 但是,在人类的指令下完成预设的动作,这并不意味着机器人能够理解环境,也不意味着它能够在陌生的环境当中自主地完成任务。这样的机器人,当然只能在特定场景,比如说工厂、园区、公园等,执行一些有限的任务。 可能有人会问,现在的工业机器人,已经能够稳定地在汽车工厂、电子工厂中承担一些焊接、搬运、装配等工作。这种场景下,根本就不需要大脑呀。 但只是那样的话,具身智能就跟传统的机器人产业或自动化没什么太大区别了。 具身智能这个概念之所以成立,就是机器人到了一个陌生的环境下,能够自主决策、自主识别、自主行动,把过去的经验迁移到新的任务,还需要能够从失败中学习,成为真正的通用机器人。换句话说,没有大脑,具身智能这个概念都会被直接证伪。 由此可见,具身智能行业从比拼身体展演,转向比拼谁的大脑更强。甚至可以说,有没有大脑,将是具身智能公司的斩杀线。 那么,谁正在这条“大脑派”的路上狂奔呢? 或许你看了今年的机器人运动会、机器人马拉松,觉得现在的机器人进化得太厉害了,能组成队列,跑得飞快,还能拳打老师傅。机器人是不是快把人类取代了?那可以放心了。 其实,人形机器人的智力,还停留在不如一只边牧的水平。 在2025年的机器人世界大会上,一位具身智能公司的创始人就说过, 目前机器人的底层模型普遍采用VLA模型,就是相对傻瓜式的架构。 卡内基梅隆大学教授、Skild AI联合创始人Deepak Pathak也认为,机器人对物理世界缺乏真实理解。 由此可见,很多机器人看起来惊艳,但实际上只能照本宣科,人类指哪打哪。这恰恰说明了大脑是具身智能最有价值的部分,如果这一环做不出来,这一波人形机器人就只能是泡沫。 那让机器人长出脑子这件事情,为什么难做呢? 一是数据。 具身数据必须靠机器人与物理世界交互产生。谷歌曾组织16人团队,花了17个月,投入上千万美元,只采集了23万条真机轨迹。 二是封闭。 如此珍贵且稀缺的数据,各家公司好不容易积累起来,肯定不愿意共享,所以各家企业数据封闭成为具身智能的关键瓶颈。 三是仿真。 既然真实的数据如此稀缺,那么有些企业就选择了仿真,但是在仿真虚拟世界里面训练出来的机器人模型,到了真实的世界里就会遭遇sim-to-real的鸿沟。于是出现了世界模型这个方向,希望能够解决仿真问题。但是,世界模型只是构想,目前还没有明确的、可实现的工程突破。 让机器人真正长出脑子,行业内各有秘技。 既然数据是机器人智力的瓶颈,那么谁家的数据多,就像拥有了一个巨大的藏经阁,可以让自家的产品在里面自我修炼。所以,修一座数据的藏经阁,就是企业打造大脑的基础设施。 2025年1月,智元第1000台通用具身机器人量产下线。这些机器人既是产品,也是数据采集器,逐步形成了一个大力出奇迹的专有数据集AgiBot World,其中包含超过100万条真机轨迹、217个任务、5大部署场景,比此前任何公开数据集都大一个数量级。有数据显示,在这套数据集上预训练的策略,平均表现比在谷歌牵头的跨本体数据集OXE上,要高出30%。 真机数据的采集护城河很深,但是代价也比较大,数据得一条一条地采,每一次场景迁移都得重新采集,数据的扩张曲线是线性的,无法指数级增长。 这一重资产,智元正在一步步地积累。同时,也有人另辟蹊径去解决数据规模不足的问题。银河通用,就决定把合成数据,搬进机器人的藏经阁。 合成数据真的能达到真机数据的效果吗?2023年,银河通用团队的DexGraspNet,就是完全在仿真中构建的大规模灵巧手抓取数据集。发展到2025年,他们又更进一步构建了具有十亿级仿真抓取数据的SynGrasp-1B,GraspVLA就基于这一数据集训练,抓取成功率98.3%,实现了零样本泛化。 可以发现,合成数据这条路,银河通用走了很多年。之所以如此坚持,是他们发现,具身智能所依靠的数据,99%可以借助高质量合成数据完成,只有在合成数据无法处理时,才需要采集使用那1%的真实数据。 举个例子,在零售场景中,让机器人按顺序抓取货架上的矿泉水,先通过百亿级别的合成仿真数据完成预训练,然后只需一个人一天的真机数据,即可完成微调,合成数据的边际成本趋近于零,这种成本结构对中小型具身智能企业非常有吸引力。 总之,真机数据就像是历年的高考真题,让机器人经历真实的考试;合成数据就像是名师出的《三年模拟》,可以让机器人大规模刷题。显然,高质量的模拟题也不是谁都能出的。 合成数据需要很好的图形学、物理仿真、物理渲染和自动动作合成管线,并不断校准仿真与现实之间的差距,这些都需要长期的积累。 无论是现实世界的真题,还是仿真世界的模拟题,都是机器人大脑不断进化的藏经阁。唯有在大量任务、交互、失败和反馈中,机器人才能走向真正的智能化。 在全球具身智能赛道上,Physical Intelligence是大脑派的极端样本,不造机器人的本体,只专注于模型本身。PI提出了一个发现,或许不需要依靠很多的数据,通过架构层面的设计,再结合在线强化学习迭代,一样可以让机器人连续工作几个小时。 这就像是降龙十八掌,通过一套动作的衔接与设计,叠加起来,发挥出比实际内力更强大的作用。所以,如果架构设计好了,大脑需要的数据比想象中少得多。 但是设计一个好的架构并不容易。以星海图为例,研究团队来自Waymo、Momenta 等自动驾驶厂商,在AI算法架构设计上独善战场。2025年开源了G0,采用双系统VLA设计,其中System 1用扩散模型学细粒度动作执行,System 2是VLM,负责高层多模态规划,这一系统曾一度是行业的主流。 然而到了2026年,星海图G0.5的架构发生了一个巨大的转变,放弃了双系统的分离式设计,选择将具身推理和控制统一到单个自回归序列中,单个模型在统一token流中完成推理、规划和行动。 这样做的好处是让语言模型直接说出动作,推理与行动一口气完成,这样机器人的动作表现就能完整继承大语言模型的scaling law,有望进一步增强机器人的物理智能。 当然,除了星海图的这条路线之外,行业内也有其他方向的探索。比如智元提出的ViLLA架构,则通过引入“隐式动作标记”(latent action tokens)这个中间表示,让VLM的语义知识能流进动作生成,模型先在语义空间理解了要做什么,再在潜空间翻译成怎么做,最后落到具体关节控制。人类视频、不同机器人的异构数据,全都可以喂给中间层学习。 这个方法的效果也比较好,首个基于ViLLA架构的通用具身基座大模型GO-1,在“倒水”“补货”等需要指令理解与位置泛化的任务上,成功率明显优于RDT和π0模型。 当然,目前机器人大脑的架构路线,还远没有定型。不过,至少共识已
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱