智能AI
morning
对话维他动力秦海龙:具身智能真正难题不是让机器人「学会」,而是跨本体「继承」
2026-08-23
1 阅读
约10分钟阅读
机器之心
字号:
编辑|Youli 本届 WRC,人形机器人前所未有地密集。几乎每个主要展台都立着一副挺拔的「人形」—— 跑跳、挥手、抓取,行业似乎已经形成某种默契: 通向通用机器人的路,终点是人的形状。 维他动力也在大会上交出了自己的人形答卷:首款人形机器人 Vbot ATOM 首次公开亮相,并同步开启预订。 但 ATOM 并非从零起步的新项目,它身后,站着已经量产交付、走进真实用户生活的四足机器人「大头」,以及由此积累的真实数据与迭代闭环。 而这恰好击中了人形热潮下最容易被忽略的一个问题: 造出一副人形的身体,正在变得越来越容易;但装进这副身体的智能从哪里来? 如果每换一副身体、每添一个任务,都要重新采数据、重新训练,机器人的能力就永远被困在单机与单场景里。换句话说 —— 如果机器人换了一副「身体」,能否「继承」已经学会的智能? 在发布会上, Vbot 维他动力联创兼技术副总裁秦海龙 给出一个生动的场景案例:假设四足机器人、人形机器人同时进入一个会议室,任务是「找到水杯,并把它带回来」。 此时,空间一样、任务一样,截然不同的只有「身体」。那对于这些不同的本体而言,哪些能力可以相互「继承」?又有哪些能力需要基于各自身体,在真实物理世界中持续学习、迭代? 基于这一问题,维他动力提出了 「Vbot Embodied Genome|具身基因组」, 核心理念是: 让智能跨任务继承、跨本体进化。 围绕这一技术体系,维他动力同步公布了三大核心模型:负责多模态流式全双工交互与异步推理的 Vbot-OmniDuplex,负责动作条件未来预测与策略评估的 Vbot-WorldModel,以及共享策略骨干与多本体 Real-Sim-Real 进化的 Vbot-EvoMorph。 三者分别对应机器人智能链条中的三个关键环节:理解人、预测未来、适应不同本体,最终连接成一条完整闭环:前台持续交互、世界持续推理、本体持续进化…… 而在「具身基因组」发布的背后,一个更宏大的行业问题浮出水面:当具身智能加速走向物理世界,机器人所谓的「通用」,是否不仅意味着「一个模型覆盖更多任务」,更要追问「一套已经形成的智能系统,能否顺畅进入截然不同的物理身体」? 带着这些思考,发布会后,机器之心与 Vbot 维他动力联创兼技术副总裁秦海龙 聊了聊,剖析跨本体智能继承的技术机制、真实数据的稀缺本质,以及人形产品化的底层逻辑。 秦海龙拥有哈尔滨工业大学、新加坡国立大学及韩国浦项科技大学机器人学与计算机工程背景,具备十余年产业研发与技术管理经验,曾历任蔚来自动驾驶高级总监、千里智驾首席科学家,主导了多模态基础模型、强化学习及端到端技术在下一代智能驾驶方案中的工程落地。 今年 3 月,秦海龙正式加入维他动力出任研发副总裁,全面负责世界模型、空间智能、Agent OS 及人形机器人研发。其在自动驾驶领域沉淀的大规模量产、工程闭环与物理世界理解能力,正加速注入维他动力多形态具身产品的演进链路中。 机器之心: 从四足机器人「大头」到最新的人形机器人 ATOM,不同本体之间能够「继承」的智能有哪些? 秦海龙: 智能「继承」不能一概而论,而是分模块的: 第一是交互层,可以做到 100% 完全继承。 因为机器人与人的交互理解、成功与失败案例与物理本体形态无关,四足积累的交互数据可直接迁移到人形身上。 第二是策略生成与空间理解层,整体处于高度复用状态。 比如,移动导航任务,对空间动静态环境的理解、避障、通行判断等,四足与人形没有太大差异;操作任务上,我们采用无本体(Egocentric / 第一人称视角)基模路线,复用大量公开与合成数据构建基模储备,当前真正的瓶颈主要在真机后训练数据上。 第三是底层运控与强化学习层,表现为「隐空间共通,末端分叉」。 就是说,上层的隐空间理解、环境感知和控制逻辑是相通的,下层则由于关节自由度、拓扑结构、运动学不同,最终输出会分叉,需要依靠特定本体的适配层与强化学习(RL)来完成控制。 机器之心: 刚刚说到数据的稀缺,其实行业都在谈操作数据稀缺,在你看来,具身智能领域真正稀缺的数据到底是什么? 秦海龙: 行业目前很多采集方式依赖遥操,但 遥操数据本质上是专家数据,真正稀缺的是真实用户使用过程中产生的问题数据。 专家数据往往只能告诉机器人「在理想状态下应该怎么做」,但机器人进入真实环境后,会遇到大量训练阶段没有覆盖的问题:为什么这个动作失败?为什么环境发生变化?为什么用户需要介入? 这些真实反馈,才是推动机器人持续进化的重要来源。 因此,具身智能不能只停留在实验室或者仿真环境里,而需要进入真实用户场景,通过持续运行形成数据闭环。 机器之心: 那未来具身智能未来的终极竞争壁垒,到底是在大参数模型,还是在数据闭环? 秦海龙: 模型只是开始,真正重要的是,让模型进入真实环境,并在真实世界中跑通全链路闭环。 机器人不是单纯的软件系统,它需要模型、本体、产品和真实场景共同参与。模型需要通过机器人获得反馈;机器人需要通过数据持续优化;优化后的能力又需要重新回到产品。只有这个循环真正跑起来,机器人智能才能不断积累。 所以最终比拼的是公司整体的软硬件实力,谁能够把技术、本体、产品和商业真正「打穿」。机器人需要进入真实场景,那就意味着终端必须能够量产并进入真实生活 / 消费场景(从 1 台、100 台到 1000+ 台滚动起来),才能沉淀出有价值的真机反馈,所以这是软硬件工程与量产交付的综合能力,不是纯算法技术问题…… 机器人越来越「通用」,但换一副身体后很多能力仍要重来? 当前,具身智能行业对「通用」的追逐几乎成为共识:业界试图让单一模型覆盖多样任务,将跨场景的海量数据混合训练,并极力推动不同构型的机器人共享模型权重。 然而,这种照搬纯软件大模型的通用尝试遭遇了严峻瓶颈。核心症结在于,不同于纯数字世界中输入输出高度标准化的 Token, 机器人有一副置身于真实物理世界的「身体」: 四足、人形与轮足在自由度、关节拓扑、接触力学、惯性与平衡约束上截然不同。 因此,「学会一个任务」和「把能力迁移到另一副身体」,在物理底层是两个维度的问题。 维他动力意识到了这一断层,进一步追问: 除了模型权重和训练数据,还有没有更底层的东西可以被抽象出来,跨本体复用? 答案是:理解用户意图、规划高层任务、推演行动后果、评价动作价值,以及从真实失败中持续学习的进化机制…… 这正是「具身基因组」的核心逻辑: 它不是一组僵化的参数,而是一套跨任务可继承、跨本体可表达,并由真实物理反馈持续改写的同源智能体系。 其底层架构被组织为三条深度耦合的闭环: IRE 闭环(Interaction-Reasoning-Evolution): 实时流式交互与异步深度推理并行,并将人机交互沉淀为系统进化数据; GEO 闭环(Generation-Evaluation-Optimization): 策略生成候选动作,世界模型推演并评估未来,训练和离线评估持续优化策略; RSR 闭环(Real-Sim-Real): 真实日志重建物理世界,在仿真中进行大规模物理对抗与试错,再回流至真机验证。 其核心架构原则在于: 共享高层语义与空间理解,分化特定任务表征,独立底层本体控制。 下面,我们来具体看一下。 机器人首先
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱