智能AI
morning
刚刚,销量第一的机器狗,长出了人形!
2026-08-23
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 谁能想到,有人靠遛机器狗,硬生生甩掉了5公斤。 网友「青苹果的猜想」每天带着机器狗暴走至少5公里。两个多月下来,里程表刷到了262公里,体重秤上的数字跟着一路往下掉。 十岁的男孩 Daniel 收到了爸爸送的机器狗,从此彻底迷上了出门「遛狗」。 有一次机器狗踩了一脚泥。他嘴里嘟囔着抱怨,身体却诚实地打了一盆水,乖乖蹲在地上给狗洗脚。 他爸爸感慨,这是第一次在儿子身上看到真切的责任感。 就是这样一只冷冰冰的机器狗,把一个慵懒的成年人从沙发上生生拽了起来,也把一个沉迷屏幕的小孩拉回了现实。 相似的剧情,正在数千个家庭里同步上演。 这只机器狗叫Vbot「大头」,售价12988元,首销订单6540台,两周用户留存率高达86%,目前是消费级具身智能销量第一。 在展区里,它自带吸睛体质,吸引了许多人驻足围观,就连歪果仁忍不住为它点赞。 但四条腿跑出来的成绩,只是一个开局。 在2026 WRC现场,Vbot维他动力首次亮相人形机器人Vbot ATOM,并发布「Vbot Embodied Genome|具身基因组」。 为此,我们采访了Vbot维他动力联创兼技术副总裁秦海龙,聊了聊真实终端数据如何反哺模型,以及四足机器人积累的能力,如何成为人形机器人继续进化的起点。 秦海龙在物理AI领域深耕十余年,历任蔚来自动驾驶高级总监、千里智驾首席科学家,主导多模态基础模型和端到端技术在智驾上的工程落地,致力于让机器在真实世界里完成感知、决策和安全执行。 在他的框架里,自动驾驶和具身智能考的根本就是同一张卷子,换掉的只是身体。 汽车是一种身体,四足机器狗是另一种身体,人形又是第三种。既然底层逻辑相通,四足上已经跑通的感知、规划和运动控制,就不必推倒重来,可以直接继承给人形。 这套能够跨身体继承智能的方法,就是「具身基因组」。 整个体系由三条闭环撑起来—— OmniDuplex负责让系统持续交互与思考,WorldModel负责让策略在行动前推演未来,EvoMorph负责让共享的智能落进不同身体,并接受真实物理反馈的检验。 给机器人换个身体 智能还能留下多少? 目前,行业主流的通用化实现,往往只能做到数据层面的共享。可一旦任务结构、身体运动学或者执行器发生改变,整套能力就得重新搭一遍。 Vbot的野心要大得多。他们要让机器人理解世界、规划任务,甚至从真实跌倒中吸取教训的能力,也能像遗传密码一样「继承」下去。 拿生物学类比就好懂了。生物基因编码的是长出心肝脾肺肾的方法,「具身基因组」编码的是生成运动能力的核心逻辑。 一只四足机器狗在办公室里学会了找水杯。当它的灵魂被注入人形躯体时,找水杯的策略思路会被完整继承。唯一需要重新练的,只是换成两条腿走路的姿势。 三条闭环,从人机之间的第一句对话开始。 第一条,IRE(Interaction-Reasoning-Evolution)。 所谓IRE,就是交互、推理、进化。 即,机器人一边跟用户对话,一边在后台不停地想,每一次真实互动都在暗中沉淀,变成新的训练数据和刁钻的困难场景。 它的实现依靠的是秦海龙提出的多模态流式全双工模型——Vbot-OmniDuplex。 在这个Thinker-Talker架构里,Talker负责说话,Thinker扛理解和推理,遇到烧脑的复杂任务,直接委派给更深层的Thinking Layer。 240毫秒一个切片。音频、视频、文本、触发事件,全都被压进这个窗口里往前推。一边开口说话,一边脑子疯狂运转。遇到复杂问题,Thinker把任务抛给后台Agent,结果再无缝传回前台。 第二条,GEO(Generation-Evaluation-Optimization)。 GEO则是一整套策略进化的机制,「生成、评估、优化」不停循环。 首先,策略模型会丢出一批候选动作。然后世界模型接手,逐一预测每条路走下去会发生什么,给出评估信号。策略拿到信号更新自己,下一轮生成更好的候选。 这个循环里最关键的角色是Vbot-WorldModel,动作条件导航世界模型。它负责回答一个具体问题:如果执行这个动作,未来会是什么样。 和那些生成一段好看视频的「世界模型」不同,Vbot-WorldModel拿到的输入是当前画面加一组9D相机动作(旋转、平移共九个维度),而它的输出则是对应的未来画面,也就是给策略提供可信的判断依据。 同样,它的训练也分两步。 在SFT阶段,模型学的是「动作会带来怎样的未来」。输入当前画面和相机动作,生成对应的未来场景。 在DPO阶段,模型学的是「哪个未来更靠谱」。同一条件下生成多个候选,按动作一致性、几何稳定性和视觉合理性构造偏好对,再优化。 实际效果来看,同一帧画面下,仅改变相机动作,模型就能预测出直行、左转、右转三条完全不同的未来分支,并保持可恢复的三维轨迹。 这套系统到底吃进去了多少数据? 77万条以上真实导航片段。从马路到小区到办公室,超3000小时视频,5000公里轨迹,全是真机一步一步跑出来的。 这个数据量扔在行业里相当炸裂。 Waymo和NVIDIA也在用世界模型给策略当裁判,但它们吃的数据全部来自汽车。Vbot的片段百分之百来源于消费终端在生活空间里的真实轨迹。两者面对的场景特性截然不同。 在秦海龙看来,世界模型光能生成未来画面远远不够。命门在于,结果必须可控、可信,能被真机执行。 去年VLA和世界模型的路线之争炒得沸沸扬扬。但本质上,两者只是不同的建模方式。 VLA擅长跨模态对齐,World Model擅长连续空间预测。Vbot死磕世界模型,目的就一个,让策略在执行前看清未来,拿来评估。 第三条,RSR(Real-Sim-Real)。 四足、轮足、人形,底盘、关节、执行器天差地别。多本体运动控制模型Vbot-EvoMorph要攻克的难题,是怎么让同一套动作意图,在截然不同的躯体上各自落地。 秦海龙的解释很形象。不同本体执行同一个任务,向前走、绕障碍、靠近目标,这些高层意图是共通的。唯一不同的,是最底层的关节该怎么扭。 方案分为两层。 共享层把视觉、本体感知、任务指令和形态信息一股脑塞进多模态编码器,输出一组Action Tokens,只管动作意图,跟具体关节无关。 每种躯体再各配一个Body Adapter,把意图翻译成自己能执行的指令。四足翻译出步态,轮足翻译出轮速,人形翻译出关节角度。 同样是「走到桌子旁边」。四足用四条腿轻盈迈过去,人形靠两条腿稳稳走过去,再丝滑地完成重心转移。 RSR底层还藏着一个跟整个行业反着来的训练怪招。 目前的主流做法是Sim-to-Real,在仿真环境里把策略训得炉火纯青,再移植到真机上。 NVIDIA的Cosmos、Google的Gemini Robotics,底层仿真能力确实越来越强。但残酷的现实是,任务越复杂,仿真和现实的鸿沟就越深。操作类任务尤其明显,演示动画看着天神下凡,一上真机立刻拉胯。 对此秦海龙的选择是,反过来把现实差距强行前置。先用真机跑出来的数据回流,再把仿真环境一比一抠到逼真,最后把模型扔进去特训。 具体来说,真实运行日志先经过系统辨识,估计出质量、惯量、摩擦力等物理参数。再用回流数据做三维重建,给每个物体贴上语义和属性。哪张桌子能绕,哪个杯子能抓,在仿真里标得清清楚楚。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱