首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光

摘要

神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光 林, 方舟 2026-09-03 09:31:45 来源: 量子位 诺亚 发自 凹非寺 量子位 | 公众号 QbitAI 还记得上周具身圈流传的那个神秘10分钟一镜到底视频吗? 视频一出,网友们表示:不敢相信,仿佛天外来物…… 甚至给出了最高评价:是AI生成的吧?! 同行跑来打听到底是哪家的,听说有头部公司专门开会研究……我们的...

做个人吧 doge 量子位 如果你端着一瓶水 有人戳你的胳膊 你能不能瞬时反应 出来的 神秘具身团队又放出一连串很炸的Demo视频 自进化模型 技术路线曝光
2026-09-03 1 阅读 约9分钟阅读 林, 方舟
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光 林, 方舟 2026-09-03 09:31:45 来源: 量子位 诺亚 发自 凹非寺 量子位 | 公众号 QbitAI 还记得上周具身圈流传的那个神秘10分钟一镜到底视频吗? 视频一出,网友们表示:不敢相信,仿佛天外来物…… 甚至给出了最高评价:是AI生成的吧?! 同行跑来打听到底是哪家的,听说有头部公司专门开会研究……我们的后台都被各路网友问爆了。 看完这个十分钟的一镜到底视频,大家说具身智能的ChatGPT时刻可能真来了,有人说这是具身智能的重要里程碑,也有人说这是创新的架构。因为它让人看到了: 机器人具有一定认知能力,而不是概率预测; 机器人理解人类行为逻辑,而非过拟合; 机器人拥有持续自进化的能力,有很多令人惊叹的瞬间。 当然,由于机器人表现得太过“科幻”,也有一些不相信的人质疑:这是不是遥操的?(虽然团队说这么小的空间真的不知道怎么遥操) 而这个神秘团队,回应质疑的方式也很特别:他们又一连甩出了另外几个demo,依旧粗糙,依旧一镜到底,仿佛想说: “智能,不管你信或不信,它真的要来了。” 因为第一篇文章,我们得以联系到神秘的模型团队,也表达了疑问——为什么不直接出来认领?得到的回应是:模型也像人,让它自己说。 我们了解到,这个神秘模型的内部代号为“MVP”,它的意思是:模型能力像真人一样(Make Veritable People),他们说可以直译为:“做个人吧”(doge)。 “做个人吧”大模型。 而这次释出的几个Demo,从表现来看,机器人“真的做了个人”,它像人类一样思考,自我决策、动作丝滑、逻辑自洽。而且听团队说, 他们马上要让机器人自己上街了,开放环境,直接给大家看。 视频1:手眼协调不分离,高超的动力学理解 如果你端着一瓶水,有人戳你的胳膊,你能不能瞬时反应、让水不洒? 机器人左手拿一个装着水的杯子,在人类(无礼的)木棍推搡下,它躲向另一侧,又平稳地归位,杯中的水没有洒半滴。 如果你端着一瓶水,有人戳你的胳膊,又同时推倒了你旁边的易拉罐,你能不能瞬时反应、让水不洒且保证易拉罐不倒? 人类又从右侧推了桌上的三个易拉罐,它的右手居然同时扶住了易拉罐。 机器人表现得就像一位太极宗师,既会化劲,将对手的撞击化解于无形,也知道分寸,将力道拿捏得刚刚合适。 而且仔细看,易拉罐被推动的时候,左臂端着水的动作还没有恢复,机器人又用右手扶住了易拉罐。 这一幕,别说机器人,其实已经超越许多人了,大家可以试试看能不能两只手同时完成这两个任务。(doge) 主流的VLA和WAM模型有个毛病:一旦面对遮挡、接触、形变等需要物理推理的任务场景时,就容易失效。因为它们只是在模仿动作的样子,并不理解背后的物理规律。 而“做个人吧”模型看起来给机器人装了一个“物理大脑”。正是动力学预测和长期状态的统一,才能让轨迹天然满足动力学可行性。 从动作反应速度跟丝滑程度来看,机器人的动作不再是靠死记硬背数据“猜”出来的,而是像人一样,靠着对物理规则的理解“学”出来的。 两者是“照葫芦画瓢”和“知其所以然”的区别吧。 视频2:对空间和物体属性的理解,以及对人类习惯的总结 第二个视频中,人形机器人正式接管家务。 而且“做个人吧”模型的团队说这是机器人zero-shot完成这个任务时候的视频。(如果是真的,那这泛化性也太无敌了!) 他们说,模型的zero-shot成功率已经达到了80%。 我把这个视频命名为“强迫症机器人之客厅不能乱”(doge) 只见机器人先把手里的小玩偶放回玄关置物台,主打一个“从哪儿来回哪儿去”。接着,它又把装满杂物的收纳篮拖到身边,微微下蹲,从中先后掏出黑色帽子和紫色健身环,将其稳稳挂上衣帽架。 最后,它从篮子里拿出一只硕大的花朵坐垫,显然它是可以弯腰的,但这次,它选择随手一扔,坐垫落到了沙发上。 整个过程下来,机器人的动作虽然不算麻溜,但颇有一种尽在掌控之中的感觉。 机器人对空间和物体属性的理解,已经非常像人:它知道物体在光滑的地板上可以拖拽,环状的帽子和健身环可以挂,平整的坐垫会自己展开。 甚至还会“偷懒”,能直接扔就绝不再费劲弯腰。(真是懒人驱动科学发展,懒机器人驱动智能进化啊。) 主流的模型暂时还达不到像人一样的泛化能力。VLA靠“大力出奇迹”硬算,一碰到陌生场景就容易崩盘;WAM则像拼积木一样拼接动作,学得太死板,稍微变通一下就不灵了。 装配“做个人吧”模型的机器人则看起来很稳定,把对空间和物体属性的理解以及人类的习惯融为了一体,顺利完成了一个长程任务。 视频3:拉平床单、抖床单、放床单,机器人组队干活了 小时候,长辈会经常喊我们,把新洗出来的床单抖一抖。 这个视频中,出现了两台不同型号的机器人,听说他们全部的训练都是看的人类视频,所以他们再次上演了“一脑多形”的跨本体协作,并且真的组队干活了。 只见一条似乎刚从烘干机中取出来的床单,一头的两角被一台身高较高的机器人拽着,另外一头的两角被另一台较矮的机器人牵着。 较矮的机器人一跨步,再一弯腰,床单便被扯得平整。紧接着,身高较高的机器人两手轻轻抖动了几下床单。 虽然视频中的机器人姿势仍然有些呆板,但是它们的行为逻辑也太像人了!这跟我们把刚洗好的衣服甩两下、以免出现褶皱有什么区别? 要知道,主流的模型有个致命缺陷:它们不像人类,无法真正实现自进化。VLA只能小修小补,动不了“脑回路”;WAM干活太死板,换个环境就适应不了。 而MVP模型不同,它看起来把对物理世界的理解和对人类逻辑的理解统一了。 视频4:能量驱动,最优能量的行为解 当机器人学会思考,懂得一次把所有东西拿走归置,比来回一趟趟归置更省力,它会怎么样? 视频里,这台机器人收纳物品的操作仿佛人一样:东西再多,也尽量不跑第二趟。 它先从篮子里抽出一条黑色围巾,像店小二一样,往脖子上一搭。接着它又拎起紫色圆环,绕在小臂上,还知道抬手让其滑落到肘关节处,成功把自己改造成行走的衣架。 然后是拖鞋、耳机,一番操作下来,机器人身上已经挂满了物品,却淡定地转身离开,留下一个轻飘飘的背影。 1分钟的视频,机器人收纳了4件物品,不仅充分展现了处理长程任务的能力,还展现了对每个物品的深刻理解,并能为每件物品建立与自身能力的对应映射。 要知道,如今的主流模型做同样的任务,大概率会是一件一件单独搬运,因为模型本质上还是基于统计拟合的猜测,缺乏像人类一样对世界的理解,也没有自主意图。 如果视频中的机器人看到这一幕,它心里的OS可能是:不是吧哥们,来都来了,怎么就带这点走啊?多带点更省劲啊! “做个人吧”模型的机器人做决策时,好像不需要刻意去“想”下一步该干嘛,只需要像水往低处流一样,顺着能量下降的方向自然滑动。 在这个“下坡”的过程中,思考、探索和行动是一气呵成的。 可能这才是真正理解世界、并有自主意图的智能吧。 总结 看完这4个demo,我终于理解了模型为什么叫“做个人吧”,机器人的一举一动,确实都太像一个
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱