首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

WRC展会拿旧Demo炒冷饭?扒一扒千寻藏在水下的全栈底牌

2026-08-22 1 阅读 约9分钟阅读 衡宇
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> WRC展会拿旧Demo炒冷饭?扒一扒千寻藏在水下的全栈底牌 衡宇 2026-08-21 13:38:12 来源: 量子位 衡宇 发自 凹非寺 量子位 | 公众号 QbitAI WRC期间,整个展馆里的机器人展台上最抓人眼球的当属各种新奇动作。 跳个舞、握个手,或者解锁个没见过的复杂任务, 够直观也够新奇 ,就足够让观众举起手机了。 可一旦把机器人真正落地到工厂、商场或是普通家庭,现实问题就回归到最实在的层面。真实场景更在乎的是机器人下一次能不能做得更快、更稳,同时尽量少靠人来介入辅助。 正因如此,千寻智能在2026世界机器人大会上的做法显得有些特别。 他们没有急于推出更新鲜的演示场景,而是 让Moz1把一个多月前在WAIC上做过的“整理客厅”搬到WRC重映 。 emmmm……炒冷饭? 于是我们在展馆里抓了个千寻员工问,真就纯展示同一个Demo啊?一点新鲜变化都没有吗? 人家笑着跟我说,你别乍一看啊! 虽然不到30天,但这套Demo超有进步的 : 可乐放入冰箱的自主推理成功率由约80%提升至99%以上; 碗放入洗碗机由约90%提升至99%以上; 导航目标确认耗时降低近50%。 此外,捡垃圾任务在颜色、种类、位置等方面的泛化条件下,执行成功率高达85%。 这些变化都发生在“整理客厅”这套长程复合任务的不同环节里(不是一次抓取或固定工位动作)。 所以,同款Demo的两次亮相,其实是一套具身系统的两张“进化快照”。 乍一看,做的还是老行当,但其实这里蕴藏着一座冰山—— 水面之上 是任务完成度的提升; 水面之下 ,则是数据、训练、Agent、导航、硬件和基础设施共同构成的全栈能力的进步。 30天的快速进化究竟是如何发生的? 我们需要潜入水面之下。 30天,Demo出现可量化跃迁 要理解这30天的变化,离不开一个叫“时间密度”的词。 这是千寻智能 首次在具身智能领域提出的学术概念。所谓“时间密度” ,看的就是一套系统能在多短时间里吸收问题、完成训练和验证,再把改进送回真机。 它衡量的不是某次演示的峰值表现,而是系统进化的速度。 真要说起来,30天前千寻的成功率就已经不低了:WAIC阶段,可乐进冰箱接近80%,碗进洗碗机接近90%。 很好看的成绩。如果只是为了做一个展会Demo,这个水平已经能支撑起不错的现场效果。 但长任务里的90%,和一个固定工位上的90%,难度完全不在一个水平线上。 单步任务失败一次,通常只是这一动作没做成; 长程任务里,一个小偏差会改变下一步面对的状态,错误还能继续往后滚。 而机器人完成“整理客厅”这种生活中的系列动作,其实环节繁复。 它得听懂模糊指令,先环视环境,判断哪些东西需要归位,再记住尚未完成的步骤。随后跨空间移动、抓取物品、开门、放置、关门,还要在过程里不断确认自己有没有做对。 而且在长程任务中,物体姿态变化、机器人站位偏移、背景干扰,甚至是开门角度不足,都可能让后续动作失去节奏。 所以, Demo跑出高成功率只是算故事的开场 ,不能说明在这个任务上已经万无一失了。 我们把视线拉到WRC现场。 冰箱、洗碗机、捡垃圾、收纳玩偶四组任务,也分别暴露出长程任务里不同的问题:连续操作能不能稳定衔接,站位和物体状态变化后能不能继续完成,以及环境变化之后还能不能认准目标。 再多看几轮演示,展会现场其实是不断加难度的。 观众穿行、遮挡和物品位置变化都会临时打乱路线,机器人还得继续避障、重新接近目标,再把导航和后续操作接上。 肉眼可见,展会现场本来就挺会制造麻烦。 但对具身机器人来说,这些麻烦恰好有价值~ (偷着乐吧所有的展商朋友们!!) BTW,这种 现场表现的稳定性,很难单靠某一个模型调参来实现 。 只有当每一次失败都能被系统识别、回传、复现、训练和再部署,形成数据闭环,才能支撑起30天内的快速迭代。 水面之下的全栈冰山:如何让一条长任务跑起来 拆解“整理客厅”的完整执行过程,其实就是拆解千寻智能的全栈技术体系。 对于机器人来说, “整理客厅”这句指令必须要拆解成一连串问题 : 房间里有什么?哪些东西需要整理?应该先做什么后做什么?机器人应该走到哪里才能完成操作?如果中途失败,下一步应该怎么办? 用户发出“整理客厅”的目标后,感知系统先扫视全局建立环境信息;Agent保存上下文记住长期目标,并把大任务拆成“先收可乐、再洗碗”之类的子任务;导航系统把机器人送到适合操作的位置;基座模型Spirit v1.6根据语言、视觉和本体状态生成动作。 干完活,它还要写一份复盘报告(数据回流),以便下次干得更好。 可以看到, 一次完整任务背后,是感知、数据、模型、Agent、导航、本体和基础设施共同协作。 △千寻智能技术架构 这条链路环环相扣,缺一不可,让机器人从每次任务中不断吸收经验。 首先来看作为系统进化“燃料”的数据管线。 想让机器人30天后变得更好,首先需要解决一个问题:这一次为什么失败?下一次训练到底应该改什么? 例如,一次抓垃圾失败,并不意味着任务结束。真正重要的是,系统能不能知道“为什么失败”:是没有识别到垃圾,还是抓取位置不对,还是动作规划出了问题。 答案藏在数据里。 千寻智能的数据平台汇集了Web视频、第一视角数据、uDAS数据、遥操作数据与真机任务数据,覆盖清洗、标注、质检、训练任务管理、模型评测和结果追踪。 目前千寻自研的数据采集设备已迭代至第7代,数据采集成本降至传统遥操作方式的1/10,数据可用性从30%提升至95%,配合全国超30万个采集点位,源源不断地输送燃料。 △千寻智能可穿戴数采设备同时在全国多地进行数据采集 但对于具身智能来说,真正有价值的数据,并不一定是最“干净”的数据。 这就不得不提到 千寻独创的“脏数据”训练理念和数据金字塔体系。 △千寻智能数据金字塔 现实世界里,灯光会变化,物品不会永远摆在固定位置,人会突然经过,环境也会不断变化。 如果机器人训练时看到的永远是规整、标准的场景,面对真实世界时反而容易被无关信息干扰。 因此,千寻强调“脏数据”训练,将真实世界里的杂乱变化直接作为模型泛化的一部分。 这还要搭配后训练过程一起来看。 BTW,后训练机制与底座模型,是决定机器人动作上限的基石。 在后训练阶段要解决的核心问题,是让模型真正理解经验,知道“什么值得看”。 机器人在完成整个任务的过程中,需要眼观四路耳听八方。 以“把碗放进洗碗机”为例,这背后至少包含十个连续阶段。 任务开始时,全局视觉帮助它迅速判断自己在哪、洗碗机在哪;真正开始操作后,关注范围会不断缩小,此时更重要的是碗的位置、把手的位置、沥水架的位置。 通过后训练,团队让模型学会对无关变化(如墙面、灯光)保持稳定,对真正影响动作的变化(如碗的位置、站位)保持敏感。 数据和后训练最终需要落到模型能力上,而支撑这一切的底座是Spirit v1.6基座模型。 据千寻智能资料,它采用VLA与世界模型深度一体化的融合架构。 传统的机器人往往是“感知-规划-控制”分步走,就像先看地图
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱