智能AI
morning
千寻智能高阳团队新作|换了新硬件,老数据还有用吗?揭秘机器人学习中的"涌现式迁移"
摘要
想象一位干了二十年的汽修老师傅,带一个刚进门的学徒。老师傅经验丰富,但如果学徒连螺丝刀都拿不稳,老师傅那些 "听声音就知道哪里坏了" 的绝活,讲了也是白讲 —— 徒弟根本接不住。可一旦徒弟练熟了基本功,老师傅的经验就会 突然变得点 石成金 ,让徒弟的水平一路飙升。等到徒弟自己都快出师了,老师傅再多的经验,能带来的提升也就有限了。 机器人学习里,藏着一个几乎一模一样的故事。 近日,千寻智能高阳团队的...
Emergent
Transfer
迁移阈值
When
Does
Legacy
Data
Start
Help
Cross
2026-08-04
1 阅读
约10分钟阅读
机器之心
字号:
想象一位干了二十年的汽修老师傅,带一个刚进门的学徒。老师傅经验丰富,但如果学徒连螺丝刀都拿不稳,老师傅那些 "听声音就知道哪里坏了" 的绝活,讲了也是白讲 —— 徒弟根本接不住。可一旦徒弟练熟了基本功,老师傅的经验就会 突然变得点 石成金 ,让徒弟的水平一路飙升。等到徒弟自己都快出师了,老师傅再多的经验,能带来的提升也就有限了。 机器人学习里,藏着一个几乎一模一样的故事。 近日,千寻智能高阳团队的最新研究 《 When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning 》(老数据何时开始 "帮上忙"?跨配置机器人学习中的涌现式迁移)正式公开。这项工作揭示了一个反直觉的现象: 在机器人硬件升级后,此前辛苦采集的 "老数据" 并不是拿来就有用,而是要等新硬件 "练到一定火候",才会突然开始发挥价值 —— 而且价值大到惊人。 图1:跨配置共同训练的三阶段规律 论文标题: When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning 论文链接:https://arxiv.org/abs/2607.25593 项目主页:https://xuezhiai123.github.io/legacy-data-transfer/ 一个真实又昂贵的难题: 硬件一升级,老数据就 "作废" 了? 机器人要在真实世界里干活,就离不开大量的示教数据(人手把手教机器人怎么做的操作数据)。可现实是, 机器人硬件一直在迭代 :摄像头换成视野更广、更清晰的新款,夹爪换成更灵活的新设计。 问题来了:这些改动会直接改变机器人 "看到的画面" 和 "手上的动作方式"。于是每一次硬件升级,都会带来一个让人头疼的现实问题 —— 之前在旧硬件上花了大量人力、金钱采集的示教数据,还能用在新机器人身上吗? 一个很自然的想法是:把海量的老数据,和少量新硬件上采集的新数据混在一起训练(称为 "co-training / 共同训练"),让老数据 "扶一把" 新机器人。学界过去的工作(如 RoboNet、BridgeData)也确实表明,旧数据能降低新场景的数据采集成本。 但这些工作都没回答一个更关键的问题: 硬件一换,老数据是不是从一开始就有用? 迁移学习的经验反而提示我们:当新旧两边差异太大时,老数据不但可能没用,甚至会 拖后腿、干扰学习 。 反直觉的发现: 老数据不是 "越多越好",而是有个 "开窍时刻" 团队在一个轮式人形机器人平台上做了系统性实验 —— 跨越两代硬件,摄像头和夹爪都换了,但机器人整体形态不变。他们对比了两种策略的表现: 图2:真实机器人实验平台与操作任务(插花、插笔等精细操作) 只用新数据 训练的策略 老数据 + 新数据 共同训练的策略 结果非常出人意料。以 " 插花 " 这个精细操作任务为例: 当新硬件数据只有 4.3 小时、机器人自己只能做到 10% 成功率时,加上老数据共同训练,成功率 纹丝不动,还是 10% —— 老数据完全没帮上忙; 但当新硬件数据增加到 15.6 小时、机器人自己能做到 23.3% 时,同样加上 17 小时老数据,成功率 直接飙升到 86.7% —— 一举提高了 63.4 个百分点! 也就是说, 仅仅是新机器人自身能力 的 一点点提升,就让老数据从 "毫无用处" 变成了 "点石成金"。 把不同任务、不同数据量下的结果汇总起来,一个清晰的 " 三阶段规律 " 浮出水面: 1. 第一阶段(新机器人能力很低) :老数据毫无用处,加了也白加; 2. 第二阶段(能力跨过某个临界点) :老数据的收益急剧爆发,带来巨大提升; 3. 第三阶段(能力接近满分 ) :老数据的边际收益又开始递减。 这个从 "没用" 到 "突然有用" 的跳变,团队称之为 " 涌现 式 迁移"(Emergent Transfer)“ 。它和大模型领域大家熟悉的 "涌现能力""grokking(顿悟)"现象很像 —— 只不过这里的" 顿悟 ",不是靠堆模型规模或训练时间触发的,而是随着 新硬件自身任务能力的提升 而触发的。 图3:三阶段相变曲线。迁移阈值 τ(T) 标出了老数据开始产生显著收益的临界点。 为什么会这样?一个 "迁移阈值" 和背后的两套机制 团队用一个关键概念来刻画这个跳变: 迁移阈值 τ(T) (transfer threshold)。 通俗地说,它就是 " 徒弟必须先掌握的基本功水平 "—— 只有当新硬件策略自身的成功率跨过这个任务相关的阈值,老数据才会开始帮上忙。 阈值之下 :新策略连任务的基本结构都没学会,给它再多老数据的 "高级经验",它也不知道怎么用; 阈值之上 :新旧数据的学习方向(梯度)开始 "对齐",老数据的经验能顺畅地迁移过来,于是收益暴涨; 接近满分时 :能提升的空间本就不多了,老数据的边际价值自然下降。 团队进一步从理论上给出了解释,核心是两套机制: 梯度对齐(Gradient Alignment) :解释了 "老数据何时开始帮上忙"—— 当新旧数据的梯度方向足够一致时,共同训练才不会互相打架,反而能相互增益; 策略残余不确定性(Residual Policy Uncertainty) :解释了 "老数据的收益 为何在接近满分时递减 "—— 当策略已经很确定时,老数据能补充的信息就所剩无几了。 有什么用?一条 "看火候下菜" 的数据采集策略 这个规律最实在的价值,是能 指导我们该怎么花钱采数据 。 过去大家默认 "数据越多越好",一上来就大规模采集新硬件数据。但这项工作给出了一条更聪明的 " 相位感知(phase-aware)数据采集策略 ": 先只采集新硬件数据,直到新机器人的能力跨过迁移阈值;然后再引入老数据做共同训练。 也就是说 —— 先让徒弟练到 "开窍",再请老师傅出手, 效果和性价比最高。 团队在一个全新的、没被用来推导规律的 " 移动双臂浇花 " 任务上验证了这套策略: 按照相位感知策略,只需采集 1.5 小时 的新硬件数据(而按过去的做法需要 8 小时 ); 任务成功率从 40.0% 提升到 78.3% 。 用不到 1/5 的新数据采集量,换来了成功率的大幅提升 —— 这对于动辄需要大量人工示教、成本高昂的真实机器人场景来说,意义重大。 图4:移动双臂浇花任务。相位感知策略把新数据需求从 8 小时压到 1.5 小时,成功率从 40.0% 升到 78.3%。 总结 这项工作系统性地揭示并刻画了跨配置机器人学习中的 "涌现式迁移" 现象,核心贡献可以概括为三点: 1. 发现三阶段迁移规律 :老数据在新硬件能力低时无用、跨过阈值后收益爆发、接近满分时收益递减,并给出了统计层面的支持; 2. 提出迁移阈值 τ(T) 与理论解释 :用梯度对齐和策略残余不确定性,讲清了老数据 "何时开始有用" 以及 "为何后期收益递减"; 3. 给出可落地的数据采集策略 :先采新数据跨过阈值、再引入老数据共同训练,在浇花任务上把新数据需求从 8 小时压缩到 1.5
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱