智能AI
morning
《npj Robotics》:还在疯狂堆数据?北航、NTU联合提出PhyFilter,让机器人在有限数据下学会举一反三
2026-09-15
1 阅读
约10分钟阅读
机器之心
字号:
智能的本质为「学习不确定性」,核心在于干扰观测、学习与利用。要让机器人在不确定环境下像生物一样「举一反三」,主流答案是把数据堆到大模型的量级。但真机数据的采集成本,让这条路在机器人领域几乎无法复制。 北京航空航天大学郭雷院士团队、北京航天控制仪器研究所王巍院士团队与新加坡南洋理工大学 MARS 团队在 Nature npj Robotics 提出 PhyFilter:把神经网络的学习误差看作一个可以被「滤掉」的低频信号,借助机器人自身的实时状态反馈与已知的物理微分结构,在线修正学习输出。 它是一个即插即用、与具体模型无关的轻量模块,滤波参数还能自动学习、无需手工整定。在四足机器人、无人机、空中作业机械臂与加速度感知四类系统上,仅在平地仿真中训练的策略可以直接跨越石板路、草地、沙地与碎石路,空中机械臂能在 5 m/s 风扰下完成厘米级抓放。 研究表明,物理滤波式的反馈机制,可以成为「堆数据」之外的另一条泛化路径。 论文:https://www.nature.com/articles/s44182-026-00114-y DOI:10.1038/s44182-026-00114-y Website:https://scoardyy.github.io/PhyFilter/ Code:https://github.com/JIAjindou/PhyFilter 背景:机器人的泛化,只能靠堆数据吗? 过去十年,大语言模型在海量语料、大规模网络与算力的加持下取得了惊人进展,也让 scaling data 成为通往通用智能的默认路径。但当智能需要落到物理实体上时,这条路径立刻遇到阻力:机器人训练所需的数据必须在物理世界中采集。 一条路是人工遥操作,然而要获得 LLM 量级(数千亿 token)的人类演示,在技术上困难、耗时且昂贵,即便是特斯拉这样的大规模工业化尝试,也仍然卡在采集吞吐与可扩展性上;另一条路是依靠仿真引擎(Isaac Lab、MuJoCo)与视频生成模型(Sora、Cosmos)合成数据,虽然在部分任务上确有收益,但仍受制于 sim-to-real 差距、高昂的计算开销,以及跨平台数据格式、软件与硬件接口缺乏标准化的问题。 研究团队把视角转向生物:生物强大的泛化能力并不只来自「规模化」。大量证据表明,先天或后天获得的物理结构本身就在促进生物对未见环境的适应 —— 皮层的运动响应由前馈信号、反馈回路与先验驱动共同支配,并动态演化以最小化全局能量函数;斑马鱼幼体则会把与生俱来的物理积分结构与实时状态反馈整合进不断更新的小脑内部模型,从而对不可预测的视觉扰动做出有效响应。 这引出了本文要回答的问题:与数字世界中的 LLM 不同,真实机器人本就拥有结构良好的物理先验和来自环境交互的实时反馈,能否把这些「现成的」物理结构利用起来,去改善机器人学习的泛化能力? 核心方法: 把「学习残差」当作可以被滤掉的信号 PhyFilter 的出发点是一个被以往工作忽视的量 —— 学习残差。 对于真实映射与学习得到的模型,二者之差即为学习残差,它来自未见场景中的传感噪声、外部扰动或未建模交互,正是泛化失效的根源。 直觉上,只要能实时知道学习残差,把模型输出进行修正即可;但部署阶段没有标签,学习残差无法直接瞬间获得。生物同样无法「瞬间理解|陌生环境,而是经历一个适应过程。 图 1 | PhyFilter 框架。a 学习输出经物理信息滤波器增强;b PhyFilter 的具体实现;c 四类代表性验证平台:四足运动、无人机飞行、空中作业机械臂与加速度感知。 受人类视觉与听觉感知系统中普遍存在的低通滤波特性启发,团队把目标写成一个高阶低通滤波形式。若滤波形式能实现,学习残差的低频特征就能被收敛地捕捉并及时补偿;低通滤波器的收敛过程,本身就可以被视为机器人在未见场景中的一次自适应。 真正的技术难点在于学习残差不可测。团队的做法是引入机器人自身的实时状态反馈与先验的微分方程结构,把原本需要高阶导数与学习残差的形式,等价重写为只依赖可测量信号的实现,从而彻底避开了对标称模型的直接高阶微分。 由此得到的 PhyFilter 具有几个关键特性: 其一,即插即用。与以往需要重新训练被改造网络的 physics-informed 方法不同,PhyFilter 是一个模型无关的轻量模块,可直接部署在已训练好的模型上; 其二,可退化、可扩展。在一阶滤波器设定下,该实现会退化为纯粹的反馈式扰动观测器,而高阶形式则能处理超出一阶情形的复杂残差; 其三,参数可自动学习。滤波参数原本要靠成熟但繁琐的极点配置手工整定,阶次一高就极不直观。团队把滤波参数重新解释为一个动力系统的控制输入,把整定问题转化为最优控制问题,再用 Lagrange 乘子法配合伴随法(反向模式微分)解析地计算梯度,配合 Adam、小批量与早停进行优化。实验显示,自动学到的参数与人工精心调出的参数基本一致。 计算开销方面,在无人机飞行与空中作业机械臂实验中,PhyFilter 在 STM32F765 微控制器上以 500 Hz 实时运行,证明其适用于资源受限的轻量平台。 评估:四类真实机器人系统 团队在四足运动、无人机机动飞行、空中作业机械臂与加速度感知四个代表性场景中验证了 PhyFilter,其中前者属于强化学习(RL),后三者属于监督学习(SL),覆盖了当前机器人学习的两条主流范式。 四足运动:只在平地仿真训练,直接跨越四种真实地形。 为了突出泛化能力,仿真训练环境只包含平地,且仅使用标准参数随机化。结果显示,在五个随机种子下,加入 PhyFilter 的策略最大训练回报一致高于基线,步态也更协调 —— 这说明一个鲁棒的底层控制器可以显著提升上层 RL 策略的训练效率。 泛化测试中,机器人被要求以训练集之外的 2.83 m/s 高速运动,并承受 15%~60% 机身重量(11.86 kg)的额外负载,最高超出训练上限 137.33%。在楼梯、水平粗糙路、坡面粗糙路、波浪地面与碎石路五类未见场景中,PhyFilter 的通过成功率分别为 70%、80%、50%、80%、40%,而基线为 0%、0%、10%、20%、0%,结合了自适应控制的 RL2AC 为 0%、20%、10%、50%、0%。 图 2 | 四足真机实验。策略仅在仿真平地训练、无任何部署后调参,直接测试石板路、草地、沙地与碎石路(左:基线,右:PhyFilter)。 真机部署同样不做任何调参。基线策略在沙地与碎石路上迅速失稳倾覆,而 PhyFilter 引导的策略在全部地形上稳定行走。一个更有意思的发现是:即使在部署时把修正项关闭,该策略依然能成功迁移到各类真实地形 —— 这说明 PhyFilter 塑造出的是一个本质上更优的策略,而不只是在运行时 "打补丁"。 无人机机动飞行:即插即用地补上泛化短板。 在监督学习场景中,团队把 PhyFilter 叠加在之前 SEER-I 之上。SEER-I 通过离线基函数学习结合在线自适应控制,能有效捕捉无人机的质量不确定性,但一旦引入风扰这类不同性质的未知扰动,其跟踪性能就明显退化。 在 2 m/s 圆轨迹跟踪任务中,加入 PhyFilter 后,平均绝对跟踪误差相比 S
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱