智能AI
morning
Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式
摘要
Haojie Huang (黄浩杰) 是美国东北大学计算机科学五年级博士生,师从 Robert Platt 和 Robin Walters,研究方向为机器人操作学习与几何深度学习。他早期主要研究利用对称性提升模仿学习的样本效率,并提出 Edge Grasp Net、Fourier Transporter、Imagination Policy 等原创工作;近期聚焦 pose-free action ...
action
AMP
Paper
cross
entropy
token
space
image
Policy
representation
2026-09-10
1 阅读
约10分钟阅读
机器之心
字号:
Haojie Huang (黄浩杰) 是美国东北大学计算机科学五年级博士生,师从 Robert Platt 和 Robin Walters,研究方向为机器人操作学习与几何深度学习。他早期主要研究利用对称性提升模仿学习的样本效率,并提出 Edge Grasp Net、Fourier Transporter、Imagination Policy 等原创工作;近期聚焦 pose-free action representation 与新的操作学习范式。其成果发表于 IJRR、RSS、CoRL、ICRA、RA-L、ICLR、NeurIPS、ICML 等顶级会议和期刊,并获 CoRL 2024 Outstanding Paper Finalist、RA-L 2026 Best Paper Honorable Mention 等荣誉。曾在 Boston Dynamics AI Institute 和 Amazon Robotics 实习。 If I Had One Bet on Robot Learning, I’d Bet on Cross-Entropy. 大语言模型的成功揭示了一个适用于一维序列数据的清晰 Scaling Law :通过自回归训练,并采用 交叉熵(cross-entropy)目标函数 预测下一个 token 的概率分布,模型能够建模非常复杂的语义概率分布,并随着数据规模和模型规模的增长持续提升性能。机器人的动作轨迹同样服从一个非常复杂、且往往具有多模态特性的概率分布。 然而,将这种基于 cross-entropy 的概率预测范式直接扩展到机器人学习并不容易: 我们应该如何定义机器人的动作分类空间,并预测一个时间窗口(temporal horizon)内的动作概率分布? 核心困难在于,机器人动作本质上是 高维的 —— 在时间窗口中的每一个时刻,动作通常至少包含 6 或 7 个自由度(包括夹爪)。如果将每一个动作维度仅仅 粗略地离散化为 10 个 bin ,并将一个完整的 6 维动作视为一个 joint action token,那么其组合空间就已经达到 10⁶,也就是 100 万种可能的动作 ;且如此粗糙的离散化本身又很难满足高精度操作的需求。如果进一步提高每个维度的离散精度,或者同时预测 temporal horizon 中多个时刻的动作,整个动作空间还会迅速膨胀。 如此巨大的 action space,再一次揭示了机器人操作学习中的一个 bitter lesson:the curse of dimensionality(维度灾难) 。 Figure1. Comparison of different policy-learning frameworks. Action Map Policy(AMP)定义了一种新的 动作表达(action representation) 。它首先将三维运动(orientation + translation)可逆地表示为 3D 关键点轨迹 ,再将这些 3D 关键点投影到多个相机平面上。通过这种方式,原本的三维运动轨迹可以被表示为 二维图像空间中的像素轨迹 。 Project Website: https://haojhuang.github.io/amp_page/ Paper Link: https://arxiv.org/abs/2607.10706 关键在于,AMP 并不是通过扩散模型进行降噪,也不是通过回归模型直接预测这些 2D 像素点的位置,而是将动作预测重新定义为一个 像素级分类问题 :模型预测每一个像素在不同时刻成为目标关键点位置的概率,从而得到每个时间步上的 像素概率分布 。通过这种巧妙的动作表达,AMP 首次将高精度的 3D 闭环机器人操作转化为图像空间中的像素分类问题 ,同时仍然能够实现毫米级(小于 1 mm )的三维动作精度。简单来说,AMP 做的事情,是把一个原本需要在高维连续空间中预测的 3D 动作问题,重新变成了一个我们已经非常熟悉的问题:在图像上做 classification。这个新的动作表达和操作学习范式带来了一些 质的变化 : 输入空间和输出空间实现了高度统一。 类似于 LLM 将输入与输出统一在 token space 中,AMP 将视觉观测和机器人动作统一到 image space :输入是 image,输出则是定义在 image 上的 action distribution。动作不再只是一个抽象的低维向量,而成为具有明确空间语义的像素概率分布。 交叉熵(cross-entropy)目标函数天然具备建模复杂、多模态概率分布的能力。 与直接回归一个确定的动作不同,分类模型可以自然地描述 “多个动作都可能是合理选择” 的情况,这对于具有高度多模态性的机器人操作尤其重要。 模型一次前向推理即可输出完整的动作概率分布。 相比需要多步迭代去噪的 diffusion-based policy,AMP 可以通过一次模型推理直接得到不同时刻的动作分布,显著提高机器人推理速度;与此同时,完整的概率分布也使得从中进行 action sampling 变得非常自然,可以根据同一个观测采样出多个不同但合理的动作候选。 Experiment 1:模型的感知能力与多峰分布表达能力 我们先看一个非常简单、但很有意思的实验,看看这个 formulation 到底带来了什么不同?桌面上放置了四个外观完全相同的木块,实验者用激光笔点亮其中一个木块,模型需要识别这个细粒度的视觉信号,并抓取被激光指中的目标。每个木块收集 10 条 demonstration,一共只有 40 条 demo。这个实验主要测试两个能力:模型对 fine-grained visual signal 的感知能力,以及对 multi-modal action distribution 的表达能力。为了尽可能排除空间泛化等其他因素,数据采集时木块的位置变化(spatial variation)非常小,训练和测试时的场景分布基本一致。 Diffusion Policy Action Map policy 可以看到,Diffusion Policy(DiffPo)在这个看似简单的小测试中出现了明显的类似 mode collapse 的问题:模型很难根据激光笔的位置,稳定地抓取被指中的木块。因为这个实验本身几乎不包含 spatial variation,因此问题并不来自模型需要泛化到新的物体位置,而更直接地暴露了模型能否捕捉这种细粒度条件信号,并正确表达对应的多峰动作分布。 换句话说,这并不是简单增加更多的数据能够解决的问题。相比之下, AMP 在这个实验中达到了 100% 的成功率 ,初步展示了它对细粒度视觉信号的感知能力,以及对多峰动作分布的表达能力。下面具体看一下 AMP 是怎么实现的这个新的 action representation。 Method:AMP 架构和主要设计 Figure2. Architecture of Action Map Policy. The left branches take one in-hand image and two side-vi
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱