首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球

2026-08-24 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|杨文 顶会可以年年开,但这本期刊不是每个实验室都能进的。 《Science Robotics》是国际机器人领域公认的顶级期刊,由《Science》母刊旗下出版,影响因子长期位居机器人学科首位。能在这本刊物上发表成果,意味着研究经过了同领域最严格的同行评审,代表当前最前沿、最具突破性的技术进展。 今年 8 月, 《Science Robotics》推出人形机器人专题特刊 ,汇聚了全球人形机器人领域的最新研究成果。 本期特刊全球仅收录三家人形机器人公司平台 —— 加速进化、宇树、波士顿动力,代表了全球人形机器人研究的最前沿阵列。 在这期特刊中, 清华大学自动化系赵明国教授团队 联合字节跳动 Seed、中国农业大学发布了一篇论文,题为《Learning Vision-Driven Reactive Soccer Skills for Humanoid Robots》(学习视觉驱动的人形机器人反应式足球技能)。该论文提出了一套 视觉驱动的反应式足球技能学习框架 ,让人形机器人仅依靠机载视觉,在动态环境中连续完成找球、追球、调整步态和多方向射门。 支撑这项研究的真机验证平台,是加速进化的人形机器人。 论文链接: https://www.science.org/doi/10.1126/scirobotics.aed1152 项目主页:https://humanoid-kick.github.io/ 这项工作没有停留在某一个动作或单项指标上,它把视觉感知、状态估计、双足运动和物理接触放进真实足球任务,还进入 RoboCup 赛场,在持续变化的环境和真实对抗中接受检验。 二十二年的技术接力 2004 年,赵明国带领学生成立清华火神机器人足球队。次年,他们带着自行研制的机器人参加 RoboCup。早期机器人只有约 50 厘米高,行走缓慢,比赛时还需要保护人员防止摔倒。此后的二十多年里,火神队几乎每年参赛,机器人逐渐长到一米以上,学会自主起身、快速奔跑和大力射门。 足球场也成为团队长期检验视觉、决策、运动控制和整机可靠性的试验场。视觉识别慢了多少毫秒,落脚点偏了多少厘米,机器人在哪个方向容易踢空,都能在真实对抗中直接呈现。团队再把问题带回实验室,修改算法,下一场比赛继续验证。这种循环持续了二十多年。 赵明国长期从事类脑计算与机器人控制研究 。他参与研制的「天机芯」类脑芯片及无人自行车研究曾登上《Nature》封面,并入选 2019 年度中国科学十大进展。从类脑计算到机器人足球,他关注的始终是感知、判断和行动如何在同一系统中连续运行。 随着岁月流转,火神队的成员一届届更替。加速进化创始人程昊曾是火神队第三任队长,从清华毕业后历经互联网创业的锤炼,以及在字节跳动担任飞书产品副总裁的履历积累,2023 年,这位对机器人念念不忘的队长选择重新出发,创办「加速进化」。曾经在火神队并肩作战的多名成员也纷纷加入,以初创团队的身份,再次开启了一场关于机器人的共同征程。论文第一作者王与时,则来自火神队的新一代。 从 2004 年火神队创立,到 2026 年论文登上国际顶刊,这是一场跨越二十二年的技术接力。 让机器人在噪声中看见并反应 这篇论文试图解决一个困扰学界多年的问题: 在充满噪声、延迟和遮挡的真实环境里,人形机器人如何做到看见即反应 。 人类踢球时,视觉和动作几乎同时发生。眼睛追踪足球,大脑判断距离与方向,身体持续调整重心和落脚点。即使足球短暂被挡住,人也能根据此前的运动轨迹预判它接下来可能出现的位置。 机器人需要用摄像头、算法和关节控制完成这套过程,难度却大得多。摄像头拍到的画面可能因剧烈运动产生模糊,目标检测存在噪声和延迟,足球还可能跑出视野或被遮挡。同时,双足机器人还得维持平衡,并在几十毫秒内决定下一步落脚位置。感知、定位、决策、运动和物理接触被压缩进一个连续任务,任何环节慢半拍,机器人都可能踢空或摔倒。 传统方案通常把这一过程拆成多个模块。视觉系统识别足球并估计位置,决策模块选择动作,运动控制器再驱动机器人执行。这套方法方便调试,但也容易产生误差和延迟的逐级传递,并且在完美仿真中训练出的策略,到了真实世界可能因光照、噪声、遮挡而出现明显性能下降。 赵明国团队提出一套 统一的感知 - 运动强化学习框架 。核心思路是将视觉感知与运动控制置于同一个优化目标下进行端到端训练。 视觉驱动的加速进化机器人控制系统概览。 研究团队首先建立了一套 虚拟感知系统 。 他们让真实机器人在不同距离和视角下观察足球,累计采集约一小时的数据,再与动捕系统记录的真实位置进行对照,由此得到位置噪声、检测成功率、更新频率和延迟等感知特征。 这些特征随后被带入仿真。足球距离越远,位置噪声越大;相机视野会随机器人头部姿态变化。即使足球出现在视野中,也可能因为运动模糊等原因检测失败。视觉系统以约 25Hz 更新,平均延迟约 116 毫秒。 视觉短暂中断后,控制器还需要根据此前的信息继续判断足球的位置和运动趋势。为此,论文设计了 编码器 — 解码器架构 。 策略会读取过去 50 帧、约一秒的历史观测,再将这些信息压缩为 64 维隐藏状态。训练阶段,解码器会尝试从隐藏状态还原足球真实位置和机器人动力学参数。这项辅助任务帮助策略完成视觉去噪,也让它能够在足球短暂消失后继续估计目标位置。 负责输出动作的 Actor 只能使用真实机器人能够获得的部分观测,训练阶段的 Critic 则可以访问仿真环境中的完整状态,为策略优化提供额外信息。解码器和 Critic 在部署到真机后都会被移除。 为了让动作更加自然,团队还引入了 对抗运动先验 AMP 。训练数据包括约 76 秒的人类全向行走动作和 30 秒脚弓射门动作数据。判别器负责判断机器人动作与人类示范的接近程度,强化学习策略继续围绕追球和进球优化。 镜像对称约束进一步帮助机器人掌握左右脚射门,避免收敛到单侧踢球。最终,找球、追球、调整落脚点和射门被放进同一个策略,控制器以 50Hz 输出关节位置指令。 策略形成的五类动作模式,包括左右脚射门、直行和左右转向。彩色轨迹为策略生成动作,灰色点为人类参考动作。 训练过程中还涌现出不少自主行为 。 足球接近视野边缘时,机器人会主动转头和转身,把球重新移回视野。在球场边缘找不到足球,它通常先朝向场地中心,再扩大搜索范围。 步态也会随足球距离变化。距离较远时,机器人采用较慢的步频,每个步态周期约 0.7 至 0.8 秒,以维持稳定观察;接近足球后,周期缩短到 0.3 至 0.4 秒,通过更短、更快的步伐微调落脚点。 当球门位于身后,策略甚至会生成一种旋转钩射动作,机器人以支撑脚为轴转身,另一条腿从侧面将球勾向球门,省去重新站位的时间。 这些变化最终也反映在实验数据上 。 射门前一秒内,原始视觉观测中的足球位置误差为 0.344 米,经过策略内部状态估计后,误差降至 0.186 米,降幅约 46%。在仿真中,当视觉检测被短暂中断 0.3 秒时,机器人的触球成功率仍超过 90%,进球率超过 50%。面对静止足球,学习策略从启动到触球通常只需约 1.5 秒,传统规则系统需要约 2 至 5 秒,最高耗时降幅达到 64%。 学习策略与当前 RoboCup 先进规则策略的对比。(
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱