首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能

摘要

一段人坐上椅子的视频,对人类而言再普通不过。我们不仅能看见 “人坐了下来”,还天然理解椅子承受人体重量,人与椅面形成接触并最终稳定,这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言,“看见动作” 与 “重建真实交互” 仍是两回事。一个视觉上准确坐在椅子上的人体,进入物理仿真后,椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。 视觉上成立,并不意味着物理交互上成立。...

HSImul3R 视觉正确 Simulation Physics the Loop https Ready 物理闭环 Scene
2026-09-21 1 阅读 约10分钟阅读 机器之心
分享:
字号:
一段人坐上椅子的视频,对人类而言再普通不过。我们不仅能看见 “人坐了下来”,还天然理解椅子承受人体重量,人与椅面形成接触并最终稳定,这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言,“看见动作” 与 “重建真实交互” 仍是两回事。一个视觉上准确坐在椅子上的人体,进入物理仿真后,椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。 视觉上成立,并不意味着物理交互上成立。 近日,大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布全新人–场景交互重建研究 HSImul3R,直指三维视觉长期存在的 “感知 — 仿真鸿沟”,推动三维重建从 “视觉正确” 走向 “物理可执行”。该成果已被全球计算机视觉顶级会议 ECCV 2026 正式接收。不同于传统方法主要关注人和场景是否重建得像、是否对齐,HSImul3R 将 重 力稳 定性、真实接触与交互稳定性 纳入核心评价标准。团队将其定义为首个面向非标定稀疏视角输入、实现稳定可仿真(Simulation-Ready)人–场景交互重建的框架,并进一步支持单目视频输入。与此同时,团队构建了面向人–场景交互的 HSIBench ,直接检验重建结果能否在物理仿真中稳定交互。HSImul3R 在 Easy、Medium、Hard 三档任务中的交互稳定率分别达到 53.68%、30.56% 和 13.92% ,显著高于 HSfM 的 10.52%、4.50% 和 2.66% ,并将人–场景三维穿模率从 69.51% 降至 22.90% 。 为实现这一目标,HSImul3R 提出 物理闭环(Physics-in-the-Loop)双向优化框架, 让物理仿真器从最终检验工具变成重建过程中的主动监督者。一方面,通过 面向场景的强化学习(Scene-targeted Reinforcement Learning)优化人体运动,使其既物理可行,又能与当前场景稳定交互;另一方面,通过直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO) ,利用交互后的仿真反馈反向优化三维场景。最终,团队将优化后的人体动作迁移至 Unitree G1 人形机器人,贯通日 常图像 / 视频 → 三维人–场景交互重建 → 物理仿真优化 → 人形机器人动作迁移 → 真实机器人执行 的完整链路,让人类视频中的交互经验从视觉信息进一步转化为 可仿真、可学习、可执行的机器人技能资产 。 Paper:《HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions》 ArXiv: https://arxiv.org/abs/2603.15612 Project: https://yukangcao.github.io/HSImul3R/ GitHub:https://github.com/yukangcao/HSImul3R、 从 “视觉正确” 到 “物理成立”:重新定义三维重建 近几年,三维重建、人体运动估计与人–场景交互建模持续发展,机器从图像和视频中恢复三维世界、理解人类行为的能力不断提升。但传统方法大多仍以几何准确、姿态还原和视觉对齐为主要标准,回答的更多是 “人和场景重建得像不像”。问题在于,机器人最终面对的是一个由重力、碰撞、摩擦与接触共同决定的物理世界。一个视觉上高度可信的场景,进入仿真器后可能立即失效:椅子可能因为结构缺失无法站稳,人体与物体也可能发生穿模,原本看似正确的交互因此无法真正成立。 HSImul3R 概览图 HSImul3R 因此将评价标准从 “视觉正确” 进一步推进到 “物理成立”,把 重力稳定性、真实接触和交互稳定性 纳入重建过程。它不再只要求人和场景在画面中对齐,而是要求重建结果能够真正进入物理仿真,并保持原有的人–场景交互关系。更关键的是,HSImul3R 并非先完成重建、再用仿真器验证,而是提出 物理闭环(Physics-in-the-Loop) 双向优化机制 ,让仿真反馈直接参与重建。正向过程优化人体,反向过程修正场景,物理仿真器由最终的 “裁判”,转变为整个重建过程中的主动监督者。 不只是动作可行,更要让交互真正成立 物理闭环的第一步,是让恢复出来的人体运动真正适应当前场景。传统动作跟踪与强化学习通常更关注人体自身是否稳定、动作是否接近原始轨迹,但即使人体动作在物理上成立,也可能已经偏离原有的人–物交互关系。例如,一段 “坐在椅子上” 的动作经过普通运动优化后,人体可能为了保持平衡而偏离椅子。人虽然没有摔倒,但 “坐椅子” 这一原本的交互已经消失。对于具身智能而言,只做到 “动作可行” 显然还不够。 去除面向场景的强化学习,仿真中出现非预期的物体位移,且难以稳定交互 为此,HSImul3R 提出 面向场景的强化学习(Scene-targeted Reinforcement Learning) ,在运动跟踪基础上进一步加入场景交互约束。系统通过人体关键接触点与物体表面的空间关系,使优化后的动作既忠实于原始观测,又能与当前场景保持正确、稳定的接触。也就是说,HSImul3R 优化的不是一条抽象意义上 “符合动力学” 的人体轨迹,而是一段 能够在特定场景中真正成立的物理交互。 “坐下” 意味着人必须真实坐到这把椅子上,而不是只在空间中复现一个相似动作。 用真实交互反过来优化三维世界 但仿真失败并不一定意味着 “人动错了”,也可能是场景本身没有重建正确。尤其在人类遮挡严重、桌腿或椅腿等结构较细的场景中,图像生成三维模型(Image-to-3D)容易产生结构缺失或几何畸变,即使人体动作合理,也无法支撑真实交互。针对这一问题,HSImul3R 在反向过程中提出 直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO) ,直接利用物理仿真的交互结果作为监督信号,反向优化三维物体生成模型。评价标准也由 “物体自己能不能站稳”,进一步提升为 “人与它交互之后还能不能稳定”。 图像到三维物体重建的定性对比 团队将仿真反馈划分为从 “物体在重力下失稳” 到 “人与物体实现稳定交互” 的四种状态。只有当物体自身稳定、交互后仍保持稳定,并且人与物体之间确实形成有效接触时,重建才被认为真正成立。因此,一把椅子即使单独放在地面上不会倒,如果人坐上去就倾覆,或者人与椅子最终完全分离,它仍然没有被真正 “重建对”。HSImul3R 由此把评价标准从 “物体自身是否物理合理” 推进到 “物体在人–场景交互中是否物理合理”,让人类交互本身成为优化三维世界的重要监督信号。 HSIBench:不只看 “像不像”,更要看 “能不能交互” 为了验证这一新的评价体系,团队进一步构建了面向人–场景交互的 HSIBench 。数据集包含 19 个场景物体、超过 50 段人体动作序列和 300 个独立交互实例 ,由 3 名参与者完成,每个案例均从 16 个视角同步采集。与传统三维重建基准更多关注几何误差不同,HSIBench 将人–场景交互稳定性(Stability-HS
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱