首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

全球首个,连续时间具身世界模型!任意帧率自由生成

摘要

新智元报道 让机器人把一只虾夹起来,再放进锅里。 真正困难的,可能不是认出虾,也不是找到锅,而是把握夹爪闭合的那个瞬间:早一点,夹爪会落空;晚一点,虾可能已经被推走。夹住之后,机械臂还要连续调整力度、方向和速度。整个过程没有暂停键,也不会等摄像头拍完「下一帧」再继续。 但许多视觉世界模型认识时间的方式,恰恰来自这些被摄像头截取的画面。它们看到第1帧、第2帧、第3帧,并学习如何从一张图跳到下一张图。...

https Flow 新智元报道 让机器人把一只虾夹起来 再放进锅里 真正困难的 可能不是认出虾 也不是找到锅 而是把握夹爪闭合的那个瞬间 早一点
2026-08-06 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 让机器人把一只虾夹起来,再放进锅里。 真正困难的,可能不是认出虾,也不是找到锅,而是把握夹爪闭合的那个瞬间:早一点,夹爪会落空;晚一点,虾可能已经被推走。夹住之后,机械臂还要连续调整力度、方向和速度。整个过程没有暂停键,也不会等摄像头拍完「下一帧」再继续。 但许多视觉世界模型认识时间的方式,恰恰来自这些被摄像头截取的画面。它们看到第1帧、第2帧、第3帧,并学习如何从一张图跳到下一张图。至于两帧之间发生了什么、换一种帧率后该如何预测,甚至某个关键瞬间缺失后如何还原,模型通常没有一条可以直接查询的连续轨迹。 问题也由此变得具体: 如果机器人对世界的理解只存在于一格格画面里,它要怎样抓住发生在两帧之间的那一瞬间? 来自清华大学智能产业研究院(AIR)与UC Berkeley BAIR的研究团队提出了ODEWorld——全球首个连续时间具身世界模型。它不再只问「下一帧是什么」,而是直接学习世界在每个时刻朝什么方向、以多快的速度变化,并由此还原一条随真实物理时间连续演化的潜空间轨迹。 论文链接:https://arxiv.org/abs/2607.27924 项目主页:https://dstate.github.io/odeworld_website/ 这项工作的关键,并不是单独增加了一项「补帧」功能。只要模型掌握的是一条连续的变化轨迹,就可以在任意时刻读取状态:需要更高帧率时,从轨迹上增加采样点;观测缺失时,查询中间时刻;需要回看变化来源时,则沿轨迹反向求解。原本分散的生成能力,因此被统一成了同一个连续时间问题。 团队将这套预测范式称为Physical-Time Flow,简称PT-Flow;基于PT-Flow构建的连续时间潜空间世界模型,则被命名为ODEWorld。 离散预测的时间边界 设机器人在时刻t的状态表征为 。传统离散模型通常学习一个状态转移函数: 其中c可以是目标图像或任务指令。 这种建模方式并非无效,但它将预测能力绑定在预先设定的时间步长上。训练视频按照固定频率采样,模型学习的也是相邻采样点之间的跳转。当查询时刻落在两个训练帧之间,或者输入序列缺少部分观测时,离散模型本身并没有一条显式的连续轨迹可供查询。 PT-Flow改为学习潜状态关于真实物理时间的导数: 这里的 是潜空间速度场,输出当前状态在下一瞬间的变化方向和速度。给定参考状态z0后,未来状态可以通过常微分方程求解器积分得到: 静动态解耦 为速度场构造干净的潜空间 把视频变成连续方程,首先需要找到一个适合由ODE描述的状态空间。 在机器人视频中,大量视觉内容没有发生变化。桌面、墙壁和物体纹理可能连续数秒保持静止,真正推动任务进程的只有机械臂、夹爪、目标物体以及接触关系。若让速度网络同时拟合静态背景与少量运动区域,动态信号会被大量零变化或噪声特征淹没。 ODEWorld因此没有直接在像素空间中建立速度场。它首先使用冻结的DINOv2编码器,将图像压缩为视觉特征 ;随后再通过一组以初始状态为条件的动态编码器与解码器,提取真正负责描述变化的潜变量: 编码器和解码器都能直接看到s0。静态场景信息因此可以从参考状态中取得,zt没有必要重复保存背景,只需概括当前状态相对s0发生了什么变化。 这种解耦带来了非常激进的压缩:原始DINO特征大小为16×16×768,而ODEWorld的动态潜变量只使用一个1×768token。基于这个单token,速度场只需由一个轻量的三层MLP参数化,时间信息通过FiLM注入;zt、z0和目标条件c则共同决定速度网络的输出。 直接监督「状态怎么变」 拥有紧凑潜空间,并不意味着模型一定能学到稳定的连续动力学。潜空间世界模型长期面临的一个问题是表征坍缩:如果编码器把不同画面都映射到相似向量,预测器就很容易得到较低损失,但这些向量不再包含足够的状态信息。 ODEWorld的关键设计,是不只比较预测状态与目标状态是否一致,而是直接监督潜状态的一阶时间导数。 由于动态编码器满足 ,根据链式法则: s0在一次预测过程中保持不变,因此它关于时间的导数为零。训练数据虽然只提供离散帧,却可以利用相邻特征估算 。 再通过雅可比向量积(Jacobian-vector product,JVP),模型无需显式构造巨大的雅可比矩阵,就能把视觉特征空间中的变化速度投影到动态潜空间,得到 。 速度网络的训练目标由此写成: 其中sg⁡表示停止梯度,用于稳定速度场优化。论文中的进一步实验显示,即使移除停止梯度,模型仍然能够有效训练,说明一阶速度约束本身已经为潜空间提供了较强的结构性约束。 这与典型JEPA式训练存在明显区别。后者通常要求预测潜变量接近目标编码器产生的潜变量,并依赖EMA、停止梯度或额外的方差与协方差约束来避免坍缩。 ODEWorld则把「状态如何沿时间移动」直接写进监督目标:如果所有状态都坍缩到相同表示,模型便无法解释非零的真实变化速度。 论文采用RankMe衡量表征的有效秩。在相同采样协议下,ODEWorld的768维动态潜变量平均有效秩为425.2;DINOv2 CLS特征为376.1;V-JEPA 2的1024维表征为203.7。 更高的有效秩意味着潜空间保留了更多彼此独立的变化维度,也表明单token并不等于信息贫乏。 Savitzky–Golay滤波 理论上,最简单的状态速度可以由相邻帧差分得到: 但ODEWorld使用的是冻结的DINOv2图像编码器。DINOv2主要为单帧视觉表征设计,并没有专门保证连续视频中的时间一致性。即便像素只发生轻微变化,相邻帧特征也可能包含高频抖动;直接将这些差分当作物理速度,会把视觉编码噪声一并交给速度场。 团队因此使用Savitzky–Golay导数滤波器估计 。 它在局部窗口内进行多项式平滑和求导,在抑制高频噪声的同时,尽量保留接触、抓取和物体移动等关键变化。论文的潜轨迹可视化显示,ODEWorld生成的轨迹比原始DINO特征以及离散下一步预测基线更加平滑,同时仍保留原特征空间的主要几何结构。 这也揭示了PT-Flow的一个重要边界:模型学习的不是已知解析物理方程,而是在数据中寻找一个适合连续积分、又能保留任务语义的潜空间动力系统。它追求的是可用于未来预测的连续表征,并不是从视频中恢复唯一的真实控制方程。 一条速度场 统一三类生成能力 完成训练后,未来预测不再依赖重复调用固定步长的下一帧模型,而是使用RK4等现成ODE求解器沿速度场积分。查询时间点可以自由选择,由此自然产生三类能力。 第一是任意时间分辨率生成。希望动作更慢,就在轨迹上查询更多、更密集的时刻;希望快速推进,则减少采样点。模型无需为不同播放速度单独训练。 第二是时间补全。论文将训练序列降采样到原始帧率的三分之一,ODEWorld仍能查询训练数据未提供的中间时刻并生成连贯状态。这里的「补帧」并非简单的像素插值,而是从学习到的潜空间动力学轨迹中解码对应时刻。 第三是反向生成。将积分方向反转,即令 ,同一速度场就能生成物理上合理的反向序列。这并不意味着模型能够还原任意系统唯一、真实的历史,也不意味着所有现实过程严格可逆;它说明模型学习到的潜空间流可以在相反方向上进行稳定数值积分。 64帧预测更快 长程画面也更稳
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱