智能AI
morning
从「看见」到「补全」:哈佛、MIT与港科大Stream3D打通流式3D重建与生成
摘要
如何从一段视频中获得完整、稳定的 3D 物体?过去,这个问题大致沿着两条路线发展。 一条是 3D 重建:把不同视角中真实观察到的几何逐步拼接起来。它擅长忠实恢复「已经看见」的部分,但在输入视角有限、遮挡严重或物体背面从未出现时,往往只能留下缺口或不完整的表面。另一条是 3D 生成:借助大规模数据中学到的先验,从单张图像推断并补全一个完整物体。它能够生成输入中没有直接出现的结构,却也可能对同一物体的...
Stream3D
token
https
github
Lab
项目主页
自适应证据记忆
证据分数
如何从一段视频中获得完整
稳定的
2026-08-03
1 阅读
约10分钟阅读
机器之心
字号:
如何从一段视频中获得完整、稳定的 3D 物体?过去,这个问题大致沿着两条路线发展。 一条是 3D 重建:把不同视角中真实观察到的几何逐步拼接起来。它擅长忠实恢复「已经看见」的部分,但在输入视角有限、遮挡严重或物体背面从未出现时,往往只能留下缺口或不完整的表面。另一条是 3D 生成:借助大规模数据中学到的先验,从单张图像推断并补全一个完整物体。它能够生成输入中没有直接出现的结构,却也可能对同一物体的不同视角作出彼此矛盾的「想象」。 这两种范式长期各有所长:重建强调观测忠实度,生成强调先验补全能力。但当输入不再是一张图片,而是一段持续到来、没有预设终点的单目视频流时,真正需要的或许不是二选一,而是让生成模型像重建系统一样不断吸收新证据,再利用生成先验补全仍未被观察到的部分。 近日,来自香港科技大学 World Mind Lab、麻省理工学院 Media Lab 与 EECS、哈佛大学 Kempner Institute 的研究团队提出 Stream3D,试图打通这两条路线。它为冻结的视图条件 3D 生成器加入一套训练免费的流式机制:模型一边从视频流中持续筛选并积累可靠的多视角证据,一边生成跨时间、跨视角一致的完整 3D 结果。 更重要的是,Stream3D 不需要重新训练,也不修改底层生成器的模型结构。它只保存固定容量的证据记忆,使跨分块状态不随视频长度线性增长。换句话说,SAM 3D、TRELLIS、Hunyuan3D 等原本面向单图或固定多视角输入的生成模型,由此获得了一种类似在线重建的持续观测能力。 图 1:在诸多样例中,Stream3D 利用连续到来的多视角信息,生成结果比逐帧使用 SAM3D 更接近真实 3D。 论文标题:Stream3D: Sequential Multi-View 3D Generation via Evidential Memory 作者:Kaichen Zhou、Zeyang Bai、Xinhai Chang、Mengyu Wang、Paul Pu Liang、Fangneng Zhan 论文地址: https://arxiv.org/abs/2605.21472 项目主页: https://stream-3d.github.io/stream3d.github.io/ 开源代码: https://github.com/kaichen-z/STREAM3D 从一张图到一段视频 为什么这么难? 现有视图条件 3D 生成器通常假设输入是一张图片,或一组预先确定、数量有限的图片。面对开放式视频流,最直接的几种做法都有明显短板。 第一种是 逐帧独立生成 。每一帧都能得到一个看似合理的 3D 物体,但模型没有历史记忆,同一物体未被观察到的部分可能在不同时间被 “脑补” 成不同形状,最终表现为明显的时间不一致。 第二种是 保留并反复处理全部历史帧 。它能够利用更多视角,却会让计算量和内存占用随视频长度持续上升,很难支持真正开放式的长序列。 第三种是 传递潜变量状态 ,例如复用 KV Cache,或通过 FlowEdit 一类方法把上一段的潜特征带到下一段。但 3D 生成器的方向、形状和尺度纠缠在潜空间中,不同视角之间很难准确对齐;误差一旦进入缓存,还可能在长序列中不断累积。 Stream3D 的出发点因此很直接: 与其搬运越来越重、也越来越不稳定的潜变量,不如只记住哪些历史视角真正提供了可靠证据 。 核心武器:自适应证据记忆 图 2:Stream3D 整体框架。输入视频按分块到来,注意力探针计算逐 token 证据分数,自适应证据记忆保留高价值历史视角,再由 Top-K 视角共同驱动冻结的 3D 生成器。来源:Stream3D 项目主页,对应论文 Figure 2。 Stream3D 在每个视频分块上执行两步计算:先进行一次轻量的预热前向传播,从交叉注意力中判断当前视角是否可靠;再根据更新后的记忆,选择一组信息量最高的历史帧进行完整 3D 生成。整个过程由三个关键环节组成。 1. 注意力探针:让模型自己判断「这一眼有多重要」 在一次单步去噪的预热过程中,Stream3D 读取冻结生成器的交叉注意力图。对每个 3D 查询 token,它不仅关注某个输入视角获得了多强的注意力,也关注这种注意力是否足够集中、足够有区分度。 由此得到的 Evidence Score(证据分数) 可以理解为:对于 3D 空间中的某个局部区域,当前视角是否提供了强而明确的观察证据。一个视角可能非常适合判断物体正面的纹理,却未必能解释背部结构;因此 Stream3D 不使用全局统一的「最佳帧」,而是为不同 token 分别记录可靠视角。 2. 自适应证据记忆:固定容量,只留更强证据 Stream3D 为每个查询 token 维护两个固定大小的列表:一个保存 Top-D 证据分数,另一个保存这些分数对应的帧索引。新视频分块到来后,只有比已有记录更可靠的视角才会进入记忆;没有被任何 token 选中的帧可以直接丢弃。 这一设计带来两个重要性质: 跨分块记忆最多只需保存两组 Q × D 数值,大小与视频总长度 T 无关,因此不会随着「看得更久」而线性膨胀。 对每个 token 和每个记忆排名,缓存的证据分数只会保持或提高。需要强调的是,这是 证据空间中的单调性 ,并不等同于每一次随机生成的成品都必然单调变好。 图 3:随着 Chunk 0、4、8、12 依次到来,高证据历史视角被写入固定容量记忆,生成网格逐步获得更完整的几何和纹理信息。来源:Stream3D 项目主页,对应论文 Figure 3。 3. 基于证据的多视角生成:让 token 为历史帧投票 到了完整生成阶段,每个 token 会根据自己的 Top-D 列表,为最能解释它的历史帧「投票」。系统汇总这些局部选择,计算每一帧覆盖了多少重要 token,再选出得票最高的 Top-K 帧作为当前分块的条件输入。 这种做法与随机挑帧或选择一组全局代表帧不同:物体的不同表面可以从不同历史视角中取证。被选中的多视角通过置信度加权的融合方式共同参与生成,而底层 3D 生成器始终保持冻结。 实验见真章: 当生成模型开始像重建系统一样积累证据 主实验显示,Stream3D 的提升并不只来自生成更多「看起来合理」的纹理。在 GSO 与 NAVI 上,它同时改善了 Chamfer Distance、IoU 等几何指标,以及 PSNR、LPIPS、Image FID 等外观指标。这意味着,多视角证据不仅约束了最终渲染结果,也真正改变了模型恢复出的 3D 结构。 更能体现其方法定位的,是与流式重建模型 StreamVGGT 的对比。StreamVGGT 沿着 reconstruction 路线持续预测并融合输入图像对应的 3D 点图;Stream3D 则把真实观测转化为生成过程中的条件证据。为尽量减少「背面从未被看到」对重建方法造成的不利影响,实验为 StreamVGGT 选取了 32 个覆盖完整角度的输入视角,并通过反投影得到其不直接支持的新视角结果。即便如此,Stream3D 仍在几何和外观指标上取得更好的整体表现,其中 Chamfer Distance 为 0.0
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱