首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Transformer开始构建三维世界:开源模型几张图片秒级生成可探索3D场景

摘要

编辑|Sia、晓楠 从 2D 像素到 3D 场景 Query,影溯正在尝试把三维内容生产推向可规模化调用的新阶段。 围着桌上的小摆件随手拍几张照片,几秒后,有趣的一幕发生了。 它们竟从二维照片中「立 」了起来,变成了一个可以把玩的 3D 内容。 没有扫描、几乎不用等待,咔嚓几下就能生成。 我又用手机从不同角度给楼下的咖啡店拍了 6 张照片。这个空间也立刻被保存在了手机里。 就连家里的卧室,也在咔嚓...

Query Topos Lite 纹理更清晰 https Gaussian QuerySplat 视图设置中 与其他方法相比 场景结构也更加干净稳定
2026-08-05 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|Sia、晓楠 从 2D 像素到 3D 场景 Query,影溯正在尝试把三维内容生产推向可规模化调用的新阶段。 围着桌上的小摆件随手拍几张照片,几秒后,有趣的一幕发生了。 它们竟从二维照片中「立 」了起来,变成了一个可以把玩的 3D 内容。 没有扫描、几乎不用等待,咔嚓几下就能生成。 我又用手机从不同角度给楼下的咖啡店拍了 6 张照片。这个空间也立刻被保存在了手机里。 就连家里的卧室,也在咔嚓几声后,变成了一个可以自由探索的 3D 空间。 聚餐、桌搭、毕业、搬家、婚礼、日常生活 ...... 手机能随手记录下当下重要的时刻,把能进入的场景发给身边的朋友,真的十分有趣。 这款 App 叫 Crystal 空间相机 ,是影溯( InSpatio ) 将最新研究成果做成的一款免费 3D 捕捉工具,让每个人都能轻松体验亲手拍摄 3D 空间照片的感觉。 这背后的技术,是影溯正式开源的前馈式 3D Gaussian Splatting 生成技术 QuerySplat。只需输入 少量 不同视角、 无需 提供相机位姿的图片,即可在一次前向推理中, 秒级 生成可自由切换视角的 3D 场景。 在大规模 DL3DV-Evaluation 基准的 2、4、12 视图设置中,Topos-Lite 在 PSNR 和 SSIM 指标上均取得 最优结果 ;在更关注感知相似度的 LPIPS 指标上,也在 2 视图和 4 视图设置中 排名第一 。 更直观的变化是,模型生成的物体边缘更锐利、纹理更清晰,跨视角结构也更稳定。 同样输入5张图片后,与其他方法相比,Topos-Lite生成结果(Ours)中的主体轮廓更完整,纹理更清晰,场景结构也更加干净稳定。 这一次,影溯选择将 QuerySplat 开源,不只是公开一项技术成果,更希望推动前馈式 3D 生成从少数团队的前沿探索,走向整个行业可以共同验证、持续迭代的技术基础,加速 3D 内容生产真正迈向规模化,并创造出更多好玩的 3D 应用。 项目主页: https://inspatio.github.io/querysplat/ GitHub 与模型权重: https://github.com/inspatio/querysplat 技术报告: https://arxiv.org/abs/2608.01186 从像素到场景: 让 Transformer 不再只围着二维图片工作 Topos-Lite 最值得关注的地方,并不只是把 3D 场景做得更清楚,而是 改变了模型组织三维空间的方式 。 Topos-Lite 架构图 过去不少前馈式 3DGS 方法采用 像素对齐( Pixel-Aligned) 的范式。可以把它理解为:模型先从每张图片的每个像素出发,预测这个像素在三维空间里对应什么,再把大量预测组合成一个场景。 但它有一个 先天问题 :高斯点仍然被牢牢绑定在二维图像的像素和相机射线上。不同视角中的像素稍有误差,就可能在三维空间里产生冲突,最终表现为重影、漂浮、结构偏移,或者大量小尺度、低效率的高斯球。 这有点像几个人从不同角度给同一只花瓶描轮廓,再把几张透明描图纸叠在一起。理想情况下,瓶口、瓶身和底座应该准确重合。但只要其中一张稍微画偏,叠起来就会出现双重轮廓,周围还可能留下零散的线条。 Topos-Lite 采用的是 Query-based 的思路。 它不再要求每个高斯点首先属于某一个像素,而是 让一组可学习的 Query 充当 「场景级位置 」 。每个 Query 可以跨越不同图片、不同区域聚合信息,再在连续三维空间中生成一组 Gaussian Primitives。 这让 Transformer 熟悉的 Query 和 Attention 机制,在这项工作中真正承担起组织三维场景的角色:Query 不再只是围绕二维 Token 工作,而是成为连续三维空间中的场景槽位。 少量图片、无需手动标定、秒级生成 只需输入数量不等、未经相机标定的随手拍照片,模型便能在无需相机位姿的情况下,通过一次前向推理快速生成可自由切换视角的3D Gaussian场景。与其他方法相比,其生成结果中的主体轮廓更完整,纹理更清晰,场景结构也更加干净稳定。 传统高质量 3DGS 往往需要围绕一个场景采集大量图片,获得或计算相机参数,再对这个场景单独进行较长时间的优化。它可以得到很好的结果,但每遇到一个新场景,就要重新做一遍。 前馈模型改变的是成本结构 。模型训练完成后,面对一个新场景,不再从头优化,而是直接完成一次预测。就像图像生成模型不会为每张新图片重新训练一样,3D 场景生成也开始从每个项目单独制作,变成一种可以被重复调用的通用能力。 对普通用户而言,这带来 三 个最直接的变化 :需要拍摄的图片更少、不需要手动提供专业相机标定信息、等待时间从传统流程压缩到秒级。 从结果来看,Topos-Lite 在 DL3DV-Evaluation 的多种稀疏视图设置中取得了 当前最强 的整体表现。 特别是在 4 视图设置中,模型 在 PSNR、SSIM 和 LPIPS 三项指标上均排名第一 。即使只输入两张图片,它也保持了领先的结构和渲染质量。 定性比较。 SOTA 效果之外,Topos-Lite 还提供了明确的 容量扩展接口 。 训练过程中,Query 数量可从 1,024 逐步扩展至 8,192,每个 Query 解码一组 Gaussian Primitives。更强的几何骨干、更大的 Decoder、更多 Query,以及更高分辨率的外观特征,都可以分别扩展。 这还不能被简单称为已经证明了 「 3D Scaling Law 」 ,但它至少说明了一件重要的事:前馈化解决了新场景的边际生成成本,Query 化则为场景表达容量留下了继续扩展的入口。速度和质量不再必须二选一。 值得一提的是,Topos-Lite 的性能还处于早期研究阶段,远未触及天花板。在数据规模效应的持续驱动下,其 3D 生成的品质与精细度将持续跃升 ;更值得期待的是, 未来该模型将有能 力在端侧高效运行 ,实现3D内容的本地化快速生成,解锁更广阔的应用场景。 下一代人工智能为什么一定要理解空间? 在影溯看来,过去十年,人工智能主要在学习人类已经表达出来的世界,而下一阶段,它需要进一步理解世界本身。语言是智能理解人类文明的入口,空间则是智能进入真实世界的基础。 图片和视频当然包含丰富的空间线索,但本质上仍然是三维世界在特定时间、特定视角下的二维投影。同一个房间可以拍出无数张不同画面,但背后不变的仍是房间本身的三维结构。 因此, 二维更像是 Observation,三维则更接近 State 。 如果模型只从二维像素中学习,它不仅要理解场景,还要反复处理视角、投影、遮挡和光照造成的变化。视频中的大量帧,可能只是在不同位置、不同时间重复记录同一面墙、同一张桌子。模型必须从这些高度冗余的观测中,反推出背后相对稳定的空间结构。 而引入三维,意味着将 「世界是什么 」 和 「我们怎样看见世界 」 分开。模型可以学习一种更紧凑、更稳定的空间表征,并理解这一状态如何在不同视角和条件下生成不同观测。它不必反复记忆大量相似画面,也更有机会持续追踪环境、物体及其相
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱