智能AI
morning
面向视觉语言模型的强化隐空间推理:先分解、看,再推理|EMNLP'26
摘要
新智元报道 大模型的推理能力越来越强,但到了真正需要「看图推理」的任务上,一个核心问题依然没有被彻底解决: 模型究竟是在「看着图推理」,还是把图看了一遍之后,主要靠文本链条继续猜? 针对这一问题,来自美国埃默里大学的研究团队提出了 Decompose, Look, and Reason(DLR) ,并被 EMNLP 2026 Main Conference 接收。 论文地址: https://ar...
Decompose
Look
visual
Reason
与视觉latent策略P
新智元报道
大模型的推理能力越来越强
但到了真正需要
看图推理
的任务上
2026-09-27
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 大模型的推理能力越来越强,但到了真正需要「看图推理」的任务上,一个核心问题依然没有被彻底解决: 模型究竟是在「看着图推理」,还是把图看了一遍之后,主要靠文本链条继续猜? 针对这一问题,来自美国埃默里大学的研究团队提出了 Decompose, Look, and Reason(DLR) ,并被 EMNLP 2026 Main Conference 接收。 论文地址: https://arxiv.org/pdf/2604.07518 DLR目标是缓解多模态Chain-of-Thought中「文本推理不断延长,但视觉证据逐步弱化」的问题。它的核心思想很直观:让视觉语言模型像人一样,在复杂问题中不断执行: Decompose → Look → Reason 也就是: 先拆解问题,再针对当前子问题「看」图,最后基于刚刚获得的视觉证据进行推理。 研究背景 多模态推理中的视觉信息瓶颈 视觉语言模型(VLM)已经能够在视觉问答、数学图表理解和跨学科多模态任务中执行较长的推理链。 然而,与纯文本推理不同,多模态推理需要在离散语言序列与高维连续视觉表示之间反复交互。 一个关键问题是:当模型进入较长的语言CoT之后,后续推理是否仍然由充分、准确的视觉证据支撑。 已有方法大致沿三条路线发展。第一类text-only multimodal CoT将视觉信息压缩为文本描述,然后主要在语言空间中继续推理;这会产生不可避免的信息损失。 第二类interleaved CoT或「thinking with images」方法在中间步骤引入图像patch、bounding box、crop、zoom或外部视觉工具,能够增强显式grounding,但也引入额外工具调用成本,并受预定义操作空间限制。 第三类latent visual reasoning将中间视觉信息投影到连续嵌入空间,但现有方法常依赖局部ROI / patch,或仅在整个reasoning chain中注入一次视觉latent。 论文指出,局部ROI并不总能与「当前推理步骤真正需要的语义证据」一致:它可能包含过多无关上下文,也可能无法覆盖跨区域关系、全局布局或抽象视觉概念。与此同时,多步推理往往要求模型在不同阶段检查不同证据,因此单次视觉注入难以支撑完整的推理轨迹。 Decompose–Look–Reason循环 DLR将一个复杂视觉推理过程表示为由多个中间步骤组成的轨迹。第t步包含文本premise p⁽ᵗ⁾、连续视觉latent z⁽ᵗ⁾和基于该视觉证据生成的rationale r⁽ᵗ⁾,最终得到答案a。其核心是把「提出需要验证的问题」和「从图像中提取对应证据」显式耦合起来。 Decompose:动态生成需要视觉验证的premise: VLM根据当前推理上下文决定下一步需要确认的视觉事实,并生成一个明确的premise或sub-question。该步骤回答的是「接下来需要验证什么」。 Look:提取premise-conditioned visual latents: visual grounder以premise结束位置的hidden state为条件,对图像特征执行cross-attention,输出一组连续视觉latent。与固定ROI或单一patch不同,这些latent可以编码局部细节、跨区域关系以及非局部视觉语义。 Reason:基于视觉latent生成grounded rationale: VLM在注入视觉latent后生成当前步骤的rationale,并据此继续下一轮decomposition,直至得到最终答案。由此,视觉证据不再只是推理开始时的一次性输入,而成为整个reasoning trajectory中可动态更新的条件。 图1:DLR总体框架。VLM文本策略负责生成premise与rationale;visual grounder根据premise提取连续视觉latent。训练阶段联合优化文本策略P θ 与视觉latent策略P ϕ 。 从概率建模角度,DLR将文本生成策略P θ 与视觉latent策略P ϕ 共同纳入推理过程。 更准确的textual decomposition可以为visual grounder提供更明确的条件,而更具任务相关性的视觉latent又能够反过来改善后续rationale,因此二者形成相互依赖的联合优化过程。 三阶段训练 从跨模态对齐到连续隐空间强化学习 Stage I:Visual Grounder Pretraining 第一阶段冻结预训练VLM主干,训练轻量visual grounder。模型使用一组learnable latent queries对图像特征进行条件化提取,并通过双向InfoNCE对比学习,使聚合后的visual latent与目标答案的文本语义对齐。 该阶段的作用是建立稳定的跨模态初始化,使latent能够在给定文本条件时提取对应视觉语义。 Stage II:Supervised Fine-tuning 第二阶段通过监督微调学习结构化的DLR轨迹。训练样本显式包含、、与等结构。 VLM学习何时提出新的视觉premise;visual grounder则根据premise hidden state生成连续latent,并通过后续rationale与答案的语言建模损失获得梯度。 SFT能够使模型内化DLR格式,但latent提取仍主要是deterministic feature extraction,缺乏显式探索。 Stage III:Reinforcement Finetuning for Continuous Latents 第三阶段进一步将强化学习从离散文本token扩展到连续视觉latent。 标准GRPO可以直接优化文本token的离散策略,但对连续latent缺少天然的token-level probability distribution。DLR因此构造了一个可显式计算策略密度与importance ratio的视觉latent policy,并与文本policy联合优化。 在超球面上进行语义探索 视觉-语言表示通常采用cosine similarity衡量语义相似性,因此语义信息往往更多编码在向量方向而非模长中。论文据此将视觉表示视为近似位于unit hypersphere上的语义流形,并提出Spherical Gaussian Latent Policy (SGLP)。 visual grounder首先预测L2-normalized mean direction μ ϕ ,在其附近加入高斯扰动,再将采样结果重新投影到unit hypersphere。这样可以将探索重点放在语义方向上,从而减少将语义变化与magnitude variation混合在一起的风险。 在强化学习阶段,DLR基于Dr. GRPO的group-relative advantage,同时优化文本策略与latent policy。 实验设置与主要结果 实验以Qwen3-VL-8B-Thinking为backbone,评测覆盖四个以视觉为中心的benchmark:V* Bench(细粒度属
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱