智能AI
morning
大模型后训练,破解多模态分布性遗忘!7B模型七项基准全线提升
摘要
新智元报道 DeepSeek-R1之后,「让模型想得更久」几乎成了提升推理能力的标准答案。 但对多模态大模型而言,推理 token 更多,并不必然意味着视觉推理更充分。恰恰相反,模型在开头还能准确描述图像,随着生成内容不断累积,后续推理却可能越来越依赖自己写出的文字。 只要早期描述出现一点偏差,错误就会沿着自回归链条被反复引用、逐步放大,最后得到一个语言上严丝合缝、视觉上完全失真的答案。 这不是简...
Remember
https
的轨迹
严格来说
新智元报道
DeepSeek
R1之后
让模型想得更久
几乎成了提升推理能力的标准答案
但对多模态大模型而言
2026-08-09
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 DeepSeek-R1之后,「让模型想得更久」几乎成了提升推理能力的标准答案。 但对多模态大模型而言,推理 token 更多,并不必然意味着视觉推理更充分。恰恰相反,模型在开头还能准确描述图像,随着生成内容不断累积,后续推理却可能越来越依赖自己写出的文字。 只要早期描述出现一点偏差,错误就会沿着自回归链条被反复引用、逐步放大,最后得到一个语言上严丝合缝、视觉上完全失真的答案。 这不是简单的「没看见」,而是 看见之后没能一直记住 。 从后训练角度看,问题还可以进一步抽象:在典型的自回归多模态模型中,视觉条件在生成开始时已经固定,语言轨迹却随着推理持续增长。如果强化学习只奖励最终答案,训练目标就不会主动区分两类轨迹——一类始终以图像为依据,另一类中途丢失视觉证据、靠语言先验碰巧答对。 久而久之,策略优化就可能把概率质量分配给「答案正确但证据失真」的轨迹。本文将这种由 rollout数据分布、序列结构与稀疏结果奖励共同诱发的系统性视觉衰减 ,概括为「分布性视觉遗忘」。 西北工业大学、香港科技大学和浙江大学的研究团队提出 Remember-R1 ,试图从源头上修正这一偏置:不修改推理流程,而是在强化学习后训练中加入三种过程奖励,让模型不仅要答对,还必须在整条推理链中持续表达、保留并准确调用视觉证据。 论文链接:https://arxiv.org/abs/2608.01314 代码链接:https://github.com/Ch921-cell/Remember-R1 模型链接:https://huggingface.co/JM-Chen/Remember-R1-7B 要理解 Remember-R1,首先要区分两个看似相近的问题: 视觉感知失败: 模型从一开始就没有识别出关键物体、属性或空间关系; 视觉记忆失败: 模型最初读取了正确证据,却在长链推理中逐渐减少对图像的依赖。 Remember-R1针对的是第二种。其关键矛盾可以写成一句话: 视觉证据是固定条件,语言状态是增长变量;模型越往后推理,越容易被自己生成的文本重新定义上下文。 假设同一个问题产生两条推理轨迹: 轨迹 A 在每个关键步骤都重新调用图像证据,最终答对; 轨迹 B 在中途脱离图像,依靠语言先验或早期描述继续推演,也最终答对。 如果奖励函数只检查最终答案,那么两条轨迹得到的结果奖励几乎相同。对强化学习来说,它们都是「好样本」。这构成了一个典型的 轨迹不可辨识问题 :结果监督知道终点是否正确,却不知道模型为什么到达这个终点。 当这种不可辨识性与长序列中的自回归累积叠加,视觉遗忘就不再只是偶发错误。每轮 rollout 都可能产生一批「碰巧答对但已经不看图」的轨迹;如果这些轨迹继续获得正向优势,策略就会逐渐提高它们的生成概率。最终,被强化的不只是某个答案,而是一种越来越偏向文本自洽、越来越远离视觉证据的推理分布。 严格来说,这种偏置并非静态训练集单独造成,而是由三者共同形成: 模态分布不对称: 视觉条件固定,文本上下文持续增长; 信用分配稀疏: 最终答案奖励难以定位视觉依赖从哪一步开始衰减; 正确轨迹不唯一: 相同答案背后,可能对应完全不同的证据路径。 现有方法通常在推理阶段补救:重新插入原图或局部图像,或者增加视觉声明和验证步骤。 它们解决的是「模型忘了之后如何再看一次」。Remember-R1则把问题前移到后训练阶段,追问的是: 能否从一开始就让模型少学那些会忘记图像的轨迹? 从「答案正确」到「证据正确」 Remember-R1的核心,不是简单给模型多发几种奖励,而是重新定义什么叫「值得强化的推理」。 从优化视角看,它的总奖励可以抽象为: 总奖励 = 答案正确性奖励 + 视觉词汇奖励 + 视觉记忆奖励 + 视觉关键区域奖励 其中,答案正确性奖励决定模型有没有完成任务,另外三项奖励则约束模型用什么方式完成任务。 严格来说,论文将后三项称为过程奖励,而不是传统损失函数中的 L1、L2 或KL正则项。 但从策略优化的作用来看,它们构成了 行为层面的奖励正则化 :通过提高视觉忠实轨迹的相对收益,缩小「可接受策略」的范围,阻止模型沿着纯文本捷径继续优化。 第一层:用视觉词汇奖励约束「说了什么」 研究团队先从训练图像中提取物体类别、颜色、大小、数量和空间关系等短视觉词组,再通过严格的词或短语匹配,统计回答覆盖了哪些视觉事实。 奖励不仅取决于匹配了多少视觉词,还取决于这些词最后一次出现的位置。视觉证据覆盖越充分、在推理链中保持得越久,得分越高。 这一项约束的是视觉证据的 语义分布 :不能只在开头说一句「图中有……」,随后就进入纯语言推理;关键视觉事实必须持续出现在后续轨迹中。 第二层:用视觉记忆奖励约束「看了多久」 只要求模型反复说出视觉词,还不能证明它真的在使用图像。为此,Remember-R1从模型最后一层提取每个生成步骤对视觉 token 的注意力,并比较推理早期和后期的平均水平。 如果后期视觉注意力快速下降,奖励就会降低;如果模型在整条推理链中保持相对稳定的视觉依赖,奖励就会提高。 这一项约束的是视觉依赖的 时间分布 。它不要求注意力绝对不变,而是直接惩罚「越想越不看」的系统性衰减。 第三层:用关键区域奖励约束「看向哪里」 模型持续看图,并不意味着它看对了地方。无差别关注整张图像,同样可能制造虚假的视觉忠实。 研究团队将训练样本中的关键区域映射到对应的视觉 token,计算注意力落在问题相关区域的比例,并对推理后期赋予更高权重。模型不仅要保持视觉注意力,还要把有限的注意力预算持续分配给真正决定答案的区域。 这一项约束的是视觉注意力的 空间分布 ,防止模型通过「形式上看图、实际上看错位置」来获取奖励。 三层奖励由此形成完整闭环: 视觉词汇奖励约束证据有没有进入语言轨迹; 视觉记忆奖励约束证据有没有贯穿推理前后; 视觉关键区域奖励约束模型调用的是不是有效证据。 它们与答案正确性奖励共同进入 GRPO 训练。对同一个问题生成的多条 rollout,依据视觉证据完成推理的轨迹会获得更高相对优势,逐渐占据更多策略概率;中途滑向纯文本推理的轨迹则被压低。 最终训练集包含 38,657 个经过筛选的样本,每个样本都带有视觉关键词和关键区域标注。这里的数据标注不是为了继续向模型灌输视觉知识,而是为奖励函数提供过程锚点,让后训练能够识别「模型何时开始忘记、忘记了什么、注意力又偏向哪里」。 7B模型七项基准全涨 给推理过程增加约束,最直接的风险是过度正则化:模型可能为了反复提及图像而生成冗余描述,也可能因为注意力被强行拉回视觉 token,损害原有的推理和感知能力。 因此,Remember-R1需要回答两个问题:奖励正则化能否跨任务提升推理,以及这种提升是否以牺牲基础视觉能力为代价。 实验覆盖数学与逻辑推理、综合多模态能力和视觉感知三类任务。 Remember-R1-7B在七项基准上均高于对应基座模型,与其他视觉遗忘缓解方法相比也展现出更具竞争力的整体表现。 其中: MathVista从62.30提升至69.80,增加 7.50 分 ; MMVet从59.44提升至72.37,增加 12.93 分 ; RealWorldQA从69.28提升至69
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱