智能AI
morning
DEEPO:MLLM 中幻觉的双熵增强策略优化
摘要
arXiv:2609.28570v1 Announce Type: new Abstract: Reinforcement learning (RL) is widely used to sharpen reasoning in multimodal large language models (MLLMs), yet its effect on hallucination is uneven. ...
the
hallucination
correction
level
advantage
gradient
and
its
queries
with
2026-09-25
1 阅读
约1分钟阅读
Yingxuan Zhuang, Miao Pan, Wangjie Gan, Jingxiao Yang, Fan Wang, Weiming Liu, Cheng Tan, Xuhong Zhang, Jintao Chen
字号:
arXiv:2609.28570v1 公告类型:新 摘要:强化学习(RL)被广泛用于增强多模态大语言模型(MLLM)中的推理能力,但其对幻觉的效果并不均衡。我们将其追溯到从奖励到参数更新的\emph{校正链}中的两个弱点。在推出级别,硬查询(具有高语义熵的查询)经常产生一致错误的样本组,从而在幻觉风险最高的地方将组相对优势降至零。在优化级别,自信但错误的标记是梯度不可见的:分类策略的预期得分梯度范数随着其分布的锐化而消失,因此最需要修正的预测会收到最弱的更新。我们提出了双熵增强策略优化(DEEPO),这是一种将信号方差正则化与梯度预处理相结合的双阶段增强:语义熵触发的专家前缀在高不确定性查询上注入接地延续,提供直接监督并恢复优势方差,而优势符号感知的 Renyi 预处理抵消了对数级饱和,因此校正达到了操作置信度中的置信错误。两个分支分别比 GRPO 有所改进;它们的交互在 VideoMMMU 上具有统计显着性——我们的评估套件中最复杂的长期任务(+4.0$, 95\% CI [1.1, 6.9])——并且在其他地方也具有附加性。 DEEPO 减少幻觉,同时保持准确性和训练稳定性。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱