智能AI
morning
学习预测 MLLM 中的中间层注意力以实现视觉令牌修剪
摘要
arXiv:2608.06411v1 Announce Type: new Abstract: Multimodal large language models (MLLMs) achieve strong performance across diverse vision-language tasks, but their efficiency is limited by the cost of...
the
layer
visual
attention
language
tokens
from
token
model
MAP
2026-08-10
1 阅读
约1分钟阅读
Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu
字号:
arXiv:2608.06411v1 公告类型:新 摘要:多模态大语言模型(MLLM)在不同的视觉语言任务中实现了强大的性能,但其效率受到处理大量视觉标记的成本的限制。视觉令牌修剪可以降低此成本,但需要准确的令牌重要性估计。最近的研究表明,来自中间语言模型层的文本到视觉注意力可以有效地指导视觉标记修剪,通常使用来自预定义中间层的注意力来选择要保留的视觉标记。因此仍然存在两个问题。首先,我们的分析表明,注意力对问题最敏感的层在不同样本中差异很大,使得固定层不是最优的。其次,从适当的中间层获得注意力需要通过多个语言模型层处理大量视觉标记,此时已经花费了大量的计算。为了解决这两个问题,我们提出了中间层注意力预测(MAP),它使用问题对比教师选择通过对比原始问题和参考问题下的注意力来识别特定于样本的教师层,并将所选层的注意力提炼为轻量级预测器,该预测器根据多模态输入特征估计视觉标记重要性。在推理过程中,MAP 将预测的重要性得分与多样性标准相结合,以在第一个语言模型层之前修剪视觉标记。因此,MAP 不需要注意图来进行修剪,并且与现有的推理加速技术保持兼容。在 LLaVA-NeXT-7B 的 10 个基准测试中,MAP 保留了 97.5% 的未剪枝模型性能,而仅包含 5.56% 的视觉标记,从而实现了 3.09 倍的端到端加速。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱