智能AI
morning
相同的证据,不同的判断:视觉/语音文本冲突中的证据不可交换
2026-09-25
1 阅读
约1分钟阅读
Zhuoyun Li, Boxuan Wang, Xiaowei Huang, Yi Dong
字号:
arXiv:2609.26986v1 公告类型:新 摘要:对于多模态大语言模型,当图像或语音与伴随文本发生冲突时,测量的文本依赖度可能会将模态偏好与证据位置纠缠在一起。早期对文本偏见的研究经常使用固定的证据顺序或随证据移动任务指令,从而导致顺序的贡献不明确。在本文中,我们使用配对比较,保持指令和证据内容固定,并仅交换两个来源的位置来量化这种潜在影响。在视觉和语音模型中,在冲突的文本之后放置图像或录音会始终将答案转向其内容。我们还回顾了之前的研究并分析了为什么他们的实验设置会导致误导性的结论。这些发现揭示了跨模态证据的不可交换性:相同的证据在顺序改变时可能会导致不同的判断,而稍后放置感知证据可以增加模型对其内容的依赖。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱