智能AI
morning
潜在事实检查:通过激活工程检测错误信息
摘要
arXiv:2608.06417v1 Announce Type: new Abstract: The proliferation of misinformation online has driven demand for scalable detection systems. While most existing approaches rely on surface-level lingui...
the
and
The
misinformation
models
direction
for
detection
retrieval
model
2026-08-10
1 阅读
约2分钟阅读
Pedro Barcelos, Ot\'avio Parraga, Marcelo M. Mussi, Lucas M. Fraga, Lucas S. Kupssinsk\"u, Rodrigo C. Barros
字号:
arXiv:2608.06417v1 公告类型:新 摘要:网上错误信息的激增推动了对可扩展检测系统的需求。虽然大多数现有方法依赖于表面语言特征或外部知识检索,但我们将真实性视为语言模型表示空间的几何属性。我们引入了一种基于激活工程的错误信息检测框架,该框架利用了变压器模型的潜在几何结构。我们的方法通过对比成对的真实和错误陈述的激活,遵循对比激活加法(CAA)的均值差异原则,在残差流中引出错误信息方向。在推理时,未见过的声明的最后一个令牌激活被投影到这个方向,并且投影的表示被馈送到多层感知器(MLP)进行分类。该过程不需要对主干模型进行微调,不需要外部证据检索,也不需要除了用于估计方向的对比对之外的特定于任务的监督。我们在 Gemma、Llama 和 Qwen 系列的 11 个模型(参数范围从 270M 到 12B)上基于三个事实检查基准(AVeriTeC、LIAR 和 FACTors)评估了该方法。虚假方向在模型规模和架构系列中是可恢复的,并且最后的令牌投影匹配或超过 LIAR 和 FACTors 上的零样本和少样本提示基线,对于较小的模型观察到最大的增益。 AVeriTeC 的性能更加有限,我们将其归因于其基于证据的标签方案。这些发现提供了证据,证明真实性是预训练语言模型潜在空间中的一个结构化的、线性可分离的概念,并指出可解释性驱动的错误信息检测作为基于检索的管道的实用补充。该代码可在 https://github.com/Malta-Lab/LaFaCt 上获取。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱