智能AI
morning
基于移除的方法来提高 LLM 在测试时的忠诚度
摘要
arXiv:2609.04343v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly used for consequential decisions, making their explanations an important tool for auditing model behavior....
the
and
model
that
explanation
faithfulness
time
for
explanations
LLM
2026-09-07
1 阅读
约1分钟阅读
Qinglan Luo, S M A Nahian, John Guttag, S. Mazdak Abulnaga, Katie Matton
字号:
arXiv:2609.04343v1 公告类型:新 摘要:大型语言模型 (LLM) 越来越多地用于后续决策,使其解释成为审核模型行为的重要工具。不幸的是,这些解释可能不忠实,无法反映模型决策背后的实际推理。我们考虑这样一种设置,其中法学硕士针对问题提供答案和解释。我们确定了不忠实解释的两个不同维度:不完整性,意味着解释忽略了影响答案的因素;不健全,意味着解释引用了不影响模型答案的因素。提高 LLM 忠实度的现有方法包括训练时方法(需要访问模型权重和大量计算资源)和测试时方法(主要侧重于解决不合理性)。我们引入了一种直接针对不完整性的测试时方法。我们从输入中删除模型解释中未提及的概念,并根据减少的输入重新查询模型。这消除了未提及的影响,同时保留了所提及概念的影响。在两个数据集、多个模型系列和两个独立的忠诚度指标中,与标准提示和鼓励忠诚度的提示相比,我们的方法提高了解释的忠诚度。我们的方法与模型无关,可以在推理时应用而无需修改模型参数,为减少隐藏影响并提高LLM辅助决策的可靠性和安全性提供了灵活的机制。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱