首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

大型语言模型中的稳定误校准:高置信度错误的实用观点

摘要

arXiv:2608.13591v1 Announce Type: new Abstract: High-confidence errors in large language models are often treated as evidence of fragile internal inference. We study a different possibility: stable mi...

audit confidence errors stable and than models are fragile internal
2026-08-17 1 阅读 约1分钟阅读 Akira Okutomi
分享:
字号:
arXiv:2608.13591v1 公告类型:新 摘要:大型语言模型中的高置信度错误通常被视为脆弱内部推理的证据。我们研究了一种不同的可能性:稳定的误校准,其中确信的错误答案在小扰动下保持局部稳定。我们结合了两种诊断:标签感知的输出级审计分数,根据强制答案基线下的置信度变化和过度自信的错误对域进行排名,以及测量隐藏状态运动的内部敏感性探针。在多域二元事实审计集上,该审计分数跟踪弃权意识自我批评减少决策损失的地方,尽管直接标记的基线对相同的收益排名更高。在内部,自我批评提示持续降低了三个开放权重模型中各层的隐藏状态敏感性。这支持提示引起的局部稳定,而不是纯粹的输出水平弃权模式,但它并不意味着校准:审计定义的过度自信错误并不明显比自信的正确答案更局部敏感,因此一些高置信度错误可能是稳定的和错误校准的,而不是简单地脆弱。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱