智能AI
morning
知与说的差距:当调查发现信心错过的错误时
摘要
arXiv:2608.07528v1 Announce Type: new Abstract: Linear probes detect corrupted context in language models with near-perfect accuracy, yet this does not translate into reliable failure prediction. The ...
and
models
with
error
across
model
probes
detect
not
into
2026-08-11
1 阅读
约1分钟阅读
Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk
字号:
arXiv:2608.07528v1 公告类型:新 摘要:线性探针以近乎完美的精度检测语言模型中损坏的上下文,但这并不能转化为可靠的故障预测。结果是对部署监控产生直接影响的分离。在多跳算术链上,检测损坏的探针并不能提供有关最终答案正确性的信息;被迫采用结构化置信格式的模型会崩溃为两个值,并且错误率无法区分;跨跃点的探测持久性无法区分正确结果和错误结果,反驳了我们预先注册的“持久性击败峰值”假设。这种知而不言的模式适用于包括推理模型在内的模型系列。作为实时监控器,基于探测的干预措施与模型和错误类型密切相关:分支选择在各个模型中都是净正的,并且在 Llama-3.1-8B 上具有独特的非破坏性(4 个已获救,0 个已损坏),而重新提示和替换先验会以大致与拯救错误跟踪的速度一样破坏正确的跟踪。基于探针的监控是对口头信心的必要补充,但没有单一干预占主导地位,可部署的答案是模型感知、错误类型感知的路由。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱