首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

机械断层扫描:面向控制的可解释性的设计测量

摘要

arXiv:2608.19338v1 Announce Type: new Abstract: Mechanistic interpretability seeks quantities that models do not expose directly: represented states, component effects, interactions, and responses to ...

the and interventions measurements map error that different access target
2026-08-21 1 阅读 约2分钟阅读 Vijay Erramilli
分享:
字号:
arXiv:2608.19338v1 公告类型:新 摘要:机制可解释性寻求模型不直接公开的数量:表示的状态、成分效应、相互作用和对干预的反应。修补、梯度、Hessian 向量积和子集干预在不同的访问假设下提供不同的测量,并且可能针对不同的数量。我们将他们共享的测量结构制定为机械断层扫描:为恢复内部机制和干预效果而设计的测量。对于选定的基础和干预系列,测量采用 y = Ax + w 的形式,其中 A 描述干预措施,x 是目标图,w 包含非线性响应、采样误差和基础错误指定。这种语言给出了一个实用的程序:从成本最低的测量开始,在预期规模上测试保留的干预措施,校准简单的不匹配,并在存在结构化残差时扩展测量系列。控制提供了要求严格的验证设置,因为指导干预的估计充当观察者。在二隐马尔科夫模型中,控制误差随着观察者误差的增加而增加,而目标改进可以隐藏令人讨厌的状态运动。在仅前向访问下,稀疏聚合测量可以用比坐标修补更少的干预来恢复有限效应图。通过梯度访问,有限探针改进了局部归因图。提升测量和 Hessian 向量积可以恢复一阶映射忽略的相互作用,而 Tracr 表明所需的族取决于基础。在 GPT-2-small IOI 上,Name Mover-Negative Name Mover 交互是三个测试的跨组对中最大的保留预测项。在 Qwen-2.5-7B 上,有限校准使得加性拒绝响应图足够,因此保留误差不支持成对提升。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱