智能AI
morning
法学硕士可以注释归因图
摘要
arXiv:2608.02632v1 Announce Type: new Abstract: Circuit tracing is an exciting technique for revealing the internal computation of language models, but it requires a time-intensive manual step of grou...
pipeline
for
supernodes
simple
that
our
tracing
the
language
step
2026-08-05
1 阅读
约1分钟阅读
Ameen Patel, Max Zhang, Nathan Hu
字号:
arXiv:2608.02632v1 公告类型:新 摘要:电路追踪是一项令人兴奋的技术,用于揭示语言模型的内部计算,但它需要耗时的手动步骤,将各个特征或 MLP 神经元分组为超级节点。我们提出了一个简单的管道来自动化此步骤:直接将特征描述呈现给语言模型,将它们分组为超级节点。使用自动可解释性指标,我们确认我们的管道生成的超级节点与人类注释者生成的超级节点一样可解释。在两跳 Capitals 任务中,我们的管道在 100 个提示中的 97 个提示中恢复了与中间跳相对应的超级节点。最后,我们使用开放式探索的管道提出了一个简单的概念证明,其中我们自动注释来自维基百科提示完成的 1000 个归因图,然后使用法学硕士法官来标记值得人工审查的有趣图表。我们希望这项工作表明,即使是简单的自动化也可以产生有意义的归因图注释,从而激励自动化电路追踪的进一步工作。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱