智能AI
morning
变压器残余流中的几何和行为分层
摘要
arXiv:2608.12447v1 Announce Type: new Abstract: Trained transformer models develop privileged bases: coordinate axes whose statistics differ from the rest of the residual stream. But what kind of dire...
the
and
prediction
direction
with
privileged
axes
anchor
The
readout
2026-08-14
1 阅读
约1分钟阅读
Nelson Guda
字号:
arXiv:2608.12447v1 公告类型:新摘要:经过训练的变压器模型开发了特权基础:其统计数据与剩余流的其余部分不同的坐标轴。但这样的基础选择什么样的方向呢?我们研究了预测方向,即模型当前预测的令牌的非嵌入方向,并发现它充当内容定义的特权锚。相对于该锚进行测量,残余流变化根据与预测的接近程度在几何和行为上分层。分层在所有 18 个测试模型中都成立(密集模型和专家混合模型、7B-120B、基础模型和指令调整模型)。狭窄的、尺度不变的预测接口集中了与读出相关的结构,而巨大的预测远端补充随着模型尺度的扩展而扩展。由于预测方向几乎与主方差轴正交,因此基于方差的分析只能部分恢复这种组织,并且缺陷会随着异质性的迅速增加而增加。锚定揭示了陡峭的几何梯度:预测邻近区域是高度结构化且与集群相关的提示,而补集则更平坦并且在提示组之间具有反歧视性。界面是一个狭窄的部分,但在功能上是决定性的。破坏最接近预测的方差方向会导致立即发散和频繁的任务框架转移;扰乱下一个级别可以延迟发散并保留框架。该补码在每个方向上的读出对齐较弱,但在因果上和时间上具有承载能力,并且行为是由方向而不是大小驱动的。这些结果将预测方向确立为与先前描述的坐标轴不同的特权锚点,并给出了高维计算如何与线性读数共存的几何解释。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱