智能AI
morning
至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%
2026-08-17
1 阅读
约9分钟阅读
思邈
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1% 思邈 2026-08-15 14:42:23 来源: 量子位 允中 发自 凹非寺 量子位 | 公众号 QbitAI 大模型机制可解释性研究中,一直存在一个颇具反差的现实: 为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。 Transcoder、稀疏特征模块等方法会学习一组新的内部单元,用它们近似原模型某一层或某个模块的计算,再通过保留、移除这些单元来寻找任务回路。 这些方法推动了机制可解释性的发展,但也带来了一笔不小的额外成本:新的表示需要数据和优化,而且一旦替代模块没有充分复现原模块,后续分析就可能同时解释模型行为和替换误差。 说白了,研究者想打开一个黑箱,却往往需要先训练另一个“小黑箱”。 问题不只是训练成本。任务回路需要找到一组可以独立干预的内部计算:只保留它们时,相关能力仍然存在;移除它们时,模型表现则明显下降。 训练型替代表示通常还需要针对不同模型、层和checkpoint分别拟合,使大规模、系统性的回路分析更加困难。 更理想的方案应当同时保持原模型行为、提供可独立干预的单元,并能以较低成本直接从已有权重中构造。 至知创新研究院(IQuest Research) 与Safe AI Forum、牛津大学、斯坦福大学、清华大学的合作者提出了一条更直接的路线: 不再训练一套独立替代网络,而是从现有的预训练权重中直接“拆”出可干预单元。 这套方法名为 稀疏权重分解 (Sparse Weight Decomposition,SWD)。 它把一个稠密权重矩阵分解为两个稀疏矩阵,并把二者共享的中间维度变成可独立评分、选择和消融的瓶颈单元。研究者由此可以直接在权重上抽取任务回路。 论文给出了三个值得关注的结果: 在匹配替换保真度的单矩阵实验中,SWD使用的数据 不到Transcoder等训练型基线的1% ; 在GPT-2、Qwen2.5和Qwen3.5-27B的任务回路实验中,SWD通常以 更少的瓶颈单元和活跃连接 达到相同的充分性、必要性目标; 方法不仅扩展到了27B模型,还覆盖了GPT-2 Small 全部48个注意力和MLP权重矩阵 ,并提供了完全不需要校准文本的zero-data版本。 论文地址:https://arxiv.org/abs/2608.03913 △SWD方法概览。预训练模型中的稠密权重被分解为两个稀疏因子,共享中间坐标成为可独立评分、选择和消融的瓶颈单元。 直接把权重拆成“稀疏路径” SWD的出发点很简单。对于预训练模型中的稠密权重矩阵W,寻找两个稀疏矩阵A和B,使得 W ≈ AB. A和B共享m个中间维度。第i个维度先通过A的第i列从输入中读出一个标量,再通过B的第i行写向输出。这样,一列和一行共同构成一个瓶颈单元,也就是一条固定的rank-one读写路径。 可以把它想象成在一张极其密集的交通网络中增加一组“中转站”:每个中转站只连接少量入口和出口。研究者不仅可以看到一条路径从哪里读取、向哪里写入,还可以单独关闭它,观察模型行为会发生什么变化。 真正困难的地方,是如何在大幅减少连接的同时,仍然保留原权重对模型激活的作用。SWD使用少量校准文本产生的层输入,优化分解前后的输出误差;求解过程中交替更新两个因子,通过硬阈值维持非零预算,并重新拟合保留下来的权重值。分解完成后,每个瓶颈单元都可以像稀疏特征一样参与任务归因、排序和消融,但不需要再训练一套独立的神经替代网络。 △从权重分解到回路抽取。Step 1将稠密权重分解为稀疏因子A和B;Step 2按任务归因对瓶颈单元排序,并选择top-k单元组成任务回路。 已经有SVD,为什么还需要SWD? 既然目标是直接分解权重,一个自然的问题是:为什么不直接使用奇异值分解(SVD)? SVD同样可以把一个矩阵表示为rank-one成分之和,而且不需要训练数据。近期的NaNA等方法也已经证明,SVD成分可以用于任务排序和干预。 但对回路分析而言,单元数量少,并不等于真正的计算路径少。 SVD成分的读方向和写方向通常都是稠密的。即使只保留少数成分,它们仍可能连接几乎所有输入和输出维度。 SWD则进一步把稀疏性施加到每个单元的读写连接上:少量单元对应的同时也是少量活跃连接。 团队还构造了两个能够精确还原GPT-2原权重的稠密对照:保留全部奇异值的full-rank SVD,以及采用随机正交基的Random-B。 两种分解都能在数值上精确复现原矩阵,但在相同的归因和消融流程下,需要更多活跃连接才能达到与SWD相同的任务表现。 这组对照表明,SWD的优势并不是“把矩阵拆开”这么简单,真正关键的是 每个单元都具有稀疏的读写结构 。 △精确稠密分解对照。Full-rank SVD与Random-B都能精确还原原始权重,但需要比SWD更多的活跃连接才能达到相同的充分性或必要性要求。 不到1%的数据,仍能保持模型行为 在进行回路分析之前,首先要回答一个更基础的问题:把原权重换成稀疏分解之后,模型还是原来的模型吗? 团队使用留出文本上的交叉熵差值(CE delta)衡量替换保真度,并使用KL散度和替换位置的激活重构误差进行补充验证。CE delta越接近0,说明替换后的模型行为越接近原模型。 在GPT-2 Small第8层mlp.c_proj的单矩阵实验中,SWD仅使用数千个校准token就进入低CE误差区间;Transcoder和VPD-Recon-CI等训练型基线则需要约10⁶量级的optimizer-replay token才能接近这一替换质量。同样的趋势随后出现在Qwen2.5-0.5B、1.5B、3B和Qwen3.5-27B上。 综合论文中的单矩阵比较,在达到匹配替换保真度时,SWD使用的数据不到训练型替代表示的1%。这意味着,大量数据和长时间替代模块训练并不是获得高保真回路单元的必要前提。直接从预训练权重出发,也可以构造足够忠实的干预表面。 △GPT-2 Small单矩阵替换的CE delta随数据量变化。SWD使用少量校准数据即可进入低误差区域。 △Qwen2.5-3B与Qwen3.5-27B的单矩阵替换结果。横轴为构造替换表示所使用的token数,纵轴为相对稠密模型的CE delta。 保留时能支撑任务,移除时会破坏任务 高保真地复现原矩阵,只能说明所有瓶颈单元合在一起能够工作。真正的回路还必须满足两个更严格的条件:只保留少量选中单元时,任务行为仍然存在;只移除这些单元时,任务表现会明显下降。前者是充分性测试,后者是必要性测试。 团队先在独立训练划分上使用一阶任务归因对候选单元排序,再构造从top-1、top-2到top-k的嵌套回路,并在留出测试集上评估。回路成本同时使用两种口径衡量:选中了多少瓶颈单元,以及这些单元实际包含多少非零读写连接。 在GPT-2 Small的GreaterThan、IOI、Docstring和Gend
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱