智能AI
morning
视觉和语言转换器的损伤感知强盗修剪
摘要
arXiv:2609.05448v1 Announce Type: new Abstract: Structured post-training pruning of transformers requires selecting complete functional units whose suppression causes limited degradation. We formulate...
the
and
evaluation
are
batch
Tiny
comparisons
transformers
units
suppression
2026-09-09
1 阅读
约2分钟阅读
Salem Ameen, Sunil Vadera
字号:
arXiv:2609.05448v1 公告类型:新 摘要:变压器的结构化训练后修剪需要选择完整的功能单元,其抑制会导致有限的退化。我们将语言和视觉转换器的结构化单元选择制定为固定候选评估预算下的损伤感知多臂老虎机问题。注意头和 MLP 通道组在校准批次上暂时被屏蔽。成对损坏是同一批次的屏蔽损失减去基本损失,从而减少批次之间的差异。平滑有界奖励驱动 UCB 式策略或部分 Beta Thompson 采样,并且通过在每一步添加一个单元来按顺序构建最终掩码。所选单元在原始密集检查点中功能归零;因此,报告的参数效应代表有效的结构抑制,而不是物理压缩或测量的加速。 WikiText-2、LAMBADA 和 Imagenette 上的实验涵盖 GPT-2、OPT、Pythia、Qwen2.5、SmolLM2、ViT-B/16、DeiT-Tiny 和 Swin-Tiny,并与随机、幅度、静态显着性和预算贪婪选择进行比较。在五个种子中,老虎机方法通常会减少配对语言模型比较中相对于预算贪婪的退化。在论文中强调的 28 个比较中,23 个引导置信区间排除了零,11 个配对检验的 p < 0.05;在 116 个数据集测试的整个系列中,经过 Benjamini-Hochberg 校正后,有 6 个的 q < 0.05。 ViT-B/16 和 Swin-Tiny 的匹配评估结果表明,它们的收益不仅仅可以用较大的候选评估预算来解释。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱