智能AI
morning
共享学习率并不是选择性同策略蒸馏中的中立控制
摘要
arXiv:2609.22109v1 Announce Type: new Abstract: Selective on-policy distillation trains a student only at the token positions a selector scores highest, and the literature compares selectors under a s...
the
rate
selector
and
selective
arm
for
student
not
dense
2026-09-22
1 阅读
约2分钟阅读
Chencheng Zhu
字号:
arXiv:2609.22109v1 公告类型:新 摘要:选择性同策略蒸馏仅在选择器得分最高的标记位置训练学生,并且文献在单一共享学习率(选择为中性的控制)下比较选择器。我们证明事实并非如此。在 GSM8K 上的 LoRA 下(Qwen2.5-1.5B 学生,7B 教师),在 8 倍学习率网格中,密集监督在统计上是平坦的(波动 1.8 pp,p=0.26),而每个选择性臂以速率移动:随机 5% 子集为 5.4 pp,总变异选择器为 6.7 pp,可教性选择器高达 17.7 pp。因此,密集与选择性的判决在 lr=1e-4 处为 10.1 pp,但在 5e-5 处为 5.1 pp,这是由协议视为风景的参数决定的 2.0 倍差异,并且选择器之间的六个成对显着性调用中的两个在相邻速率之间翻转,没有任何排名反转。我们将这种选择器速率纠缠称为选择器速率纠缠,并将其追溯到选择本身而不是步长:尽管各臂之间存在 15.5 倍的梯度范数差异,但 AdamW 更新幅度将速率跟踪在 2.2% 以内。预先注册的冷冻评分消融(由最初的学生评分;标准、预算和政策推出不变;每个细胞 12 个种子)显示实时评分增加了 3.79+/-1.69 pp 的速率敏感性 (p=0.035),而冷冻臂仍然显着缠结 (p=0.015):反馈循环加剧了这种现象,而不是导致这种现象。在按照本文实际使用的速率(1e-6 到 1e-5)进行全面微调的情况下,模式会增长:密集本身摆动 19.8 pp,选择性臂摆动 49.5 pp,结论范围从公布的操作点的非显着性 +3.6 pp 到更热的 +34 pp (p=0.005)。在 MATH-500 上,LoRA 下不会重现速率依赖性,从而确定结果的范围,而选择性训练的约 10 pp 成本则会重现。我们规定报告臂 x 速率矩阵,而不是共享速率列,作为选择器比较的前提条件。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱