智能AI
morning
Temperon:全职 SAM 质量,减少三分之一的挂钟
摘要
arXiv:2609.17575v1 Announce Type: new Abstract: Sharpness-aware minimization (SAM) doubles the cost of every training step, yet its benefit concentrates where training ends. We study where an expensiv...
the
SAM
and
Muon
cost
SGD
epoch
training
its
where
2026-09-17
1 阅读
约2分钟阅读
Stamatis Mastromichalakis
字号:
arXiv:2609.17575v1 公告类型:新 摘要:锐度感知最小化(SAM)使每个训练步骤的成本加倍,但其好处集中在训练结束的地方。我们研究了昂贵的训练模式应该用在哪里,并提出了 Temperon:一个普通的 SGD 探索器,用于 epoch 预算的前 43%,然后一个预定的交接,将整个最终余弦退火交给 SAM 包裹的 Muon 精炼器。在 CIFAR-10/100、SVHN 和 Tiny ImageNet(五个种子,报告的时间为 epochs-to-target 时间乘以空闲 GPU 校准的 epoch 成本)上,Temperon 在所有准确度上都与最佳的全职 SAM 配方相匹配,同时在四个中的三个上更快地达到最难的共同目标 35%、34% 和 32%,并且在同等成本下比已发布的 SAM+SGD 配方高出一层。消融使归属变得准确:Muon 精炼器价值 +0.85pp,其他所有内容均固定;探索者的形状及其重新启动毫无价值,我们将其作为贡献撤回。以匹配的预算重新运行最接近的竞争对手后期 SAM 显示了边界:它对每个中级目标都是最快的,但任何种子中都没有 SGD 精炼方法达到 Muon 精炼器购买的层(CIFAR-100 上为 0.83,CIFAR-10 上为 0.97),而在 Tiny ImageNet 上,Muon 没有购买任何层,竞争对手只是获胜 - 该方法的测量边界。分配法则转移到 GPT-2 预训练(-29% 挂钟的全 SAM 质量)和 GLUE 微调(绝不会比全职 SAM 差,但 SAM 成本只有三分之一)。两个常数组织了经济学:提前跳过 SAM 会购买固定信用,而在所有四个数据集上,Muon 历元的成本是 SAM+SGD 历元的 1.50 倍。最后,切换不能根据轨迹来计时:在余弦调度下,精度曲线是平稳然后激增,因此信息存在于调度中,使得调度切换有原则性而不是方便性。代码和可安装 pip 的实现已发布。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱