智能AI
morning
当 Muon 遇到任务干扰:持续学习和模型合并的光谱视角
摘要
arXiv:2608.27518v1 Announce Type: new Abstract: Continual learning (CL) and model merging (MM) both aim to obtain a single model that performs well across multiple tasks, challenged respectively by ca...
the
and
that
optimizer
task
model
this
interference
Muon
across
2026-08-31
1 阅读
约2分钟阅读
Shangge Liu, Yuehan Yin, Yinghuan Shi, Lei Wang, Wenbin Li
字号:
arXiv:2608.27518v1 公告类型:新 摘要:持续学习(CL)和模型合并(MM)都旨在获得在多个任务中表现良好的单一模型,分别面临灾难性遗忘和权重解缠错误的挑战。在文献中,这些困难只是单独处理并通过各种解决方案来缓解,而基础优化器引起的几何形状被视为实现细节。在这项工作中,我们表明这两个困难实际上是同一现象的两个实例:对一项任务有用的参数更新会将模型的输出转移到另一项任务上。我们将这种共享现象形式化为 \textit{任务干扰} 并将其简化为常见的分层 Frobenius 内积 $\langle \Delta W_\ell, J_\ell(x)\rangle_F$。反过来,这个数量被用来揭示优化器的作用。我们从理论上推导了一个上限,该上限将谱范数 $\|\Delta W_\ell\|_2$ 隔离为任务干扰的优化器可控因素,并且每个模式分析表明该上限跟踪经验干扰的主要部分。具体来说,我们然后将最近的 Muon 优化器确定为一种通过构建来调节该因素的机制。我们的工作表明,它对光谱范数的优雅控制收紧了 CL 和 MM 的干扰界限,将 Muon 定位为一种有原则的以优化器为中心的方法,对现有解决方案进行补充。我们的理论分析得到了实验结果的充分验证。在三个 CLIP 主干网的八任务模型合并基准上,用 Muon 替换 AdamW 优化器可将准确性提高高达 +5.02 点。为了持续学习,Muon 还在 10 个类增量协议、3 个任务增量协议和 11 个任务 MTIL 基准测试中提供了一致的正收益。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱