智能AI
morning
漂移契约:深度鲁棒局部学习的频谱更新
摘要
arXiv:2609.26811v1 Announce Type: new Abstract: Local learning trains each layer with its own auxiliary loss and no global backward pass, which makes layer updates structurally parallel. Two problems ...
the
and
depth
spectral
step
local
layer
with
its
per
2026-09-24
1 阅读
约2分钟阅读
Fabien Polly
字号:
arXiv:2609.26811v1 公告类型:new 摘要:本地学习用自己的辅助损失来训练每个层,并且没有全局后向传递,这使得层更新在结构上是并行的。有两个问题使其处于边缘地位:随着深度的增长,准确性会下降,而且超参数很脆弱。我们将 Muon 式谱更新几何结构(具有谱步长缩放的动量正交化)应用于每层局部更新,这是以前未研究过的交集。在具有局部线性头的 CIFAR-10 MLP 基准上,单步长设置是我们测试的从宽度 128 到 2048、从深度 12 到 48 的网格中的最佳值,而局部 Adam 需要沿两个轴重新调整,并且在深度 48 处仍然崩溃(每个深度重新调整 31.3%,转移深度 12 设置后重新调整 19%,而在未更改的设置下进行光谱更新则为 42.7%)。在五个种子和宽度 512 处,光谱更新明显领先于局部 Adam(48.9 +/- 0.5 与 46.6 +/- 0.3)。预期指定的控制将传输和大部分深度鲁棒性归因于光谱几何本身,而不是其之上的任何步长规则。我们另外将步长制定为漂移契约,lr = epsilon / RMS(input),它限制了每步每层的权重引起的预激活变化,以当前输入为条件。该合约在测量基线的最佳固定学习率上产生了小幅增益,使步长可解释,并提供了标准优化器不提供的每层输入条件漂移界限。我们报告了一个负面结果:通过主干中的 RMSNorm 和权重衰减,频谱更新的稳定性优势会归因于全局训练而不是局部训练,因此局部优势精确地集中在缺乏归一化的地方。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱