智能AI
morning
数据可预测性影响变压器训练中威布尔体重秤的增长
摘要
arXiv:2608.23573v1 Announce Type: new Abstract: A trained transformer's weight magnitudes can be summarized by a two-parameter Weibull distribution whose shape $k \approx 1.2$ is stable across layers ...
the
and
training
eta
weight
two
across
lambda
H_r
per
2026-08-26
1 阅读
约2分钟阅读
Tiexin Ding
字号:
arXiv:2608.23573v1 公告类型:新 摘要:经过训练的 Transformer 的权重大小可以通过二参数威布尔分布来概括,其形状 $k \approx 1.2$ 在各层和模型中都是稳定的,因此尺度 $\lambda$ 承载了大部分训练引起的运动。什么语料库属性决定 $\lambda$ 增长多少?使用二元条件熵 $D = H(\text{next} \mid \text{prev})$(训练前计算的免训练统计数据),我们在受控腐败家族中发现了一个学习率条件定律 $\lambda^2 - \lambda_0^2 = C_0(\eta) + C_1(\eta)(H_r - D)^{0.59}$,其中 $H_r$ 是匹配预算洗牌基线。凸指数继承自独立测量的数据侧饱和关系,而不是直接拟合到增长曲线。删除两个 per-$\eta$ 系数后,跨越学习率一个数量级的 23 个运行崩溃到 $(H_r - D)^{0.59}$,单位斜率($R^2 = 0.941$;直接 per-$\eta$ 拟合较弱,$R^2 \approx 0.82$)。由于 $D$ 是在训练之前计算的,因此该定律是一个前向预测因子:端到端的自我验证以 5.7% 的相对误差恢复了家庭内体重增长。读数保持模型和每层分辨率,并跨越两个测试的架构,保留功能形式,仅改变系数。它还标记了它的边界:跨语料库预测过度预测代码,暗示冗余是更广泛的 $\Phi(D,R,A,H)$ 数据权重框架的第二个轴。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱