智能AI
morning
当梯度看到等级时:可证明的必要性、因果招募和训练矩阵记忆中的组合
摘要
arXiv:2609.17594v1 Announce Type: new Abstract: Can gradient-based training learn the rank needed to store and compose associations in a matrix memory? In our earlier study, we used a matrix-augmented...
the
rank
recovery
matrix
and
operator
training
bindings
linear
fixed
2026-09-17
1 阅读
约1分钟阅读
Samuel Larson
字号:
arXiv:2609.17594v1 公告类型:新 摘要:基于梯度的训练能否学习在矩阵存储器中存储和组合关联所需的等级?在我们早期的研究中,我们在一项承认 1 级解决方案的任务中使用了矩阵增强推理器,从而使这个问题悬而未决。我们在 $K$ 个新的键值绑定上训练矩阵记忆,其精确的线性恢复需要 $\mathrm{rank}(Z) \geq K$。固定线性读数查询单个矩阵状态,而无需访问原始绑定。实验通过大于 0.9 的余弦相似度来衡量恢复情况,这是一个与数学等式不同的阈值。在测试网格中学习的有效排名随着 $K$ 的增加而增加(Spearman $\rho = 1.0$ at $d = 16$)。训练时间排名上限会在 $k = K$ 附近产生恢复过渡:在 $d = 8$、$K = 4$ 时,排名 3 最多提供 0.0004 恢复,排名 4 提供 0.97。通过训练有素的操作员 21 倍的自我应用,五颗种子中的四颗保留了至少 0.9996 的回收率。在实体子空间上,学习算子的有效排名接近$K$并且接近理想循环。对于上限低于 $K$ 的单个收敛种子,使用实体子空间运算符和理想循环的计算通过七次应用预测测量的余弦在 0.008 范围内。扩展训练解决了一些最初的失败,但在编码器宽度固定的较大矩阵维度上,恢复率仍然下降。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱