首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

无知的几何:法学硕士知道何时调整贝叶斯先验

摘要

arXiv:2609.02959v1 Announce Type: new Abstract: What does a language model predict when it has few clues? The answer lurks in its unembedding geometry: a single direction of the unembedding matrix enc...

the prior model direction texttt prediction lambda unigram which and
2026-09-04 1 阅读 约1分钟阅读 Toni J. B. Liu, Jiajun Bao, Yizhou Liu, Gurbir Arora, Nicolas Boull\'e, Rapha\"el Sarfati, Christopher J. Earls
分享:
字号:
arXiv:2609.02959v1 公告类型:新 摘要:当线索很少时,语言模型会预测什么?答案隐藏在其非嵌入几何中:非嵌入矩阵的单个方向对训练语料库的一元分布进行编码,该分布充当模型在不确定时所依赖的贝叶斯先验。这种结构——我们称之为\emph{无知的方向}——出现在所检查的所有四个模型族中(\texttt{Llama}、\texttt{Qwen}、\texttt{Gemma}和\texttt{Pythia}),参数范围从0.4B到405B。将最终的预测状态投影到这个方向上会产生每个令牌的 \emph{先验加载因子} $\lambda$,根据经验,随着上下文信息变得更加丰富,该因子会稳步下降。形式上,相同的投影将预测状态分解为两个正交向量,它们与调和贝叶斯更新的两个因素完全对应:提升到指数 $\lambda$ 的一元先验和上下文驱动的似然。这种几何概率解释校准了 $\lambda$,使其在模型大小和系列之间具有有意义的可比性,较大的模型通常在高上下文限制中表现出较低的先​​验依赖性。最后,我们证明无知的方向是因果活跃的:在最终预测状态下提高或降低 $\lambda$ 会引导预测朝向或远离 KL 散度中的一元先验。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱