首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

探究推理性能的起源:RL 与 SFT 微调模型中解决数学问题的表征质量

2026-08-01 1 阅读 约1分钟阅读 Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit, Kevin Zhu, Aishwarya Balwani
分享:
字号:
arXiv:2607.26119v1 公告类型:新 摘要:通过强化学习 (RL) 训练的大型推理模型已越来越多地被证明在数学推理任务上优于监督微调 (SFT) 模型;然而,这种优势的机制基础仍不清楚。因此我们要问,哪些内部表征差异使强化学习模型具有卓越的性能?我们的工作提出了两条汇聚的证据:首先,在分层隐藏状态上训练的线性探针表明,与 SFT 模型相比,强化学习模型在预测答案正确性方面往往能获得更高的准确度,这表明更多的线性可分离和结构化表示。其次,平均消融研究表明,强化学习模型开发了一种分层架构,其中更深的层变得逐渐变得更加重要,而 SFT 模型在各层之间均匀分配重要性。总之,这些发现表明强化学习训练从根本上重构了模型表示和处理推理问题的方式。最后,我们分析跨问题重复采样下的令牌计数变异性,以评估自适应计算分配。虽然我们观察到一些 RL 调整的模型比 SFT 模型具有更高的变异性,但我们在其他模型中看到了很强的一致性,这表明令牌分配可能更多地依赖于整体训练流程,而不是 RL 与单独的 SFT。我们相信,这种代币分配的可变性揭示了合理的策略推理的传播,突出了哪些模型表现出稳定的策略,而哪些模型表现出不确定的、潜在的不可识别的解决方案行为。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱