智能AI
morning
ERR+:用于高效且果断的 LLM 推理的顺序熵解析
2026-09-01
1 阅读
约1分钟阅读
Xin Jiang, Minhao Wang, Wen Wu, Zhentao Xie, Shangheng Du, Jinxin Shi, Jiabao Zhao
字号:
arXiv:2608.28771v1 公告类型:新摘要:大型推理模型通过具有可验证奖励(RLVR)的强化学习生成扩展的思想链(CoT)轨迹,从而在复杂任务上实现强大的性能。虽然当前的 RLVR 方法通过基于正确性的奖励信号取得了很好的成果,但它们对推理过程本身的质量提供的指导有限,导致内部推理结构很大程度上未得到优化。通过对多个模型系列的实证分析,我们发现了一个一致的模式:正确的推理轨迹比错误的推理轨迹在思维阶段表现出更频繁和更大的标记级熵下降。我们提出了 ERR+,这是一个基于这一观察结果的两阶段 RLVR 框架。第一阶段使用熵救济奖励(ERR)进行训练,该奖励与思考阶段累积的令牌级熵下降成正比,并通过响应长度进行对数归一化。与之前抑制熵的方法不同,ERR 奖励不确定性的解决,同时使探索性的高熵状态不受约束。第二阶段引入了鲁棒相对效率奖励,它通过 $\tanh$ 转换的组内 $z$ 分数,对每个响应的长度与共同生成的同行进行评分。我们提供的正式分析表明,两个目标的联合优化会在早期训练中引起梯度冲突,从而激发顺序设计。对五个数据集的实验表明,跨模型主干的准确性和响应简洁性均得到了持续改进。我们的代码位于 https://github.com/XrkArul/err_response
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱