开发者生态
morning
法学硕士学习如何解决强化学习中的难题,永不放弃
2026-09-16
1 阅读
约6分钟阅读
natolambert
字号:
这是我最近关于法学硕士 RL 后培训的论文的一篇博客文章:介绍马太效应并建议用“永不放弃”来解决它。它以互动方式呈现,不太正式,更像是我的演讲方式。如需更深入、更技术性的探索,请查看 arxiv 上的论文和 github 上的代码。您的评估实际测量的是什么? # 每个优秀的强化学习实践者无疑都看到了评估曲线的上升。这是我们对 Olmo 3.1 RL-Zero Math 进行 RL 训练期间的 AIME 2025 评估 (1) (1) 请参阅 Olmo 3.1 博客文章和 arxiv 在 Dolci RL-Zero 数学上使用 RL 训练 Olmo 3 7B 基础,提高其整体数学能力。或者确实如此?这条曲线的真正含义是什么?我们的评估平均超过 30 个 AIME 问题。让我们将这 30 个问题分为 3 个难度级别。我们最初的强化学习前模型在 pass@32 中得到 0 的每个问题都将被标记为“困难”。我们将根据其他问题的通过率将其平均分为“中等”和“简单”。因此,我们的子集的初始 pass@1 平均值将为 0%、3.8%、22.7%。您认为每个子集的性能将如何发展? ▶ 在 Olmo 3.1 RL-Zero 期间玩我们的 AIME 评估,根据初始精度分为三个难度级别。 Easy AIME 问题得到了显着改善,但以 pass@32=0 开头的问题大多以 pass@32=0 结束!平均我们的 AIME 评估隐藏了一些重要的东西:我们的大部分改进来自最简单的问题,从部分解决到大部分解决。最困难的问题几乎没有改善。如果您查看每个示例的解决率随时间变化的情况,这一点就会清晰可见(参见页边空白处的图表)。 ⊕ 每个 AIME 评估示例在训练中的准确性。我们按难度从上(初始模型 pass@32=0)到下(初始模型 pass@1 > 30%)对示例进行排序。最难的例子(顶行)几乎没有通过训练得到改善。该模型主要学习如何更好地解决已经相当好的解决的简单和中等难度的示例。我们将这种差异称为马太效应。但这是针对法学硕士的数学强化学习。其他域呢?我们使用 Deepcoder 和 DeepSWE 评估代码 RL 和代理 RL,这两个开源项目发布了模型和日志。我们可以使用初始模型将每个基准分为难度桶(LCBv6 上的 Deepseek-R1-Distilled-Qwen-14B),或者我们可以使用现有的任务长度/难度标签 (SWEBench)。初始模型 让我看看 RL 的收获!强化学习的收益与问题的简单程度成正比。我们将这种偏见与网络科学和经济学中的类似现象联系起来,即马太效应 (2) (2) Merton (1968),也可参见维基百科,一般概括为“富者愈富”。因此,我们提出了法学硕士强化学习中的马太效应。强化学习可以根据模型的初始能力提高任务的性能,使简单的任务变得更容易,而困难的任务通常仍然很困难。法学硕士强化学习中的马太效应 造成马太效应的原因是什么? # 您可能认为该问题与 GRPO 有关。如果我们在 $k$ 采样完成中没有得到问题的正确答案,那么我们就不会得到任何梯度,也无法改进这个问题。 (3) (3) Xiong 等人 (2025) 将此称为信号损失 一种可能的答案是采样更多完成,即更大的 $k$ 。 (4) (4) 其他方法包括使用特权信息和课程学习。这些通常是对我们方法的补充。为了测试这一点,我们在 GSM8k Platinum 上使用 GRPO 训练 Qwen 2.5 0.5B Instruct 并在其上进行测试。我们使用初始 pass@1 将数据集分为难度级别:简单 (25%)、中等 (10%)、困难 (5%) 和超困难 (0%) 问题。我们改变 $k \in \{4, 8, 16, 32\}$ 但保持批量大小固定。较小的 k 比较大的 k 解决更困难的问题。我们的 GSM8k 评估按照初始难度进行划分,如前所述。令人惊讶的是,$n=64$ 提示和 $k=4$ 完成比 $n=8$ 提示和 $k=32$ 完成更适合解决难题。事实证明,较小的 $k=4$ 实际上是最好的!为什么会发生这种情况?让我们看看我们的训练批次实际上是由什么组成的。由于我们会过滤所有完成正确或不正确的提示,因此我们的训练批次必须始终由一些完成正确、一些错误的问题组成。我们绘制了批次中简单子集和额外困难子集的百分比以及随时间的变化情况。较大的 $k$ 会增加为非常困难的问题找到罕见正确解决方案的机会。因此,我们天真地期望它会在批次中遇到更多难题。问题是,较大的 $k$ 也会增加为简单问题找到罕见的错误解决方案的机会。 GSM8k Platinum,提示批量训练困难。按难度跟踪进入我们训练批次的实际提示。 $k=32$ 一开始解决了更多困难的问题,但在 200 步时有一个拐点,之后 $k=4$ 超过了它。在训练早期,$k=32$ 找到了解决难题的罕见解决方案。但拐点过后
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱