智能AI
morning
分解子任务的强化学习
2026-09-25
1 阅读
约2分钟阅读
Mattie Terzolo, Mikolaj Sacha, Ayan Sinha, Andrew Rabinovich
字号:
arXiv:2609.27035v1 公告类型:新摘要:用于训练语言模型代理的组相对策略优化(GRPO)和相关策略梯度方法在进入策略更新之前将整个多轮部署折叠为单个标量轨迹奖励。当任务由不同的技能组成时,特别是在稀疏和延迟的环境反馈下,这种崩溃是有损的:优化器必须隐式推断出哪种能力驱动了结果以及应该如何改变行为。我们认为正确的原语不是更好的标量,而是分解:轨迹奖励应该在进入策略更新之前沿着子任务分割。我们引入了分解子任务强化学习(RLDS),其核心是子任务分解优势估计(SDAE):标量 GRPO 优势的替代品,它将轨迹奖励分割为固定分类上每个子任务的份额,计算每个子任务的组相对优势,并通过按其重要性对每个子任务的优势进行加权来分配每个令牌信用,将其集中在反射将该子任务的执行标记为的步骤周围结果。我们评估四个代理基准:FrozenLake(稀疏网格导航)、HotpotQA(多跳 QA,一种检索工具)、ScienceWorld(长视野体现科学)和 DeepResearch(长篇研究、四种工具、复合标题奖励)。训练过程中发出的异质性诊断表明,分解是有回报的——随着子任务异质性的扩大,在高异质性任务 ScienceWorld(+11.5 分,配对引导 95% CI [+9.8,+13.3])和 FrozenLake(+9.8 分,[+7.0,+12.8])上获得最大收益,并且在 HotpotQA 和 DeepResearch 的噪声范围内,诊断预测很少恢复。 ScienceWorld 在 RLDS 下的计算效率也比标量 GRPO 更高(每步 -10.9% 挂钟),因为长时间的部署可以分摊固定的反射和分级开销。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱