智能AI
morning
走出数学与代码,大模型还能自我进化吗?
摘要
可验证奖励的强化学习(RLVR)逐渐成为提升大模型推理能力的重要技术路线。在数学和代码任务中,标准答案和编译器能够自动判断输出是否正确,从而为大规模强化学习提供准确、低成本的奖励信号。 然而,创意写作和研究分析等开放式任务通常不存在唯一正确答案。现有方法往往依赖人工偏好、奖励模型或 LLM Judge 评估输出质量,容易受到评估偏差和裁判模型能力的限制,同时还会增加训练阶段的推理成本。如何为开放式...
RLSVR
RLVR
SpyRL
Self
LLM
Reinforcement
Learning
Rewards
Judge
Verifiable
2026-08-06
1 阅读
约10分钟阅读
机器之心
字号:
可验证奖励的强化学习(RLVR)逐渐成为提升大模型推理能力的重要技术路线。在数学和代码任务中,标准答案和编译器能够自动判断输出是否正确,从而为大规模强化学习提供准确、低成本的奖励信号。 然而,创意写作和研究分析等开放式任务通常不存在唯一正确答案。现有方法往往依赖人工偏好、奖励模型或 LLM Judge 评估输出质量,容易受到评估偏差和裁判模型能力的限制,同时还会增加训练阶段的推理成本。如何为开放式任务构造稳定、可扩展且能够自动验证的奖励,成为 RLVR 进一步扩展的关键障碍。 受到自监督学习的启发,作者提出了 RLSVR(Reinforcement Learning with Self-Verifiable Rewards) 训练框架。自监督学习通过掩码预测、对比学习等代理任务,从数据本身生成训练标签;RLSVR 将类似的任务变换思想引入强化学习,通过构造带有环境隐藏变量和确定性规则的代理任务,让开放式任务也能够产生可验证奖励。 论文标题:From RLVR to RLSVR: Task Transformation Induces SelfVerifiable Rewards for Open-Ended LLM Self-Improvement 代码链接:https://github.com/wangqinsi1/RLSVR/tree/SpyRL 论文链接: https://arxiv.org/abs/2607.23802 基于这一思路,作者进一步提出自博弈训练方法实例 SpyRL(Self-PlaY Reinforcement Learning) 。其核心是构造一个信息不对称的多智能体博弈环境:不同智能体在掌握信息量存在差异的条件下完成同一目标任务,并通过彼此的输出进行比较、判断和互动。环境预先记录造成信息差异的隐藏状态,因此博弈结果可以被自动、精确地验证;与此同时,智能体能否在竞争中取得优势,又取决于其完成原始任务的质量。由此,开放式任务中难以直接衡量的能力,被映射为可用于强化学习的规则化奖励信号。 从 RLVR 到 RLSVR: 为开放式任务构造可验证奖励 RLVR 能够有效提升数学推理和代码生成能力,关键在于这些任务拥有确定性的验证机制。数学答案可以与标准答案直接比对,代码则可以通过编译器和单元测试判断是否正确,因此模型能够以较低成本持续获得稳定的强化学习信号。 开放式任务的情况更复杂。摘要、写作和研究分析通常不存在唯一答案,任务质量分散在完整性、逻辑性、相关性和创造性等多个维度中,很难通过简单规则直接计算。奖励模型和 LLM Judge 虽然可以提供近似评价,但训练效果会受到评估器能力、偏差和推理成本的影响。 针对这一问题,RLSVR 引入了 任务变换(Task Transformation) 。其基本思想是将原始开放式任务转化为一个可验证的代理环境,并在环境中主动构造监督信号。环境首先从原始数据中采样任务,再注入并记录一个隐藏变量,例如哪个输入受到扰动、哪部分信息被删除,或某个输出在什么条件下生成。模型仍然需要完成原始目标任务,从而保证训练过程中使用的能力与真实应用场景保持一致;随后,模型通过输出之间的比较和交互,对环境中的隐藏状态作出判断。 由于隐藏变量由环境预先生成并保存,模型的判断结果可以通过确定性规则直接核验。这样一来,原本难以直接衡量的输出质量,就能够通过代理环境中的交互结果转化为强化学习奖励。论文将这种奖励称为 自可验证奖励(Self-Verifiable Rewards) :它不依赖人工标注或外部裁判,其验证依据来自环境自身的状态和规则,标准答案在任务生成时就已经确定。 从这个角度看,RLSVR 可以视为将自监督学习的思想引入 RLVR。自监督学习通过代理任务从数据中自动生成标签,RLSVR 则通过任务和环境变换自动生成奖励。任务变换对应代理任务,环境隐藏变量对应自动构造的标签,最终得到的规则化奖励可以直接用于 GRPO 等现有强化学习算法。RLSVR 由此提供了一条新的路径:开放式任务的可验证性可以通过环境设计获得,并进一步支持大规模、低成本的模型自我进化。 SpyRL:基于自博弈的 RLSVR 的实例 为了验证 RLSVR 能否真正应用于开放式任务,作者设计了一个基于信息不对称自博弈的具体实例—— SpyRL(Self-PlaY Reinforcement Learning) 。SpyRL 将摘要、创意写作和数学推理等任务嵌入一个类似「谁是卧底」的多智能体环境中,通过环境预先分配的隐藏身份,为原本缺乏标准答案的任务构造可验证奖励。 如论文图 2 所示,SpyRL 的每轮训练包含 Performing 和 Detection 两个阶段。首先,环境从任务数据中采样一个输入,并随机指定一名玩家为 spy。其余 civilian 玩家获得完整输入,spy 则只能看到经过信息降质处理的版本,例如被连续遮盖部分内容的报告、写作提示或数学材料。随后,所有玩家根据各自掌握的信息完成同一个目标任务,生成摘要、故事或数学问题及解答。信息降质只移除影响任务完成的关键内容,同时尽量保持输入的主题、风格和表面形式一致,以避免模型通过长度、格式等简单特征识别身份。 在 Detection 阶段,所有输出会被公开,玩家需要结合这些结果判断谁获得了残缺信息。由于 spy 的身份由环境提前随机指定,投票是否正确能够直接与环境记录进行比较,Detection 阶段也因此获得了确定性的奖励。与此同时,一个玩家生成的内容越不完整、逻辑越薄弱,越容易暴露其信息缺失并收到更多怀疑票。因此,投票结果也可以反向用于评价 Performing 阶段:收到的怀疑票越多,任务执行奖励越低;能够生成更完整、更连贯、更具说服力输出的玩家,则更有可能避免被识别。 这两个阶段共同构成了 SpyRL 的闭环自博弈机制。检测能力提升后,模型能够发现输出中更细微的缺陷,给执行者带来更严格的训练信号;执行能力提升后,不同玩家的输出会变得更难区分,又会推动检测模型继续进化。作者对两个阶段进行交替优化:当检测任务已经较为容易时,训练重点转向执行模型;当执行模型的提升导致身份识别准确率下降时,再增强检测模型。这样的动态过程能够持续围绕模型当前的能力边界产生学习压力,降低固定评估器逐渐失效带来的训练停滞。 在奖励设计上,Detection 阶段根据身份判断是否正确获得可验证奖励,并通过类似 GRPO 的组内相对优势进行优化。Performing 阶段则采用零和奖励,将 spy 与 civilian 之间的竞争以及 civilian 内部的相对表现结合起来。 通过这样的设计,SpyRL 将「输出质量」映射为「输出是否暴露了信息缺失」,再将身份判断结果转化为可由环境直接核验的训练信号。整个训练过程不需要人工标注、奖励模型或外部 LLM Judge,并且执行阶段始终围绕原始目标任务展开,从而保证代理博弈所训练的能力能够迁移回摘要、写作和推理等真实任务。 实验结果 作者在 Qwen3-4B 和 Qwen3-8B 上验证了 SpyRL,实验覆盖文本摘要、创意写作和数学推理三类任务,并与 R-Zero、Absolute Zero 等自进化方法
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱