首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI evening

日榜第二!北大开源,强化学习数据策略接入更简单、对比更公平

摘要

新智元报道 每一轮强化学习到底应该把哪些数据交给模型? 这个问题正随着推理模型和 RLVR 的发展变得更加重要。随着强化学习在大模型后训练中的作用不断增强,模型练什么、怎么练,也需要更仔细地安排。一道题可能起初很难,训练一段时间后却能稳定答对。哪些数据该继续保留,学习权重和领域配比该怎样调整,都需要结合模型的训练状态重新考虑。 而数据策略方法往往不止一种,如何把不同方法比较清楚,还有一些实际难题。...

DataFlex https token advantage verl 新智元报道 每一轮强化学习到底应该把哪些数据交给模型 这个问题正随着推理模型和 RLVR 的发展变得更加重要
2026-09-24 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 每一轮强化学习到底应该把哪些数据交给模型? 这个问题正随着推理模型和 RLVR 的发展变得更加重要。随着强化学习在大模型后训练中的作用不断增强,模型练什么、怎么练,也需要更仔细地安排。一道题可能起初很难,训练一段时间后却能稳定答对。哪些数据该继续保留,学习权重和领域配比该怎样调整,都需要结合模型的训练状态重新考虑。 而数据策略方法往往不止一种,如何把不同方法比较清楚,还有一些实际难题。不同方法各有一套实现,换个筛选规则就可能要改训练器;比较效果时,模型、奖励函数和训练预算又未必一致。即使分数提高了,也很难判断收益究竟来自数据策略,还是其他训练设置。 为了解决数据策略接入和效果比较中的麻烦问题, 北大DCAI团队联合UCAS、上海 算法 创新研究院、中关村学院最新发布DataFlex-RL 。 GitHub 开源仓库:https://github.com/haolpku/DataFlex-RL 论文地址:https://huggingface.co/papers/2609.06107 少花时间反复修改训练器,多留精力验证数据策略是否有效,是DataFlex-RL最直接的价值。 DataFlex-RL复用verl的训练流程,把数据选择、样本重加权和领域配比调整做成可配置组件,让开发者可以在同一套RLVR/GRPO流程中配置三类动作: 选择哪些rollout参与当前更新; 给样本或token分配多大的学习权重; 决定下一批数据从哪些领域采样。 这些策略直接复用 RL 循环已经产生的奖励、优势、token 概率和 prompt 分组等信号,rollout、验证和策略更新代码基本保持不变。 论文发布后获得了社区的关注,并登上HuggingFace #2 Paper of the day。论文中组织了591次实验,在多种模型和数学、逻辑、科学任务上,检验数据策略。 三大动态数据策略维度 选择、加权、混合 在GRPO训练中,模型会对同一道题生成多个回答,由验证器给出奖励,再根据组内奖励差异更新模型。DataFlex-RL将数据策略分成三类:选择决定哪些回答参与当前更新,加权调整它们对更新的贡献,混合根据历史反馈改变后续批次的领域构成。 数据选择,控制哪些回答参与策略更新 同一道题生成的回答,提供的学习信号可能很不相同。在基于组内奖励差异的 GRPO 中,一组回答全部正确或全部错误,通常无法形成有区分度的 advantage。 DataFlex-RL 支持按组内解出率、advantage 排名、奖励方差和回答效率进行筛选。 difffilter 是一个具体例子:每道题生成五个回答,只保留解出率严格处于0.2与0.8之间的组,也就是答对两个或三个的情况,将更新集中到中间难度的题目。 maxvar 保留组内奖励方差最大的子集, gfpo 按奖励与回答长度的比值选择, topk 保留advantage幅值排名靠前的回答。 这里筛选的是已经生成的回答,当前实现通过0/1权重控制策略损失,因此不会减少已经发生的生成成本。评估效率时,还需要关注实际参与更新的数据量。 动态重加权,调整不同样本的学习强度 有时研究者希望保留当前批次中的全部回答,同时让部分样本承担更大的更新权重,重加权就用于这种情况。 DataFlex-RL 支持回答级和 token 级权重: softmax 、 per 根据advantage幅值调整回答贡献, diffband 对奖励落在指定分位区间内的样本加权, ar 利用已有token概率,对低概率token施加相对较低的权重。 这些方法会将权重均值归一到1,尽量控制整体损失尺度的变化。 动态领域混合,根据历史表现调整配比 数学、逻辑和科学任务的学习进度可能不同,固定比例未必适合每个阶段。DataFlex-RL用滑动窗口累计各领域的训练反馈,再由mixer更新后续批次的目标比例。 混合策略会先在warmup阶段积累反馈,再按配置的间隔更新比例。当前插件通过自定义replay buffer从可用样本中按领域选取,实际进入训练的数据还会受到各领域候选数量的限制,因此需要同时观察目标比例和实际数据分布。 统一技术架构 让数据策略灵活接入训练 三类策略作用的位置不同,都需要接入训练流程、读取反馈,再把判断转成具体操作。DataFlex-RL通过 verl 插件接入训练,复用已有信号,并将打分与执行分开,让策略组件可以独立替换。 插件化接入,复用verl训练流程 要比较不同数据策略,首先需要让它们在同一套训练流程里运行。DataFlex-RL以插件形式接入verl,通过注册机制提供自己的trainer。 对于选择和加权,插件在原有advantage计算完成后读取信号,运行数据策略,再将结果写入 verl 已有的 rollout_is_weights 字段。选择结果转成0/1权重,加权策略返回连续权重,两者都由现有策略损失接口处理。领域混合使用单独的trainer与自定义replay buffer,累计反馈并按更新后的领域比例选取可用样本。 不同策略共用模型生成、奖励验证和模型更新流程,改动集中在数据策略的接入位置。 开发者新增方法时,可以沿用这些训练能力,把主要工作放在策略组件上。当前插件面向verl v1 trainer接口,使用前需要确认宿主版本兼容、插件能够正常注册。 共享训练信号,减少重复打分 接入训练之后,策略还需要判断依据。奖励反映回答表现,advantage提供策略更新信号,token log-prob记录 token 概率。这些数据已经随训练产生,scorer可以直接读取并计算所需分数。 策略不需要为了打分额外执行一次模型前向,可以复用相同的信号处理代码。共享的是信号来源和计算逻辑,并不要求所有策略使用同一个分数;领域混合还需要把反馈按领域累计成历史统计。 训练过程还会记录保留比例、权重统计、领域目标比例和反馈,方便检查策略是否按预期运行。 打分与执行解耦,通过组件替换策略 有了分数,接下来才是决定怎样使用它。DataFlex-RL将这两步分别交给 Scorer 和 Actuator 。 Scorer 根据输入信号计算分数,执行器将分数转换成保留索引、连续权重或领域比例。 有了分数,接下来才是决定怎样使用它。同一份advantage幅值分数可以交给 topk 做筛选,也可以交给 softmax 生成连续损失权重。 组件按名称注册,再通过配置组合:基于已有信号新增筛选方法时,通常只需实现执行规则;需要新的判断依据时,再扩展scorer。 实验结果 从基础训练增益到动态数据调度 论文共进行了591次实验,覆盖不同基础模型,以及数学、逻辑和科学任务。核心实验在Qwen2.5-7B-base上展开,包含13个配置,每个配置使用12个配对随机种子,共完成156次运行。实验先确认GRPO能够有效训练模型,再观察三类数据策略如何参与后续训练。 在Qwen2.5-7B-base上,未训练模型的平均得分为42.01,采用均匀采样的标准GRPO基线训练后提升到49.77,平均提升 7.76个百分点 。在Llama-3.1-8B-base上,模型也从10.87提升到21.12,平均提升 10.25个
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱