首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

假如有一万张卡,RL训练该怎么扩大规模?十万张呢?

2026-09-22 1 阅读 约10分钟阅读 机器之心
分享:
字号:
强化学习走向规模化,效率成为关键变量 当预训练将大模型带到新的能力起点,强化学习则通过持续的探索与反馈,不断激发模型在新环境、新任务中的推理与行动能力,决定它们还能走多远。 RL 在模型开发中占的比重越大,训练效率对算力预算的影响也越直接。 算一笔示意账:假设 1 万张 GPU 连续运行 30 天,按每卡每小时 3 美元计算,总费用是 2,160 万美元。如果使用同样的卡数、达到同样的模型效果,但将训练时间缩短 10%,就能少使用 72 万 GPU 小时,按上述假设节省约 216 万美元。对租用集群的团队,这是直接减少的账单;对自建集群的团队,则意味着能更早把这些算力交给下一轮实验。 这些效率收益可以从哪里找?一个最基础、也几乎所有训练配方都无法绕开的参数,就是 Batch Size。 在实际训练中,Batch Size 常常出现在两类决策中: Batch Size Tuning: 让配方适配新条件。 模型变大了,或 GPU 卡型变了,原来的 Batch 和学习率不一定还合适。Batch 太小可能让硬件利用不充分,与之不匹配的学习率则可能让学习变慢甚至不稳定。这时需要找到一组能稳定学习、又能高效使用当前硬件的 Batch 与配套超参数。 Batch Size Scaling: 把并行度变成更短的训练时间。 如果同一个模型得到了更多 GPU,Batch 能否同步扩大,让模型更早达标?即使 GPU 数量不变,如果生成并发较低、设备还没有充分工作,能否通过更大 Batch 利用这部分闲置能力? 两类决策最终都指向同一个实际问题: 如何找到最优的 Batch Size,使模型以最短的 wall-clock time 达到预期性能? 更大的 Batch,既可能是加速器,也可能成为减速带。腾讯混元团队在实验中观察到:适度增大 Batch,并同步调整学习率,可以在保持学习效率的同时提高吞吐;但 Batch 过大时,额外样本代价会反过来压过吞吐收益。图 1 把这种反差画成登山:有的路线能更快抵达同一性能「山顶」,有的看似步子更大,登顶反而更慢。 图 1|把训练比作登山:山顶代表达到同一目标性能,四条路线代表不同的 Batch Size,每个路标代表一次优化更新。配套调整学习率后,B、2B 和 4B 在累计样本维度上保持近似相同的学习进度;其中更大的 Batch 因吞吐更高而更快「登顶」。但扩大到 16B 后,样本效率损失超过吞吐收益,登顶反而比 B 更慢。图例给出了归一化 time-to-target。 这种从加速到减速的转折,背后遵循怎样的科学规律?能否建立一套可测量的准则,找到 time-to-target 最短的 Batch Size? 为回答这个问题, 腾讯混元团队将 Batch Size 放回训练动力学与硬件执行的共同约束中,从第一性原理出发,重新审视大模型强化学习的规模化规律。 标题:《When Do Larger Batches Help Scale LLM Reinforcement Learning?》 机构:Tencent Hy Team(腾讯混元团队) 论文链接:arXiv:2608.29296 从经典 Batch Scaling 到 LLM 强化学习 「Batch 可以有效扩大到什么程度」,并不是一个新问题。 2017 年,大 Batch 的价值首先以工程突破的方式进入人们的视野。Facebook 的 Priya Goyal、Yangqing Jia 和 Kaiming He 等人在《Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour》中,通过线性放大学习率和 gradual warmup,将 ResNet-50 在 ImageNet 上的训练从 8 张 GPU、Batch 256 时约 29 小时,扩展到 256 张 GPU、Batch 8192 时 1 小时,同时保持了小 Batch 的精度。 这项工作说明, 经过配套优化,更大的 Batch 确实可以把更多硬件并行转化为更短的 wall-clock time;也由此把问题从「大 Batch 能否训练」推向了「大 Batch 究竟能有效扩大到什么程度」。 2018 年,OpenAI 的 Sam McCandlish、Jared Kaplan、Dario Amodei(现任 Anthropic CEO)在《An Empirical Model of Large-Batch Training》中,研究了扩大 Batch 的收益何时开始递减,并将这个转折与梯度噪声尺度联系起来。随后,Google Brain 的 Christopher J. Shallue 和 George E. Dahl 等人进一步指出,数据并行带来的有效收益依赖于具体任务,而且公平比较不同 Batch 需要分别调整超参数。 与此密切相关的另一个问题是 Batch Size Invariance: 改变 Batch 后,如果配套调整学习率等超参数,模型在消耗相同数量的样本时,能否保持近似的学习轨迹?2022 年,OpenAI 的 Jacob Hilton、Karl Cobbe 和 John Schulman 对策略优化中的这一问题进行了系统研究。 那么,LLM 强化学习的特殊之处在哪里? 在监督学习中,训练样本通常已经存放在固定数据集中。取出一个更大的 Batch 后,主要新增成本发生在模型的前向传播、反向传播和参数更新;样本本身不需要由正在训练的模型现场生产。因此,经典 Batch Scaling 主要讨论的是:更大的 Batch 如何改变梯度估计、更新次数和训练并行度。 LLM 强化学习则多了一个关键闭环。作为 Agent 的 Transformer 必须先用当前策略进行自回归生成,或与环境连续交互,得到回答、轨迹和奖励;这些在线产生的数据随后才进入学习阶段,用于前向传播、反向传播和参数更新。更新后的 Transformer 又继续生成下一批数据。 换言之, 模型既是生产训练数据的推理系统,也是消费这些数据的学习系统。 图 2|LLM 强化学习的两个主要计算环节都依赖 GPU:Sampling 通过自回归推理产生回答和轨迹,Training 再用这些数据更新模型。连接两侧与 GPU 的「通道」由 Batch Size 塑造:它既影响采样侧的并发规模,也影响训练侧每次更新处理的数据量。 从系统架构看,虽然两个过程运行的是同一个 Transformer,它们对 GPU 的使用方式却不同。生成是逐 token 的自回归推理,需要反复读取模型权重、维护 KV Cache 并调度并发序列;学习则在整批 token 上执行前向和反向传播,还要保存激活、计算梯度并更新优化器状态。 因此,扩大 Batch 不是只给同一种计算多塞一些数据:它既可能通过更高并发提高生成效率,也会增加训练侧的计算和显存开销。 学习曲线无法单独回答训练会快多少,生成吞吐也无法单独回答模型还需要多少样本。 两种效率,一个分析框架 对大模型训练来说,最终目标不是把 Batch 开到最大,也不是让某个局部阶段跑到最快,而是让模型尽早达到要求
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱