开发者生态
morning
DAPO:字节跳动Seed和清华AIR的开源强化学习系统
摘要
Important 🔥 News!!! [2025/05] We update the wandb training record of full DAPO and the checkpoint which achieved 50%+ on AIME 2024. We also provide instructions for evaluation on AIME 2024. [2025/03] ...
the
and
training
DAPO
model
AIME
2024
for
provide
system
2026-09-21
1 阅读
约7分钟阅读
the_arun
字号:
重要🔥新闻!!! [2025/05] 我们更新了完整 DAPO 的 wandb 训练记录以及在 AIME 2024 上达到 50%+ 的检查点。我们还提供了 AIME 2024 的评估说明。 [2025/03] 我们在 wandb 中发布了早期版本 DAPO 的训练记录(没有 Token 级 PG Loss & 动态采样),在 AIME 2024 上达到了 44% 以上。我们发布了一个用于大规模 LLM RL 的完全开源系统,包括算法、代码基础设施和数据集。该系统实现了最先进的大规模 LLM RL 性能。我们提出了解耦剪辑和动态采样策略优化(DAPO)算法。通过开源,我们为更广泛的研究社区和社会提供了可扩展的强化学习的实用途径,使所有人都能从这些进步中受益。我们的系统基于很棒的 verl 框架。感谢他们的出色工作! 🤗 如果您对我们的论文有任何疑问,欢迎提出问题,我们可以在那里讨论。谢谢你! 🚀 DAPO 基于 Qwen2.5-32B 基础模型在 AIME 2024 上获得 50 分,以 50% 的训练步数优于之前的 SoTA DeepSeek-R1-Zero-Qwen-32B。训练长度稳定性和增长期间的指标监督:响应长度的稳定增加允许进行更大的探索,促进模型学习更复杂的推理行为的能力,最终有助于训练稳定性和性能提高。奖励分数稳定性:奖励信号的稳定增加表明模型成功拟合训练分布,确保学习过程保持稳健和一致,没有明显波动。熵和平均概率趋势:在最初下降后,熵的受控增加可确保探索和利用之间的健康平衡,避免过度拟合或过度随机性等问题,并促进持续的模型性能。我们提供了 DAPO-Qwen-32B 的模型权重,它是基于 Qwen2.5-32B 使用 DAPO 算法训练的。我们建议使用 conda 创建环境: conda create -n dapo python=3.10 conda activate dapo pip3 install -rrequirements.txt 我们在此处提供模型推理代码: import torch from Transformers import AutoTokenizer from vllm import SamplingParams , LLM Examples = [ { "question" : "逐步解决以下数学问题。您响应的最后一行应采用以下形式 Answer: $Answer (不带引号) 其中$Answer 是问题的答案。 \n \n 求 \\ [(75+117i)z+ \\ frac{96+144i}{z} \\ ] 的最大可能实部,其中 $z$ 是一个复数,且 $|z|=4$。 \n \n 请记住将答案放在 \" Answer: \" 之后。 , "answer" : "540" }, { "question" : "逐步解决以下数学问题。您回答的最后一行应采用以下形式:Answer: $Answer(不带引号),其中 $Answer 是问题的答案。 \n \n 每天早上,Aya 都会进行 9$ 公里长的散步,然后在一家咖啡店停下来。当她以每小时 $s$ 公里的恒定速度行走时,步行会带走她4 小时,包括在咖啡店花费的 $t$ 分钟 当她每小时步行 $s+2$ 公里时,步行需要 2 小时 24 分钟,包括在咖啡店花费的 $t$ 分钟。 假设 Aya 以每小时 $s+ \\ frac{1}{2}$ 公里的速度行走,包括在咖啡店花费的 $t$ 分钟 \n \n 请记住将您的答案写在“答案:”之后。 ”。 , "answer" : "204" }, { "question" : "逐步解决以下数学问题。您回答的最后一行应采用以下形式:Answer: $Answer(不带引号),其中 $Answer 是问题的答案。 \n \n 令 $ \\ mathcal{B}$ 为一组表面积为 $54$、体积为 $23$ 的矩形框。令 $r$ 为可包含每个矩形框的最小球体的半径$ \\ mathcal{B}$ 的元素的矩形框的值可以写为 $ \\ frac{p}{q}$,其中 $p$ 和 $q$ 是互质正整数。 \n \n 请记住将答案放在 \" Answer: \" 后面。 , "answer" : "721" } ] def main (): model = "BytedTsinghua-SIA/DAPO-Qwen-32B" tokenzier = AutoTokenizer . from_pretrained ( model ) llm = LLM ( model = model , dtype = torch .bfloat16 , tensor_parallel_size = 8 , gpu_memory_utilization = 0.95 ) Sample_params = SamplingParams (Temperature = 1.0 , top_p = 0.7 , max_tokens = 20480 ) 例如在示例中: Question = example [“问题”]答案=示例[“答案”]输出= llm。生成(提示= tokenzier。apply_chat_template(对话= [{“内容”:问题,“角色”:“用户”}],add_ Generation_prompt = True,tokenize = False),采样参数=采样参数)打印(f“***问题***:\ n {问题} \ n ***地面真相***:\ n {答案} \ n ***模型输出***: \n { 输出 [ 0 ]. 输出 [ 0 ] } \n " ) print ( "
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱