智能AI
morning
大模型Scaling撞上成本墙:三星提出TrOPD新方法,把前沿智能塞进数亿终端
摘要
标题:Trust Region On-Policy Distillation 文章地址:https://arxiv.org/abs/2606.01249 项目地址:https://github.com/Xingrun-Xing2/TrOPD GPT-6 等前沿大模型的能力仍在快速 Scaling,但随之攀升的推理成本,正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能...
OPD
token
Policy
Distillation
TrOPD
Trust
Region
https
Scaling
Qwen3
2026-09-18
1 阅读
约10分钟阅读
机器之心
字号:
标题:Trust Region On-Policy Distillation 文章地址:https://arxiv.org/abs/2606.01249 项目地址:https://github.com/Xingrun-Xing2/TrOPD GPT-6 等前沿大模型的能力仍在快速 Scaling,但随之攀升的推理成本,正在成为 AI 进一步规模化普及的关键障碍。当 AI 从云端走向手机、平板、智能家居等终端,模型不仅要 “足够聪明”,还必须塞进有限的内存和算力预算,并满足功耗、时延等严苛约束。 对于拥有数亿级终端设备的三星而言,这一矛盾更加直接:如何用更小的模型、更低的推理成本承载更多智能,让前沿 AI 能力进入更多终端,已经成为端侧智能继续 Scaling 的关键问题。端侧模型能否有效继承大模型的复杂推理能力,不仅决定 AI 能覆盖多少设备和应用场景,也直接影响智能服务的成本与用户体验。 On-Policy Distillation (OPD) 正是解决这一问题的重要技术路径。相比通过结果奖励驱动模型自主探索的 GRPO,OPD 利用教师大模型提供细粒度监督,让端侧模型直接学习更强模型的推理能力。然而,现有 OPD 面临一个关键瓶颈:当教师与学生模型能力差距较大时,监督信号可能失真,甚至导致训练不稳定。 针对这一问题, 三星大模 型团 队联合牛津大学、北京大学提出基于信任域 OPD 方法(Trust Region On-Policy Distillation) ,通过识别教师 “可信” 的监督区域,让端侧模型更稳定、更有效地继承大模型能力,为前沿智能以更低成本走向数亿终端提供了一条新路径。 核心结论 当前关于 On-Policy Distillation(OPD)的研究,大多缺少统一 benchmark 下的公平对比:不同工作的训练步数、KL 散度估计方式各不相同,很难判断某一种改进是不是真的有效。这篇先把主流 OPD 方法拉到统一设定下系统测了一遍,由此发现了真正决定 OPD 训练成败的关键: 不是该用哪种散度公式(FKL、RKL 还是 JSD),而是 教师能否对学生生成的每一个 token 给出可靠监督 。一旦学生和教师的输出分布差得太远,监督信号本身就会失真,再精巧的散度公式也救不回来。 沿着这个发现,提出 TrOPD (Trust Region On-Policy Distillation):只在教师 “信得过” 的区域做常规的在策略学习,对教师 “看不懂” 的离群区域换一种更温和的监督,再用离策略引导主动把学生的生成拉向信任区域。在 Qwen3-SFT-1.7B 上,TrOPD 在数学(AIME 25)、代码(LiveCodeBench)、指令遵循(IFBench)、STEM(GPQA)四个基准上分别比原始 OPD 提升 +3.34、+4.00、+5.11、+6.18 分 ,全面超过 EOPD、REOPOLD 等现有方法。 图 1:在 Qwen3-SFT-1.7B 学生模型上,TrOPD(紫色)相较 OPD、REOPOLD 等基线在四个基准上的领先幅度。Qwen-1.7B 为官方的非开源 OPD 版本,仅作为参考。 问题:K1 估计器的两个优化瓶颈 要理解 OPD 为什么会训崩,得先看懂它现在是怎么给 “教师的分数” 打分的。 全词表 OPD 方法(如 GKD、speculative KD)在整个词表上计算 KL 散度,信号最完整,但显存开销是 On⋅k(n 为序列长度,k 为词表大小,常见 LLM 词表动辄十万级),推理模型动辄生成几千上万 token 的思维链,这个开销很快变得不可承受。 为了绕开这个瓶颈,Thinking Machines Lab 提出用 K1 估计器给出 KL 散度的无偏估计,不再对整个词表求和,只在学生实际采样到的那一个 token 上算一次: 这里 πS、πT 分别是学生和教师在当前 token 上给出的概率。 单样本估计把显存开销从 On⋅k 压到了 On,代价是优化过程的稳定性,集中体现为两个具体的瓶颈。 瓶颈一:策略梯度离群点。 一个 token 对总梯度的贡献大致是 “奖励 × 对数概率的梯度”:奖励 越大,说明教师越认可这个 token,更新幅度也越大。问题在于,一旦学生采样到的某个 token 教师给出的概率 趋近于 0,奖励就会冲向负无穷:一次更新的方向可能被某个 “倒霉” 的离群 token 完全主导,数量级上压过成百上千个正常 token 的贡献总和。 这两个瓶颈说明:光是把 “全词表 KL” 换成省显存的 K1 估计器还不够,它解决了显存问题,却把 “教师监督是否可靠” 这个问题暴露得更彻底。那么,现有的改进思路解决了这个问题吗? 现状综述:主流方法都在改什么 面对这两个瓶颈,现有工作大致沿两条思路修补。 思路一:换散度公式 。 KL 不对称:RKL 的期望在学生分布上取,重点惩罚“学生有质量、教师没质量”的区域,表现为 mode-seeking——学生被牢牢约束在教师的主要分布上。围绕它有两种改法:一是弃用RKL,改在教师概率最高的 top-k 个词(受显存所限一般取 64)上求和计算 FKL;二是用 JSD 在混合分布 上做对称折中(β 默认 0.5),GKD 等工作即属此类。 思路二:筛 token,不改公式。 与其修改散度估计,不如直接把 “不靠谱” 的 token 排除在训练之外,常见三种设定:受高熵 GRPO 方法的启发,只保留熵最高的前 20% token、其余置零;REOPOLD 保留全部 token 但给奖励设下限,把低于阈值 τ 的奖励抬到 τ,属于 “温和纠偏”;Token 掩码(Mask)更彻底,直接把超出阈值的奖励梯度清零,即 “完全无视”。 这些改法各自都讲得通,却从未在同一套教师、学生、训练步数和采样设置下被公平比较过 —— 哪条思路真的有用,只能靠实验说话。 诊断实验:先把 OPD 问题找出来 把上述方案统一放到相同的教师模型(Skywork-OR1-Math-7B)、学生模型(DeepSeek-Qwen2.5-1.5B)、训练配置下训了一遍,数学推理基准结果如下: 表 1:以 Skywork-OR1-Math-7B 为教师、在数学推理基准上对比各类 OPD 策略。单独使用 FKL 几乎训不动;裁剪或屏蔽离群奖励有明显提升;离群区域改用前向 KL 效果更好;TrOPD 综合最优。 三个现象,和上一节的理论推演对照着看,很能说明问题: 1. 单独用 top-k 估计的 FKL,训练几乎直接失败。 这印证了 top-k 截断 FKL 从教师的概率角度进行估计,依然存在较大的偏差。 2. 按熵筛选 token,反而略微拖了后腿。 Entropy OPD 20% 平均分 46.13,比什么都不做的 OPD(RKL)基线 46.79 还低。教师在熵不高的 “普通” token 上同样能提供有效监督,只学高熵 token 反而丢掉了更多有效信号。 3. 奖励裁剪确实有效果,但依赖超参数。 Clip Outlier(47.86)和 Mask Outlier(47.72)都比 OPD 基线高出约 1 个点,说明
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱