首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Data-DPO:LLM训练后目标模型数据选择的直接偏好优化

摘要

arXiv:2608.16926v1 Announce Type: new Abstract: Data selection in supervised fine-tuning aims to select a small set of effective samples from large-scale candidate data, reducing training cost while p...

data model and the Data target selection training DPO samples
2026-08-20 1 阅读 约1分钟阅读 Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu
分享:
字号:
arXiv:2608.16926v1 公告类型:new 摘要:监督微调中的数据选择旨在从大规模候选数据中选择一小组有效样本,在保持模型性能的同时降低训练成本。然而,现有方法通常将数据值视为相对静态的属性,而对数据与目标模型的能力分布之间的兼容性关注有限。为了解决这个问题,我们提出了Data-DPO,一种面向目标模型的SFT数据选择方法。 Data-DPO通过一步探测来观察目标模型在不同样本上的局部训练反馈,将样本之间的激活差异转化为成对的数据偏好,并训练轻量级奖励模型来学习目标模型感知的数据偏好。在最终选择阶段,Data-DPO进一步结合目标模型偏好、外部质量得分和边际多样性来构建更加稳定和有效的训练子集。 Vision-Flan 和 LLaVA-CoT 上的实验结果表明,Data-DPO 在多个数据预算下始终优于现有数据选择基线,并稳定超过全数据训练性能。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱