智能AI
morning
Data-DPO:LLM训练后目标模型数据选择的直接偏好优化
摘要
arXiv:2608.16926v1 Announce Type: new Abstract: Data selection in supervised fine-tuning aims to select a small set of effective samples from large-scale candidate data, reducing training cost while p...
data
model
and
the
Data
target
selection
training
DPO
samples
2026-08-20
1 阅读
约1分钟阅读
Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu
字号:
arXiv:2608.16926v1 公告类型:new 摘要:监督微调中的数据选择旨在从大规模候选数据中选择一小组有效样本,在保持模型性能的同时降低训练成本。然而,现有方法通常将数据值视为相对静态的属性,而对数据与目标模型的能力分布之间的兼容性关注有限。为了解决这个问题,我们提出了Data-DPO,一种面向目标模型的SFT数据选择方法。 Data-DPO通过一步探测来观察目标模型在不同样本上的局部训练反馈,将样本之间的激活差异转化为成对的数据偏好,并训练轻量级奖励模型来学习目标模型感知的数据偏好。在最终选择阶段,Data-DPO进一步结合目标模型偏好、外部质量得分和边际多样性来构建更加稳定和有效的训练子集。 Vision-Flan 和 LLaVA-CoT 上的实验结果表明,Data-DPO 在多个数据预算下始终优于现有数据选择基线,并稳定超过全数据训练性能。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱