智能AI
morning
LLM 训练后通过流形覆盖和稀疏特征覆盖进行分层数据选择
摘要
arXiv:2608.16927v1 Announce Type: new Abstract: As supervised fine-tuning data continues to scale, selecting high-value subsets from large candidate pools is crucial for reducing training cost and imp...
and
data
fine
MASS
for
training
semantic
selection
coarse
coverage
2026-08-20
1 阅读
约1分钟阅读
Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu
字号:
arXiv:2608.16927v1 公告类型:新 摘要:随着监督微调数据不断规模化,从大型候选池中选择高价值子集对于降低训练成本和提高模型性能至关重要。现有的方法通常直接在原始嵌入空间中测量多样性,其中几何度量纠缠着主导语义方向、细粒度监督差异和局部噪声。我们通过将数据选择表示为从粗到细的分层覆盖问题来解决这一限制,并提出 MASS。 MASS 使用密集自动编码器学习低维主流形坐标以进行粗略语义分组,然后使用 TopK 稀疏自动编码器在每个组内执行质量感知的稀疏特征覆盖。 Vision Flan 和 LLaVA-CoT 上的实验表明,MASS 在多个预算中始终优于强大的数据选择基线,并且在多种设置中仅使用一小部分数据就匹配或超过了完整的数据训练。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱