首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

ReNFT:通过内部概率质量重新校准修复训练后奖励模式崩溃

摘要

arXiv:2609.00061v1 Announce Type: new Abstract: Reward post-training of diffusion generators inevitably concentrates probability mass on a few reward-favored modes, a mode collapse that erases within-...

the and reward post probability mass that prompt from new
2026-09-02 1 阅读 约1分钟阅读 Yuchen Bao, Chao Wen, Haowei Wang, Ruoxin Chen, Donghao Luo, Jiahui Zhan, Wenjian Huang, Shen Chen, Yiting Wang, Taiping Yao, Chengjie Wang, Shouhong Ding, Jianguo Zhang
分享:
字号:
arXiv:2609.00061v1 公告类型:新 摘要:扩散生成器的奖励后训练不可避免地将概率质量集中在一些有利于奖励的模式上,这种模式崩溃会消除提示内的多样性。现有的缓解崩溃的方法依赖于外部信号或接口、通过感知目标增加奖励、调整参考正则化或修改文本编码器,但没有一种方法可以修复已经崩溃的适配器,同时保留所获得的奖励。我们观察到,在线后训练主要是重新分配从预训练继承的能力的概率质量,而不是学习新的视觉内容。因此,崩溃是抑制,而不是删除,并且可以从生成器内部逆转。我们提出 ReNFT,它通过内部概率质量重新校准来修复高回报、低多样性的适配器。无条件探测首先优先考虑“反中心”提示,其中与提示无关的偏见最容易暴露。然后,两条政策主导的混合路线从相同的提示和初始噪声中生成匹配的反事实建议,一条探索冻结的基础方向以寻找受抑制的替代方案,另一条则暴露训练后的无条件趋势。自适应翻转防护的奖励排名分配拉动和推动角色,联合配对 NFT 更新实现修复。在 PickScore 和 GenEval 上,ReNFT 保留了 NFT 98.9% 和 99.0% 的奖励,同时将 DreamSim-Div 分别提高了 58.8% 和 55.0%,为外部干预提供了补充替代方案。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱