智能AI
morning
超越路由权重:通过贡献对比对专家混合奖励模型进行忠实的响应水平解释
摘要
arXiv:2608.06400v1 Announce Type: new Abstract: Reward models are central to learning from human preferences, yet identifying what drives their predictions remains challenging. Recent sparse Mixture-o...
and
routing
models
reward
experts
textbf
the
based
human
sparse
2026-08-10
1 阅读
约1分钟阅读
Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Soyoung Oh, Isabel Valera, Vera Demberg
字号:
arXiv:2608.06400v1 公告类型:新 摘要:奖励模型对于学习人类偏好至关重要,但确定驱动其预测的因素仍然具有挑战性。最近的稀疏专家混合 (MoE) 奖励模型试图通过将提示路由给专业专家并通过具有高路由权重的示例来描述专家来提高可解释性。然而,路由权重仅揭示了哪些提示专家$\textit{receives}$,而不是它$\textit{judges}$如何响应,仅提供了专家行为的部分说明。因此,我们提出 $\textbf{Co}$ntribution-$\textbf{Co}$ntrast ($\textbf{CoCo}$) 响应级别解释,它使用具有最大贡献对比的选择-拒绝响应对忠实地表征专家的角色,共同捕获路由和偏好行为。在自动和人工评估中,CoCo 比基于路由器、基于分数和基于稀疏自动编码器的替代方案产生更加连贯、忠实和专业的解释,同时保持有竞争力的奖励建模准确性。据我们所知,这是对教育部奖励模型解释方法的首次系统研究。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱