首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

在垃圾邮件中寻找信号:从成对比较中联合学习奖励和工人可靠性

摘要

arXiv:2608.10045v1 Announce Type: new Abstract: The problem of learning from pairwise comparisons has been widely studied across many domains such as recommendation systems, social choice, and more re...

and the comparisons this our algorithm problem learning pairwise using
2026-08-12 1 阅读 约1分钟阅读 Kaustubh Shivshankar Shejole, Tanish Agarwal, Arpit Agarwal, Avishek Ghosh
分享:
字号:
arXiv:2608.10045v1 公告类型:新 摘要:从成对比较中学习的问题已在推荐系统、社会选择以及最近的微调大型语言模型等许多领域得到了广泛研究。在这个问题中,目标是根据项目之间的成对比较来学习项目奖励。在许多情况下,这些比较是由使用 Amazon Mechanical Turk、Scale AI 等平台的众包人员得出的。然而,由于领域知识有限或收入最大化(垃圾邮件)行为,众包人员通常不可靠。在这项工作中,我们的目标是了解工人可靠性(能力)是否可以与项目奖励联合学习。为此,我们采用玻尔兹曼理性模型进行成对比较,该模型通过纳入工人能力来扩展布拉德利-特里-卢斯模型。我们通过引入 Polya-Gamma 潜变量将逻辑似然转换为条件高斯形式,推导了在此模型下基于 EM 的学习算法,从而实现了易于处理的优化,并在算法的 E 步中得到了简化的 $Q$ 函数。这项技术使我们能够将公式简化为矩阵传感问题,并利用它为我们的算法建立理论收敛保证。我们对现实世界和合成数据集进行了广泛的实验。这些实验证明了使用我们的算法相对于多个基线的优势,并证实了其对垃圾邮件发送者和敌对工作人员的强大鲁棒性,突出了其在现实众包和奖励学习环境中的实际有效性。代码和数据可在 https://github.com/KaustubhShejole/BoRa_EM 上公开获取。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱