首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

分片可防止 LLM 监督失败和对抗性剥削

摘要

arXiv:2608.06422v1 Announce Type: new Abstract: Giving an LLM judge more compute does not necessarily make it check more requirements. When one call must return many verdicts, some decisions become we...

the that judge call budget and sharding more verdicts even
2026-08-10 1 阅读 约1分钟阅读 Victor Akinwande, J. Zico Kolter, Aran Nayebi
分享:
字号:
arXiv:2608.06422v1 公告类型:新 摘要:为 LLM 法官提供更多计算量并不一定会让其检查更多要求。当一个调用必须返回多个判决时,即使该调用收到与一组单独调用相同的代币或工具预算,某些决策也会变得缺乏证据基础。在专家分级的研究复制、法律工作和临床试验评估中,随着每次通话裁决数量的增加,与专家的一致性下降。我们将分片视为缓解基于模型的监督失败的干预措施。分片将需求划分为更小的组,将每个组分配给单独的调用,并聚合结论。与小组的全部预算的单一调用相比,分片可以提高一致性,同时保持模型、证据、总预算和每个决策预算固定。总的来说,我们发现,一个分片较弱的法官可以胜过一个更有能力的整体法官,并且可以与该法官相匹配,即使后者收到了小组的全部预算。此外,我们发现分片对对手表现出鲁棒性。 N 中最好的对手可以固定基础作品,只改变其表现形式,并成倍提高超载的法官对真正未满足标准的接受度。无论分片减少基线误差,它都会消除这种对抗性优势,即使对手的搜索范围扩大,也能保持较低的过度接受度。分片并不能解决在每个标准上分别说服法官而不是利用过载的攻击。在这种情况下,我们发现分片之上的辩论式反对能够承受这种自适应重新优化。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱