智能AI
morning
引入无奖励的评审标准,减少代理商评估中的过度信任
摘要
arXiv:2608.13564v1 Announce Type: new Abstract: Evaluating language-model agents at scale increasingly relies on a second language model as an automatic judge, because the gold signal, an executable e...
the
judge
and
trajectories
model
reward
false
environment
rubric
agent
2026-08-17
1 阅读
约2分钟阅读
Darragh Quinn, David Dylan, Roisin Healy, Fionn Carroll, Maeve Donnelly, Cormac Sheehan
字号:
arXiv:2608.13564v1 公告类型:新 摘要:大规模评估语言模型代理越来越依赖第二语言模型作为自动判断,因为黄金信号(可执行的环境奖励)在部署时昂贵、缓慢或不可用。这样的法官是一个无奖励的代理,其价值取决于它是否可信,但现有的法官要么像 G-Eval 那样手写评分标准,要么微调法官的权重,两者都倾向于将流畅但不成功的轨迹视为成功。相反,我们从一小部分带有真实标签的轨迹中归纳出代理判断标题的文本,并将其扎根于真实的结果。我们提出了 RubricForge,它通过针对标记轨迹的反射进化来演化出一种判断规则,以最大限度地提高与环境奖励的一致性,冻结它,并将其应用于没有环境访问权限的一个模型调用中保留的轨迹。优化后的工件是人类可读的文本,因此每个判决都可归因于命名标准。使用一个冻结的 7B 模型作为代理人和法官,在 tau-bench(从 220 次展示中绘制出 173 条标记轨迹)和 WebShop(160 条)上,主要收益是忠诚度而不是原始一致性。相对于通用 G-Eval 判断的优势并不具有统计显着性(McNemar p = 0.248),并且绝对分数校准稍微有利于通用判断(|err| 差异 -0.048,p = 2x10^-4)。然而,RubricForge 过度信用失败轨迹的频率大约只有一半(tau 工作台上的错误通过率分别为 0.115 与 0.173,其中 3 次过度信用捕获和零逆转)并且对 WebShop 结果的评级更加忠实(Spearman 0.410 与 0.370)。对于无奖励评估者来说,与部署相关的数量是错误通过率,而不是总体一致性,因为错误通过会导致代理损坏,而错误失败只会导致重试。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱