智能AI
morning
测量语言模型代理中的跨任务行为一致性
摘要
arXiv:2608.13598v1 Announce Type: new Abstract: Agent evaluation relies almost entirely on outcome metrics such as success rate, which capture whether an agent succeeds but not how consistently it beh...
that
and
task
consistency
success
the
are
agent
tasks
BCM
2026-08-17
1 阅读
约1分钟阅读
Amritesh Banerjee, Pranil Raichura
字号:
arXiv:2608.13598v1 公告类型:新 摘要:代理评估几乎完全依赖于成功率等结果指标,这些指标捕获代理是否成功,但不捕获其行为的一致性。我们认为跨任务的行为一致性是一个独特且可测量的属性,并且我们引入了行为一致性指标(BCM)来量化它。 BCM 训练一个模型,根据代理执行轨迹的行为特征来预测任务成功,导出每个轨迹的特征属性向量,并测量代理系统内这些向量的平均成对相似度。在软件工程任务上的六种语言模型代理的大约 9,000 个轨迹中,我们的主要发现是,跨任务和任务内一致性是不同的轴,可能会出现分歧:一些系统是本地可重复的,在一项任务的重复尝试中表现相似,但全局分散,在不同任务之间没有稳定的策略,而其他系统在两个尺度上都是一致的。先前的工作仅测量相同任务的可重复性,因此无法观察到这种分离。我们进一步发现,一致性并不能简化为成功率,因为具有可比成功的系统在一致性方面可能存在巨大差异,并且在保持任务难度不变的任务内控制下,前沿与开源一致性差距仍然存在。我们将 BCM 定位为过程级可靠性信号,可补充结果指标,并且我们明确说明其有意义的条件。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱