首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

是什么让终端工作台任务变得困难?在判定代理语料库上区分真硬度和假硬度

摘要

arXiv:2609.26826v1 Announce Type: new Abstract: Frontier benchmarks need tasks that current models cannot solve. But a task that no model solves is not automatically a hard task. The same zero pass ra...

tasks that and the task not The pass can capability
2026-09-24 1 阅读 约2分钟阅读 Edward Lue Chee Lip, Boden Moraski, Tim Knappe, Lang Xiong, Sarvesh Gharat, Antonio Mari, Ivan Bercovich
分享:
字号:
arXiv:2609.26826v1 公告类型:新 摘要:前沿基准测试需要当前模型无法解决的任务。但没有模型能够解决的任务并不一定是一项艰巨的任务。同样的零通过率可能来自于真正的能力差距,但也可能来自于上下文缺失、参考解决方案损坏、基础设施故障或可以绕过的验证器。在本文中,我们使用冻结的 Terminal-Bench 3 / Frontier-Bench 0.1 生产记录来研究这个问题,其中包含 1,081 个拉取请求、639 个评分任务、28,801 次试验以及记录的代理支出 105,933 美元。我们询问全部失败的任务实际上证明了什么。对于没有诚实通过的 125 项任务,我们结合了任务工件、参考解决方案运行、空解决方案控制、对抗性试验、轨迹、遥测和审查记录,并应用有序有效性筛选。 125 项任务中只有 78 项作为经过认证的未解决候选任务幸存下来。其余任务包括 14 个预言机损坏的任务、8 个以基础设施故障为主的任务、4 个只能通过验证者旁路才能通过的任务、以及 21 个其可解决性未经现有证据证明的任务。因此,缺乏饱和度和真正的困难并不是一回事。经过认证的未解决标签也很狭窄:这意味着所编写的路线已通过,基础设施没有占主导地位,没有观察到严格的旁路,并且所有评估的代理都失败了。它不能证明内在硬度、验证器完整性或预期功能的失败。我们进一步分析被拒绝的提交和通过的任务,以表明仅通过率无法解释任务为何困难。总的来说,我们的结果表明,前沿基准应该在将其用作能力声明之前报告其全失败任务背后的证据。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱