首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

神鬼寓言5.1超越却贵了2.5倍人类,NeoCognition给特工进公司算了笔账

摘要

机器之心发布 大模型榜单越来越多,但榜单上的几分差距,到了真实工作中究竟意味着什么,并不容易判断。 在 Artificial Analysis(AA)、Terminal-Bench 4.0 和 CursorBench 4.0 等评测中,Fable 5.1 和 Opus 5 的成绩只相差几分。可如果让它们进入同一家公司,使用同样的软件、学习同样的业务,再连续处理同一批账单,结果却变成了 72% 对 ...

Agent ApprenticeBench Fable Opus https Astra 100 the benchmark 机器之心发布
2026-09-19 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 大模型榜单越来越多,但榜单上的几分差距,到了真实工作中究竟意味着什么,并不容易判断。 在 Artificial Analysis(AA)、Terminal-Bench 4.0 和 CursorBench 4.0 等评测中,Fable 5.1 和 Opus 5 的成绩只相差几分。可如果让它们进入同一家公司,使用同样的软件、学习同样的业务,再连续处理同一批账单,结果却变成了 72% 对 36%。 完成的任务数,差了一倍。 这个结果来自 NeoCognition 最新发布的 ApprenticeBench。与常见的单项能力测试不同,它把 Agent 放进一家模拟建筑公司,让它像新员工一样入职:阅读员工手册和历史资料,使用真实企业软件,并根据主管反馈逐渐摸清公司的业务规则。 ApprenticeBench 主页链接:https://apprenticebench.com/ Agent 没有针对这份工作接受专门训练。它需要一边工作,一边从公司的历史数据和带教过程中学习。在这项评测中,Fable 5.1 和 GPT-6 Astra 分别取得 72% 和 68% 的通过率,也超过了本次表现最好的人类测试者的 51%。 Fable 5.1 和 Astra 出现明显的能力跃升,超过本次人类测试者。图源:ApprenticeBench 博客(https://neocognition.io/blog/apprentice-bench/) 这也带出了一个更大的问题:如果 Agent 能自己熟悉软件、学会业务,今天需要 FDE(前线部署工程师)为每家客户做的部署和适配,未来能不能交给 Agent 自己完成? 一份看似普通的会计工作,为什么能拉开这么大的差距?对正在训练下一代模型的团队,这些差距又意味着什么? 公司的规矩, 进公司才知道 会计学知识可以提前学习,但是一家公司具体怎么做账,最近改了什么政策,任何通用模型都不可能,也不应该知道。一个新员工入职后要补的课,Agent 一样要补。 这便是 ApprenticeBench 的核心设计思路:Agent 进入一家模拟建筑公司,使用和人类员工同样的软件(Odoo)处理应付账款。入职时,它拿到员工手册、软件教程和六个月的历史账单,随后连续处理 100 张新账单。在第一个月里,主管会逐单指导,后来只在月底提供稀疏反馈。 从翻阅历史记录,到逐步独立处理业务,Agent 经历与新员工相似的学习过程。图源:ApprenticeBench 博客 真正做起来才会发现,麻烦都藏在细节里 ——the devil is in the details 建筑公司的应付账款工作中,单位写错、保险过期、前任没交接清楚,都不稀奇。同一张账单,几个问题经常一起出现,还得来回沟通好几轮。然而,现有的 benchmark 把真实工作里的这些麻烦都省略了。同时还有很多规矩,根本不会被明确写下来。相同的支出描述,因为用途不同,就可能归入不同成本码(cost code)。Agent 需要从历史账单中自己琢磨,而不能只靠名称猜答案。 这些麻烦都被放进了 ApprenticeBench。100 个任务经过两位合计拥有超过 30 年相关经验的专业人士独立验证,确认它们确实会在工作中发生,也能根据 benchmark 中提供的信息解决。 拥有 20 年经验的建筑业财务主管 Emilie F. 表示: “这些场景很真实。比如项目经理弄丢了东西却没有意识到,这种事比你想象的常见得多。在参与这个项目之前,我从没想过 AI 能处理这类工作。如果它能应付这些邮件、来回沟通和交叉核对,我相信它会成为会计部门真正的帮手。” 有 10 年建筑与项目管理经验的企业经营者 Austen K. 表示: “这些场景非常符合建筑业财务主管会遇到的情况。目前这些工作都由我自己处理。如果 AI 能接手,我就能腾出时间承接更多项目、拓展业务。对我这样规模的公司,这很容易带来每年六位数美元的价值。如果 AI 能学会这些并拿到高分,我很愿意让它到自己的公司试一试。” 这就是团队所说的 “生态效度”(ecological validity)。它还关系到一种更容易推广的部署方式:企业能否用现有的软件、资料和带教流程,让 Agent 真的像新员工一样学会工作? 真实工作, 让模型真正拉开差距 单独测试软件操作,两个模型可能表现接近。但做一份完整的工作,Agent 还得从历史记录里学会公司的惯例,根据主管反馈和政策变化调整做法,并与供应商沟通、补齐信息。这些挑战也会相互影响。软件使用不熟练,可能无法精确检索相关历史记录,公司的规则也就学不明白。主管指出的问题没学会改,后面的账单则会继续出错。把这些挑战放在一起,单项测试中不明显的差距就会累积。Fable 5.1 与 Opus 5 从其他榜单上相差几分,到 ApprenticeBench 的 72% 对 36%,正是值得进一步研究的差距。 AA:Fable 5.1 为 53,Opus 5 为 51。图源:Artificial Analysis 排行榜 Terminal-Bench 4.0:Fable 5.1 为 57.9%,Opus 5 为 51.8%。图源:Terminal-Bench 排行榜 CursorBench 4.0:Fable 5.1 Max 为 51.8%,Opus 5 Max 为 46.6%。图源:CursorBench 排行榜 另外值得一提的是,开源权重模型与闭源模型的差距也很直观。Fable 5.1 和 Kimi K3 在 AA 上是 53 和 44,在这里则是 72% 和 18%。这 100 张账单里,一个有 28 张没通过,另一个是 82 张。如果最后由你接手,这个差距恐怕很难忽略。 这套评测提高了复杂案例的比例,不能直接当作日常业务的错误率。不过,那些需要人接手的地方,恰恰值得模型团队仔细看。 下一版模型, 该往哪里使劲? 分数拉开了,接下来让我们看看原因。ApprenticeBench 的几组分析,已经给出了一些具体线索。 用鼠标代替 API,模型要交多少 “CUA 税”? 用图形界面做事,到底会拖累模型多少?为了公平比较,ApprenticeBench 团队专门基于 Odoo 的后台接口,定制了一套与图形界面功能对等的 API 工具,让模型分别通过两种方式完成同一份工作。 团队提出了 “CUA 税” 这一概念来衡量 agent 从 API 切换为 GUI 导致的成功率损失: CUA 税 =(API 成功率 − GUI 成功率)÷ API 成功率 使用 GUI 带来的相对成功率损失随模型代际快速下降。图源:ApprenticeBench 博客 这笔 “税” 随模型迭代逐渐降低。Fable 5.1 的 GUI/API 成功率为 72%/70%,Astra 为 68%/65%。这一结果说明今天最强模型的 CUA 税可能已经消失。 这意味着,Agent 有望直接使用企业现有软件,减少专门开发接口的需要。不过,GUI 的操作成本仍然更高,效率上还有提升空间。 模型原本就会,还是入职后学会的 做对一道题,不一定说明模型学到了新东西。它可能本来就会,也可能只是找到了可以照抄的答案。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱