首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI evening

33%!Claude、GPT、Gemini在真实网站上集体翻车,ClawBench把AI代理打回原形

摘要

论文标题:ClawBench:Can AI Agents Complete Everyday Online Tasks? GitHub: https://github.com/TIGER-AI-Lab/ClawBench 项目主页: https://claw-bench.com/ 论文链接: https://arxiv.org/abs/2604.08523 Hugging Face: https:...

ClawBench agent https 153 TIGER Lab com 144 Claude Sonnet
2026-09-02 1 阅读 约10分钟阅读 机器之心
分享:
字号:
论文标题:ClawBench:Can AI Agents Complete Everyday Online Tasks? GitHub: https://github.com/TIGER-AI-Lab/ClawBench 项目主页: https://claw-bench.com/ 论文链接: https://arxiv.org/abs/2604.08523 Hugging Face: https://huggingface.co/collections/TIGER-Lab/clawbench 如果你觉得 AI agent 离帮你订机票、填报销单、投简历只有一步之遥,那 MMLU-Pro 的作者联合滑铁卢大学 TIGER Lab,UBC NAIL Group 和 UniPat AI,CMU 等机构刚刚放出的这项研究,可能会让你冷静下来。 ClawBench,一个让 AI agent 在 144 个真实生 产环 境网站 上执行日常任务的新评估框架,结果堪称惨烈: 最强的 Claude Sonnet 4.6,每三个任务就要翻车两个。GPT-5.4 更是只有 6.5%—— 在 153 个任务中仅完成 10 个。 而且, 153 个任务里有 68 个(44.4%)没有任何一个模型能做对。 一个都没有。 不是 "AI 会不会用浏览器" 的问题, 是 "AI 能不能替你干活" 的问题 现有的网页 agent 评测,大多长这样: WebArena :在自己搭的沙箱里测,网站是假的,页面是静态的,能出什么错? OSWorld :虚拟机里跑,就 9 个应用,翻来覆去测那几招。 Mind2Web :更省事,直接拿录好的操作轨迹考选择题 —— 连浏览器都不用开。 前沿模型在这些评测上能轻松拿到 65%-75% 的分数,看上去让 agent 执行现实任务指日可待。 但 ClawBench 干了一件不一样的事: 它让 AI 用浏览器直接接入真实网页 。不是沙箱,不是模拟器,是人们每天都在用的那些生产环境 ——Google Flights、DoorDash、Zillow、Instacart、Airbnb、LinkedIn、Doodle……144 个平台,153 个任务,覆盖了从购物、订票、投简历到填保险报价单等 15 个日常类别。 而且 AI 要解决的不是 "搜一下某个航班多少钱" 这种只读任务。ClawBench 考的是写操作 —— 下单、预约、提交申请、发送消息。换句话说,它考察的是 AI 能否作为用户的 “替身”,完成真正需要通过交互改变和理解网站状态的复杂任务。 结果是: 那些沙箱里的高分,在真实网站上几乎清零了。 论文的原话一针见血: "Strong performance on existing web-agent benchmarks does not transfer to everyday write-heavy tasks on live production websites." 翻译过来就是:你以为的学霸,换了个考场直接交白卷。 安全难题:怎么让 AI 随便点, 又不让它真把钱花出去? 这个基准有一个绕不开的技术难题:你让 AI 在真实网站上执行写操作,它万一真下了个订单、真投了份简历、真发了一封邮件 —— 谁来背锅? ClawBench 的解决方案很巧妙,叫做 final-request interception(终态请求拦截) 。 具体做法是:人类标注员先把每个任务完整走一遍,标记出那个 "不可逆的最后一击" 是哪个 HTTP 请求 —— 比如 DoorDash 上的 "下单" 按钮对应的 POST 请求。然后,在 AI agent 执行任务时,系统通过 Chrome 扩展和 CDP(Chrome DevTools Protocol)监控所有出站流量。 论文报告了一个让人放心的数字:在 153 个人类参考运行中,拦截器 100% 捕获了所有终端请求,零误伤导航流量。 换句话说,AI 可以像人类用户那样正常浏览、搜索、填表、点击,在真实网站上走完全程,— 但当它试图发出那个标记好的终端请求时,系统直接拦截,请求永远到不了服务器。 AI 可以在网站上 "走完全程",但影响真实世界的扳机永远不会真的扣下去。 不是 "不够聪明", 而是 "最后一公里" 集体恐惧症 论文最有意思的发现,藏在失败轨迹的细粒度分析里。 表面上看,Claude Sonnet 4.6 的失败是因为 人工验证墙拦截 (Cloudflare、DataDome 验证码直接拒掉自动浏览器)、登录卡关、填错表单字段这些 "硬伤"。 但有一个问题在所有模型身上反复出现,论文称之为 " last-mile non-commitme n t "—— 最后一公里恐惧症。 什么意思?Agent 能把前面的步骤全做对:找到正确的网站、搜到正确的商品、点进正确的页面、填好正确的表单…… 然后,在需要点那个 "提交"/"确认"/"下单" 按钮的时候, 它停住了 。 论文里有一个让人哭笑不得的案例: ClawBench 任务 780:在韩国美妆网站 Soko Glam 上完成一次购买流程。Claude Sonnet 4.6 完美地找到了商品、添加到购物车、进入结算页面、开始填收货地址 —— 然后在输入街道地址打到一半的时候,轨迹戛然而止。没有点击 "提交订单",没有发出任何提交请求。171 秒,121 个浏览器操作,全部正确 —— 只差最后一步。 论文统计显示,八个模型中有六个,大量失败轨迹都堆积在 "已到达最终确认页面但未提交" 这个阶段。 另一个让人意外的发现是:失败轨迹消耗的浏览器操作数量, 比成功轨迹还要多 。Claude Sonnet 4.6 的失败运行中位操作数是 120 次,而成功运行只需 64 次。Gemini 3 Flash 的失败中位数是 74 次,成功是 45 次。 这说明什么? AI 不是探索不够,而是在原地打转。 碰到验证码就反复刷新、遇到表单校验不通过就重复填、被反爬墙拦住就不停重试 —— 大量的 token 和 API 费用,烧在了毫无进展的死循环里。 GPT-5.4 怎么了?14 个工具调用就交卷 这张成绩单上,最让人意外的不是谁赢了,而是谁崩了。 GPT-5.4,OpenAI 的旗舰模型,在 ClawBench 上只拿了 6.5% 。153 个任务完成 10 个。 但比这个数字更离谱的是它的行为模式: 平均每个任务只做 13 次工具调用 (Qwen 3.5 是 42 次,Sonnet 4.6 是 61 次)。 85 个任务上直接主动退出 (agent_exited),是自己说 "我完事了" 然后走人。 中位运行时长只有 196 秒 ,而 Sonnet 4.6 的中位数是 593 秒。 论文的诊断是 "early termination"—— 不是能力不够,是 根 本没认真做 。GPT-5.4 似乎倾向于 "快速判断任务太复杂然后放弃",而不是像 Sonnet 4.6 那样坚持到要么成功要么撞墙。 而在它真正尝试的任务里,又暴露出另一种问题 —— "假完成"(false completion) : ClawBench
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱