首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Opus 5通关ARC-AGI-3!马具正在变成捆住模型的绳子

摘要

新智元报道 30.2%。 这是ARC Prize官方给Opus 5打的ARC-AGI-3成绩。 排行榜第一,甩开第二名GPT-5.6 Sol(7.8%)近四倍。 听着还行,对吧? 但就在刚刚,开发者Jeremy Berman把一组数字甩到了X上,直接把AI圈看懵了—— 25个公开关卡,单次通关24关,Opus 5的正确率从 30.2% 飙升至96.2%! 每关要是给两次机会,正确率直接飙到99.3...

Opus AGI Sol 权重没动 269个程序 27万行代码 同一个模型 Harness 新智元报道 这是ARC
2026-08-13 1 阅读 约6分钟阅读 新智元
分享:
字号:
新智元报道 30.2%。 这是ARC Prize官方给Opus 5打的ARC-AGI-3成绩。 排行榜第一,甩开第二名GPT-5.6 Sol(7.8%)近四倍。 听着还行,对吧? 但就在刚刚,开发者Jeremy Berman把一组数字甩到了X上,直接把AI圈看懵了—— 25个公开关卡,单次通关24关,Opus 5的正确率从 30.2% 飙升至96.2%! 每关要是给两次机会,正确率直接飙到99.3%,25关几乎一关不漏。 从30分到96分,模型没换,权重没动,中间就隔了一台电脑。 给它一台电脑 剩下的它自己想办法 Berman的做法简单到不讲道理。 一个Claude Code环境,一个动作命令,一份文件系统日志(到目前为止发生了什么)。没有精心设计的提示词,没有针对ARC写的专用代码。 剩下的, 就是交给Opus 5去探索,自己摸清规则,自己造出需要的工具,自己把关打通每一关从零开始,打完就扔。 ARC-AGI-3这一代要模型钻进一个从没见过的小游戏里,边玩边搞清规则。小孩哥几分钟就能上手,但AI历来在这儿摔得鼻青脸肿。 关键就在于,每一关游戏规则都是先造的,模型根本不可能找答案作弊,只能现场推理。 今年3月发布时,最强AI只考了0.37%,人类通关率则是100%。 269个程序,1.27万行代码,全是现场写的 这次测试Berman从没在提示词里让Opus 5写解析器,没让它写模拟器,没让它建世界模型,也没让它写搜索程序。 需要什么工具,模型自己判断,现场就造。 一轮跑下来, Opus 5写了 269个程序,接近1.27万行代码 。 25个游戏全部写了解析器,23个配了搜索函数,9个被它直接写出了能跑的游戏模拟器。 一关一套定制工具,用完即弃,下一关重新来过。 也就是说,Opus 5每次面对一个完全陌生的游戏,它先花几步摸清规则,然后觉得「我需要一个解析器」——啪,现场写一个出来。「得搜索」——啪,写个搜索函数;「得把游戏逻辑模拟出来」——啪,模拟器出炉。通关,全部删掉,下一关再来。 这里有个反直觉的地方。 模型停下来先写一堆程序,账单却比让Opus硬解每一关更低。 原因是代码能复用。模型把推理逻辑压进函数,这个函数可以跑上千次,一口气执行整段动作序列。 这次Opus 5 打通 25 关,全程沙箱断网,总成本只有 540 美元。 整套代码已开源到GitHub,仓库叫arc-code。 同一套壳子,Codex忙着翻墙 搞笑的来了。Berman还把这套程序原封不动换成Codex和GPT-5.6 Sol(xhigh)又跑了一遍。 结果成绩是73.7%。动作数是Opus的三倍左右。 25次会话里, Sol有7次在试图逃出沙箱,上网找答案 。Opus 5这边 0次。 沙箱是断网的。Sol那7次试图逃逸,相当于在考场里疯狂找场外援助。 脚手架正在变成绳子 说到这里,让我们回到最开始那个问题: 同一个模型,分数怎么从30跳到了96? 四个字: 环境变了。 官方把模型摁在椅子上,看一道题答一道题,不许动手,不许打草稿。Berman换了个考法: 给你一台电脑,能写代码,能存文件,能反复试,你爱怎么折腾怎么折腾。 模型还是那个模型,权重没动。但它从「只能动嘴」变成了「能动手」。结果就是它现场给自己造考试工具:解析器、搜索器、模拟器全是临时攒的,考完就扔。 66分的差距,全来自一件事: 你让不让它动手。 Berman在帖子最后说了一句话,值得整个Agent的圈子思考: 「模型越强,harness就该越简单。」 Harness,简单说,就是人类给模型搭的脚手架:提示词模板、工具链、流程规则、防呆机制。 过去两三年,所有人都在研究怎么给模型搭更精巧的架子。斯坦福专门出了篇《Meta-Harness》论文研究怎么优化这些架子。 但Berman证明了一件事: 当模型足够强时,最好的脚手架就是没有脚手架。 一台电脑、一个动作接口、一本日记——三样东西,比任何精心设计的提示词工程都好使。 根因在于那些精心设计的工具链和流程规则,本质上是人在替模型做决策。你预设了它需要解析器,它可能需要模拟器;你预设了搜索接口,它可能想用完全不同的策略。 人搭的架子,本意是帮忙。 但当模型自己能造出解题需要的一切时,架子反倒成了绳子。 趋势还在继续。随着模型能力增强,「简单环境+强模型」碾压「复杂架子+同一个模型」的案例只会越来越多。Prompt Engineering、工具编排、Agent框架,这些手艺的保质期,可能比想象的短得多。 所以ASI的进度条在哪?也许不在参数量上,不在训练数据上,甚至不在模型架构上。 它在我们敢给模型多大的自由里。 参考资料: https://x.com/jeremyberman/status/2087633198822117446 编辑:所罗门 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱