首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

刚刚,英伟达AI刷爆ARC-AGI-3!华人班底一口气屠了183关

2026-08-23 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 就在刚刚,英伟达的通用编码智能体 AVO , 在ARC-AGI-3上拿了满分! 它在25个游戏环境里通关了全部 183个 关卡,总共只花了 6624步 ,RHAE拿到 100.00 。 要知道ARC-AGI-3是出了名的不讲武德。它把智能体直接扔进一个陌生游戏,规则和目标都不给,全靠自己按、自己看、自己猜。 有的环境能上下左右挪,在走廊里绕来绕去,撞上一个蓝黑色的方块,整幅画面就转90度;有的连走都不让走,只能点,靠点击把格子的颜色循环成目标图案。 每个环境至少六关,越往后越狠,第一关五步能过的,第六关得走五十步。 而智能体手里只有一块64×64的网格,和几个按键。 前沿模型直接硬闯,根本搞不定。 AVO这次 用的模型是Claude Opus 5。但 让它单独去考 ,成绩 只有 30.16%,而这还是官方认证榜上的第一名。 ARC Prize拆过上一代的对局录像,归纳出了三类典型错误。 一是局部看懂了,全局没看懂。 二是把陌生机制往熟悉的游戏上套。 三是过了关,却没学会。 第三种最要命。Opus曾经只用37步就打通了ka59的第一关,但它对点击机制的理解从头就是错的。进到第二关,它还抱着那套错理论不放,最后卡死在了里面。 英伟达的做法是不碰模型,只在外面加一层壳。 于是,同一个Claude Opus 5, 分数直接从30分跳到了满分。 然后 X上直接炸了。一边是「ARC-AGI-3已倒下」「该换个新榜爬了」满屏刷,一边是直呼英伟达这波太顶了。 照这个势头,下一次模型级别的跃迁,说不定不是等来一个新模型,而是等来一次harness更新。 100分的跳跃,拆开只有两样东西 那英伟达到底在模型外面装了什么,能把这三个坑一次填上? 和最近爆火的DeepSeek Harness、Codex Harness一样,AVO管的也是模型之外的一圈事。 包括给它什么上下文、给它什么工具、怎么存状态、怎么接反馈、卡住了怎么办,还有上下文满了之后怎么接着干等等。 具体到机制上,真正起作用的是两样东西。 第一个是持久记忆。 长时程任务最要命的地方在于上下文会满。 一满,模型的记忆就清零了,前面试过什么、哪条路走不通、profiler吐出来什么结果,全都没了。 下一轮开始,它又从头把同样的坑再踩一遍。 AVO则会把这些全都存了下来,过往的实现版本、每次评测的结果、编译器和分析器的输出、累积下来的推理过程都在里面。 上下文重置之后,智能体是从当前状态接着干,而不是从零开始重建整个搜索。 第二个是监督器。 主智能体负责埋头干活,看什么、改什么、测什么、提交什么都由它自己定。 监督器不干活,只在旁边盯着整条搜索轨迹。一旦发现进展停滞,或者智能体开始原地打转反复做无用功,它就出手把主智能体拽向别的策略。 还有个细节。 AVO跑ARC-AGI-3全程用的是 纯文本模态 ,每一帧观察喂给模型的是一个精确的64×64文本网格,一张图都没有,一个图像token都没送。 也就是说,在一个满屏都是像素的游戏里,模型从头到尾一眼都没看见画面。 这套机制换来的,就是6624步跑完183关、RHAE拿满的那份成绩单。 英伟达从这里得出的结论是,长时程能力从来不是模型单独具备的,而是整个系统凑出来的。 记忆决定哪些东西能留到下一轮,工具决定智能体能做出哪些动作,反馈让它知道自己有没有走错。 而假设被推翻的时候,能不能爬回来接着干,决定了这份活能不能一直做下去。 它先革的是英伟达自己的命 有意思的地方在于,AVO压根不是为了打游戏做的。它的主战场是 GPU 算子优化 。 今年3月25日,英伟达往arXiv上传了一篇论文,叫《AVO:面向自主进化搜索的智能体式变异算子》。 论文地址:https://arxiv.org/abs/2603.24517 题目里有两个词是关键,一个是进化搜索,一个是变异算子。 进化搜索本身不复杂。手里攥着一批候选代码,改一改,跑一跑,留下最快的那版,再接着往下改,一代一代推过去。 负责「改一改」这一步的,在进化算法里就叫变异算子。过去它是写死的,改法由人提前定好;后来换成LLM来改,也只是调一次吐一段代码。 而AVO的做法是,把整个变异算子换成一个自主智能体。 如此一来,它不仅能翻CUDA编程指南和PTX架构文档,能跑测试,能读profiler,还能自己诊断正确性故障,然后决定下一版改哪儿。 团队把它放到B200上,任务是优化注意力内核,这是Transformer里被榨得最狠的一个算子。然后人就撒手了。 AVO连续自主跑了 7天 ,探索了超过 500个 优化方向,最终提交 40个 有效内核版本。 跑出来的多头注意力内核,比英伟达自家闭源的cuDNN最多快 3.5% ,比最前沿的开源实现FlashAttention-4最多快 10.5% 。 随后它又把这套优化搬到了如今大模型主流的GQA上。这回只自主跑了大约 30分钟 ,新内核就比cuDNN快7.0%,比FlashAttention-4快9.3%。 手写CUDA内核一直是这个生态里门槛最高的活,而AVO第一个超掉的就是它。 而ARC-AGI-3那25个游戏,用的就是这同一套系统。 调内核和打游戏,听上去是完全不搭界的两件事。但在英伟达看来,这两件事底下跑的是同一个循环。 智能体先从残缺的证据里立起一个假设,动手去试,观察结果,把有用的状态存下来,再修正自己对问题的理解。假设错了就退回来重想,然后一轮一轮往下滚。 用英伟达自己的话说,能迁移的不是领域知识,而是维持长时程自主推进的那套机制。 做出它的,是一支华人班底 把AVO那篇论文的作者名单拉出来,会看到一串很眼熟的名字。 23个署名,几乎把过去十年开源深度学习基建的关键人物凑齐了。 共同一作之一的许冰,是英伟达的 Distinguished Engineer ,也是MXNet的作者。更早的时候,他还是2014年那篇GAN原始论文的第四作者,和末位作者Yoshua Bengio同署在蒙特利尔大学名下。 TVM和XGBoost的作者陈天奇也在名单上。TVM这条线还牵出了Luis Ceze,两人一起创办的OctoAI在2024年9月被英伟达买下,Ceze随后加入英伟达继续做机器学习编译器。 再往下是FlashInfer的作者叶子豪,以及CUDA编译器元老Vinod Grover。 坐镇的是Humphrey Shi,英伟达高性能AI副总裁,同时还是佐治亚理工的教授。另一位共同一作Zhifan Ye,正是佐治亚理工在读的博士生。 这次的博客署了五个名字,四位是华人,除Humphrey Shi外还有Terry Chen、Zhifan Ye和Yeyin Zhu,剩下那位Jean-Francois Puget是英伟达的两冠Kaggle特级大师。 最有意思的一段来自许冰此前在X上的自述。 一年半前他和Terry Chen刚在英伟达做智能体编程的时候,两个人都不懂GPU编程。 正因为不懂,他们从第一天起就奔着完全自动、不用人插手的系统去做,还给这套路子起了个名字,叫「盲编程」。 一年半之后,这套不靠人指挥的系统,把人类专家优化了几个月的内核给超了。 账最后都结到了老黄的显卡上 一家卖显卡的公司,为什么要花一年半,做一套不用人插手
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱