首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

最强AI改进自己只得0.16分? Einsia AI发布AI4AI-Bench:AI能否设计出更好的AI?

2026-08-23 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 导读 AI 能否改进 AI 自己? AI 已经会写 AI、训练 AI、优化 AI 系统;下一个里程碑,是 AI 能不能开始「设计 AI」。 对于今天的 Coding Agent 来说,它能介入的改进大致有三层: 系统工程解决算子、并行和通信,最终受硬件上限约束;数据工程改进配比、合成和清洗,受高质量信息供给限制;而算法设计改变的是目标函数、更新规则和训练流程本身。 这一层最特殊, 一个 更好的算法改变的是:在同样的数据和算力下,究竟能换来多少能力。 Adam、DPO、GRPO 这样的进步一旦出现,就能持续影响之后的一代代模型。 所以,如果 Recursive Self-Improvement 真要形成闭环,关键问题就是: 「今天的 Agent,已经能开始设计更好的 AI 算法了吗?」 Einsia AI 旗下 Navers Lab 最新发布的 AI4AI-Bench ,盯上的正是这个问题, 该 Benchmark 在 X 发布 7 小时后获得 110 万次浏览, 引起了 2956 条相关讨论并登上 X 的 Today News。 AI4AI-Bench 在 X 发布 7 小时后获得 110 万次浏览 论文题目:AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 项目主页:https://lab.einsia.ai/ai4ai Arxiv: https://arxiv.org/abs/2608.20318 GitHub Repo: https://github.com/Einsia/AI4AI-Bench 当 Agent 不再只是 “改代码”, 而是要改 “模型怎么学” 区分「调参」和「设计算法」,从来不能看 diff 有多长。 同样是「改进训练算法」,一份提交可能把训练步数拉长、学习率调小、checkpoint 存得更频繁,改了几百行,本质上仍是在使用既有算法;另一份只改了几行,却重写了损失函数中的关键项,真正改变了模型如何学习。 AI4AI-Bench 把这条边界划得很清楚: 超参数是算法接受的输入,算法改动则改变算法本身。 这也是算法研究真正困难的地方。一个成熟的算法研究员需要从训练动态中判断问题究竟出在哪里:策略熵是否坍缩,某个惩罚项是否压过主目标,奖励模型是否已经饱和…… 然后修改对应的机制,而不是继续在外围调参数。 「先定位机制,再改变机制。」 AI4AI-Bench 想测的,正是今天的 Agent 能不能进入这个研究闭环。 把 Agent 扔进十个真实的研究仓库 为了把这件事测得足够真实,Navers Lab 没有专门「造题」,而是直接选了 10 个真实的 AI 研究仓库 ,覆盖 10 类不同的算法问题: 其中 8 个涉及模型训练,另外两个 —— 权重平均和 One-shot 剪枝 —— 本身并不训练模型,但同样需要做算法决策 AI4AI-Bench 的十个真实研究仓库 一套不给 Agent 留空子的评测流程 AI4AI-Bench 把 Agent 的探索和最终验收彻底分开。 第一阶段是 4 小时探索。 Agent 拿到一张 B300,可以自由读代码、改代码、跑训练,也可以反复查看一个廉价的 proxy metric。时间一到,真正留下来的只有一份东西:源码。探索阶段产生的权重、缓存和临时状态全部作废。 第二阶段是最长 12 小时的独立重跑。 提交的源码会在全新环境中从头执行,最终产出的模型再交给一个预先冻结、Agent 从未接触过的 evaluator 打分。更关键的是,它要击败的 baseline 就是原始仓库自己的代码。同一张 GPU、同样的时间预算、同一份数据、同一个 evaluator。 它只问一件事: 「在完全相同的条件下,你改过的算法,真的比原来的算法更好吗?」 这套流程也很像真实的算法研究:小实验可以快速筛掉一个想法,但真正决定它是否成立,仍然要靠一次完整、独立的重跑。 AI4AI-Bench 的评测流程 Opus 5 最强, 真正拉开差距的是「有没有进入算法层」 AI4AI-Bench 没有单独比较模型,而是把 模型 + Agent 框架 + reasoning effort 看成一个完整系统。 GPT-5.6 Sol、Terra、Luna 在 Codex 下测试六档 reasoning effort;Claude Opus 5 和 Sonnet 5 在 Claude Code 下测试五档;Kimi K3 则测试最高档 max。 总计 29 个配置,每个配置完成 10 个任务,共 290 组实验。 十个任务的指标之间没法直接比,论文把它们统一换算到一把 0 到 1 的尺子上:0.1 分是仓库自带算法的水平,1.0 分是该指标理论上的最优,什么都没交出来记 0 分。一个分数落在 0.1 以上,衡量的就是「从自带算法到理论最优这段距离,被走完了多少」。 在统一后的评分尺度上, Claude Opus 5 整体表现最强。 而从任务来看,十个任务中只有多轮 Agentic RL 已经出现多个满分配置,其余任务距离上限仍有明显空间。 但论文进一步把每一份代码提交拆开之后,发现了一个比模型排名更重要的分界线: Agent 最后到底有没有真正修改「模型怎么学」? 280 份提交中,有 17 份没有产生可分类的修改。剩下的 263 份里: 141 份 只修改了「训练怎么跑」; 122 份 真正触及了「模型怎么学」。 前一类包括训练多久、learning rate、batch size、保存哪个 checkpoint、adapter 放在哪里;后一类则会修改 loss、加入新的 supervision、更换 update rule,甚至改变训练算法本身。 也就是说,即使已经给了 Agent 四个小时、一整个研究仓库,而且任务明确告诉他「仓库自带的方法只是基线,不是必须保留的做法」, 超 过一半的有效提交仍然没有进入算法层。 从结果来看,进入算法层的提交确实表现得更好。 只修改运行侧的提交,平均分为 0.126;真正修改学习过程的提交,平均达到 0.226,相差 0.100 。 更多思考预算, 真正买到的是「进入算法研究的机会」 那什么东西能把 Agent 推到算法层? 把 reasoning effort 从最低推理档提高到最高档,触及学习算法的提交比例从 8% 上升到 64% 。 低 effort 下,Agent 更多是在改预算、日志和优化器参数;到了高档,它们开始重写 objective、更换 learning rule,甚至给训练流程加入新的 supervision。 而且,reasoning effort 买到的不只是「敢改」。它还买到了更多实验: 四小时内的中位评测次数从 4 次增加到 16 次 ; 修改代码行数从 18 行增加到 246 行 ; 输出 token 从 1.1 万增加到 10.9 万 。 最终成绩也确实随之提高。从最低 reasoning level 到最高档,平均分从 0.094 上升到 0.196;只看 C
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱