智能AI
morning
Auto-Research「终极大考」:新基准撕下大模型科研伪装
摘要
该论文团队由来自10所高校的28位研究者构成,核心作者包含加州大学伯克利分校吕博涵、韩鑫阳,普渡大学张家儒,华盛顿大学李星汉,以及清华大学杨玉成、黄思乔、徐启鑫、张华清、张轶程。团队成员覆盖多领域背景,在大语言模型、强化学习、MLsys、计算机视觉、优化理论等领域的成果受到学界业界广泛认可。 当一个 AI Agent 在机器学习实验中得到更高分,提升究竟来自哪里? 它可能提出了新的优化器或训练目标...
Bench
MLS
Agent
140
https
强化学习
com
H100
该论文团队由来自10所高校的28位研究者构成
核心作者包含加州大学伯克利分校吕博涵
2026-08-12
1 阅读
约10分钟阅读
机器之心
字号:
该论文团队由来自10所高校的28位研究者构成,核心作者包含加州大学伯克利分校吕博涵、韩鑫阳,普渡大学张家儒,华盛顿大学李星汉,以及清华大学杨玉成、黄思乔、徐启鑫、张华清、张轶程。团队成员覆盖多领域背景,在大语言模型、强化学习、MLsys、计算机视觉、优化理论等领域的成果受到学界业界广泛认可。 当一个 AI Agent 在机器学习实验中得到更高分,提升究竟来自哪里? 它可能提出了新的优化器或训练目标,也可能只是调整了学习率、扩大了模型、修改了数据处理,甚至找到了评测流程中的漏洞。只观察最终指标,往往无法区分方法创新与工程优化。 这也是现有 Auto-Research 评测面对的核心归因问题。代码生成与实验执行已经成为前沿模型的常见能力,但「能完成研究流程」并不等于「能发现更好的方法」。如果不控制数据、容量、训练预算和评测协议,任何分数提升都很难被可靠归因到算法本身。 来自伯克利、普林斯顿、清华等多家机构的研究者提出 MLS-Bench ,试图在可执行环境中单独测量这项能力。它包含 12 个机器学习领域的 140 个真实研究任务,每个任务都设置多个泛化条件,并在统一代码库中复现至少三种强人类方法,其中包括领域公认的 SOTA。 论文对初版五个前沿模型的分析发现,即使获得这些强方法的实现,模型仍然更擅长优化和组合已有组件,而不是完成真正的方法发现。 MLS-Bench 论文首页: 论文:https://arxiv.org/abs/2605.08678 项目主页:https://mls-bench.com/ GitHub:https://github.com/Imbernoulli/MLS-Bench 现有评测为什么难以测量方法发现 过去一年,自动研究系统取得了不少进展。一类系统把代码生成、自动验证和进化搜索连接起来,在 circle packing、kernel 优化或固定训练任务中持续提高指标;另一类系统尝试让 Agent 阅读论文、提出想法、编写实现并生成研究报告。 两类路线分别证明了大模型可以进行大规模搜索,也可以执行越来越完整的研究流程。但它们仍留下一个共同问题:结果变好时,我们不知道模型究竟发现了什么。 具体来看,MLE-Bench 一类任务继承了数据挖掘竞赛的形式:模型获得训练集与测试接口,通过数据清洗、特征工程和既有算法组合提高单个数据集上的预测表现。这适合评估机器学习工程,但单点结果无法说明候选方法能否迁移。另一类端到端研究评测让 Agent 生成方案和论文,再由语言模型从新颖性、完整性与可行性等维度评分,却不直接比较候选方法的实际性能。 还有一些任务更接近方法搜索,但聚焦范围较窄。例如激活函数发现可以在少数固定数据和模型上验证大量表达式;nanoGPT speedrun 可以持续吸收新优化器、注意力实现与训练技巧。它们能够推动具体系统,却没有为跨领域方法发现提供统一测量。 在拥有廉价验证器的任务中,系统可以生成大量候选,通过单一分数选择最优实现。这种设置适合测量搜索效率,却不要求候选方法跨数据、模型或规模成立。端到端研究任务覆盖范围更广,但允许模型修改的环节也更多。只要数据处理、训练资源、模型容量或评分逻辑没有锁定,局部工程收益就可能被误认为方法进步。 机器学习方法的价值通常来自可迁移性。残差连接、Attention、归一化或 Adam 并不是只在某个固定实例上有效;它们解决了更一般的问题,并在条件发生变化时继续带来收益。因此,一套面向方法发现的评测至少需要回答两个问题: 提升能否被归因到目标研究组件,而不是其他工程变量? 同一个改进能否跨越多个数据、环境、模型或规模? 从这个角度看,工程优化与科学方法发现的区别不在于是否写代码,而在于优化对象。工程任务允许围绕一个最终指标使用多种技巧;方法发现则要求改进一个明确研究组件,并验证它在多个下游条件与更大规模中仍然成立。 MLS-Bench 的任务设计围绕这两个问题展开。 从真实研究问题构造 140 个可执行任务 MLS-Bench 覆盖语言模型预训练、语言模型后训练、视觉生成、强化学习、机器人、机器学习系统、AI for Science、优化与理论、因果推断、时间序列和可信学习等 12 个方向,共包含 140 个任务。 任务跨度包括 KV 缓存压缩、主动学习、时空交通预测、黑洞图像逆问题、抗体与抗原结合、机器人世界模型、训练量化以及优化与理论问题。完整评测运行一次候选方案约需 700 个 H100 小时;30 题的 MLS-Bench-Lite 将单次评测降至约 90 个 H100 小时。这个成本本身也反映了真实方法验证与廉价代码评分之间的差异。 这些任务并不要求模型总结论文或复现既有实验。每个任务都从真实代码库和具体研究问题出发,要求 Agent 修改一个明确的研究组件。例如,候选提交可能是一种新的训练目标、优化器、注意力变体、采样策略或路由机制。模型必须提交可运行实现,并通过统一评测得到结果。 MLS-Bench 关注方法在多个条件下是否持续有效,而不是固定实例上的单点提升。 完整任务包含五类关键要素: 一个具体研究问题和对应的真实代码库; 一个由领域专家校准的可修改范围; 至少三个用于检验迁移能力的测试条件; 至少三种强人类基线,其中包括领域公认的 SOTA; 在同一代码库、同一训练与评测流程中复现的基线结果。 团队还从中选择 30 个任务构成 MLS-Bench-Lite。这个子集覆盖全部 12 个方向,用于成本更低的持续评测。Kimi K3 和 Qwen3.8-Max 已在各自官方发布中采用这一版本。 图片分别来自 Kimi K3 Tech Blog 与 Qwen3.8-Max 官方 Blog。 受控修改范围如何隔离算法贡献 开放性与可归因性之间存在直接张力。允许模型修改整个仓库,更接近自由研究,但难以判断增益来源;只允许修改少量代码,又可能排除真正有价值的方法。 MLS-Bench 通过复现人类基线来校准这个边界。对每个任务,研究团队首先将至少三种代表性方法重新接入同一代码库,并确认其中的 SOTA 能够恢复参考性能。如果某种强方法无法在给定范围内表达,说明任务边界过窄;如果无需改动目标组件也能显著提高结果,说明边界仍然过宽。 经过校准后,模型只能修改与目标问题直接相关的部分。研究训练目标时,数据管线、评分器和共享训练协议保持固定;研究模型结构时,系统会检查参数规模,避免通过增加容量换取性能;涉及不同计算预算的任务,也会统一资源约束。 部分原始研究使用的训练规模过大,无法直接放入持续评测。MLS-Bench 对这类任务使用较小模型或较少数据,但要求所有人类基线在缩小后的规模上保持原有性能排序。也就是说,降低验证成本不能改变任务对方法优劣的基本判断。140 个任务都需要通过这项校准。 强人类方法与模型提交在相同代码基础和相同协议中比较。 多个测试条件承担另一个作用。模型可能在可见反馈上找到特例,但候选方法还需要在未用于局部优化的数据集、环境、模型规模或训练条件中继续有效。一个只提高单个实例、离开当前条件便失效的补丁,不会被计为一般性方法进步。 不同任务包含不同数量的条件和指标,论文采用三级统一评分。原始指标先以人类基线
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱