首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

代码榜刷满分,AI科研却撞墙?140道真实研究题撕开「自进化」真相

2026-08-12 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 AI已经能写代码、跑实验,甚至靠海量试错刷新部分人类纪录。 但当目标从「把一个分数继续刷高」,变成「提出一种真正更好的机器学习方法」,最强模型还能走多远? 一项覆盖12个领域、140个真实研究任务的新工作 MLS-Bench 给出了并不乐观的答案。 即使拿到人类最强方法的完整实现,并被允许反复实验,当前前沿模型仍没有展示出可靠的方法创新能力。它们交出的所谓新方案,基本仍是对已知方法的调优与重新组合。 更值得注意的是, MLS-Bench 的评测已经进入Kimi K3和Qwen3.8-Max的官方发版表。 代码评测逐渐饱和后,头部模型厂商正在把下一个能力前沿指向同一个问题: AI 能否真正开展研究? 论文链接:https://arxiv.org/abs/2605.08678 项目主页:https://mls-bench.com/ 代码链接:https://github.com/Imbernoulli/MLS-Bench 在Kimi K3与Qwen3.8-Max的官方评测表中,MLS-Bench-Lite与软件工程、终端操作和通用智能体评测并列出现。 图片分别来自 Kimi K3 Tech Blog 与 Qwen3.8-Max官方Blog 。 这不是又一套代码题。MLS-Bench-Lite从完整评测中选出30个任务,覆盖全部12个机器学习领域,专门考查模型能否围绕真实研究问题提出并实现更好的方法。 2026年6月,Kimi K2.7-Code首次将它纳入官方发布评测;一个月后,Kimi K3再次采用;随后Qwen3.8-Max也把它写进官方发版结果。对于一个刚刚提出的研究评测,这种采用速度说明,行业关心的不再只是Agent能不能完成更多编码任务,而是它能不能推动AI本身继续前进。 拿到强方法之后 模型仍在重组答案 论文主实验评测了五个前沿模型。模型既可以直接提交首次方案,也可以进入真实代码库,多轮修改代码、运行实验,再提交最终实现。 研究团队还把强人类基线的代码直接交给模型,其中包括每个问题上公认的SOTA方法。换句话说,模型不是在信息不足的情况下从零猜答案,而是已经站在当前最好方法之上,任务只剩下继续向前一步。 论文主实验的结论很明确:在当时评测的五个模型中,所有模型提出的方法在整体表现上都无法超过Human SOTA。即使模型已经拿到Human SOTA的实现,并被允许进行多轮实验,这一步也没有发生。 随着更强模型进入榜单,汇总分数还会继续上涨,但领先成绩本身仍然不高,评测远未饱和。与此同时,一次总分超过某条基线,并不自动意味着模型发现了新的机制。更关键的问题是,增益究竟来自方法创新,还是来自更充分的调优、搜索与已有组件重组。 网页柱状图按领域展示首次方案、多轮Agent与Human SOTA ;论文主实验中,模型方法的整体表现均未超过Human SOTA。 论文进一步检查了模型到底在做什么。结果发现,当提示词从「发现一种新方法」改为「优化现有方案」时,模型反而做得更好。专家逐项分析提交后也看到,模型经常把已经出现过的模块重新排列组合,再把组合包装成新方法;真正新的机制极少,即使偶尔出现,也往往缺少能够解释其有效性的有洞见假设。 专家案例分析显示,模型提交往往紧贴已经看到的基线组件。 这里出现了一个颇具反差的现象。模型能够读懂代码库,识别多个基线的组成部分,也能把不同组件拼接成一个可以运行的系统。 从工程执行角度看,这已经是一种很强的能力;但从科学发现角度看,它仍然没有回答最关键的问题:为什么需要一个新的机制,它要修正现有方法中的哪项根本缺陷,又凭什么在新的数据和规模上继续有效? 当模型缺少这样的判断时,多轮实验很容易退化成局部爬山。它根据刚看到的结果微调权重、组合模块、修改训练细节,偶尔可以获得增益,却很难形成一个有解释力、可迁移的研究主张。 这不是简单的「分数还不够高」。当前模型离真正的方法发现仍然很远:它们会调参、会改工程、会拼装已知组件,却还不会像优秀的人类研究者那样提出真正有用的算法创新。 外推到科学发现 过去一年,Auto-Research与递归自我改进迅速升温。AlphaEvolve在circle packing等问题上找到更优构造,nanoGPT speedrun也让Agent围绕固定目标不断试错。 与此同时,「自进化」正在变成一个不断扩张的标签。让Agent编写更多项目代码、自动生成技能、更新记忆、清理数据、合成训练样本,甚至优化训练基础设施,都可能被放进AI改进AI的叙事中。 Anthropic在《When AI builds itself》中梳理了一条非常直观的演化路线:模型先是提供代码片段的聊天机器人,随后成为能自己运行代码的编程Agent,再发展到能够分派长程任务的多Agent系统。其内部数据显示,Claude编写的代码已经占到合并代码的80%以上,工程师人均合并代码量也出现显著增长。Anthropic同时把真正「闭环」仍放在未来:由Agent自己构建和训练下一代模型。 图片来自Anthropic的 When AI builds itself 。 国内也出现了相似叙事。MiniMax M2.7的官方发布把模型创建强化学习技能、更新记忆并优化自身学习流程称为「开启模型的自我进化」。这些进展确实在提高AI研发的自动化程度,但它们主要回答的是模型能否更深地参与已有流程。 更关键的问题还没有因此消失:AI能不能发现人类尚未发现的方法? 这些工作证明了大模型可以成为强大的搜索器,但它们通常拥有一个共同条件:验证便宜、反馈快速、结果能被单一分数清楚判断。系统可以一次生成大量候选,再从中选择最优答案。 真正改变机器学习的方法不是这样诞生的。Attention、残差连接、归一化和Adam的价值,不在于它们只在某一次实验里多赢了几个点,而在于它们换到不同数据、模型和规模后依然成立。支撑科学进步的,是这种能够迁移、能够扩展的方法发现。 这也呼应了Richard Sutton在《苦涩的教训》中提出的标准。长期真正有效的,往往是通用、并能随计算资源继续发挥作用的方法;我们需要的是能够完成发现过程的AI,而不是只装载人类既有发现的系统。 从GAN、Seq2seq、VAE、BatchNorm,到ResNet、Transformer、扩散模型、LoRA、RMSNorm与PPO,机器学习社区的繁荣来自一批经得起时间、领域与规模检验的方法。让AI更快实现这些方法当然重要,但递归自我改进真正有野心的目标,是让AI独立发现下一批这样的方法。 此前没有一套评测真正测量这种能力。很多工程类任务把方法设计、超参数、数据处理和实现技巧混在一起;一些开放式研究任务又只看最终分数,无法判断提升究竟来自算法创新,还是扩大模型、修改评测器等捷径。 现有基准的覆盖方式也存在断层。一类任务本质上是数据挖掘竞赛:给定训练集和测试集,让模型清洗数据、组合现有算法,最后提交预测结果。另一类任务要求Agent生成研究方案或论文,再由语言模型从新颖性、完整性和可行性等维度打分,却不直接运行并比较它提出的方法。前者更接近工程,后者更接近文本评价,都没有正面回答方法到底有没有变好。 MLS-Bench要锁定的,正是这条
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱