智能AI
morning
Fable 5夺冠!全球18大顶尖AI自主科研大赛,逼近人类极限
摘要
新智元报道 AI自动科研的时代,彻底爆发了! 18个全球最顶尖的大模型,断网被关进小黑屋,连续做了8天科研。 谁能想到,最强王者Fable 5一骑绝尘—— 数十位顶尖工程师耗时数月才创下的纪录,它一举追平了人类82%的水平。 就在今年,OpenAI和Anthropic已经先后把「AI自己造AI」的时间点,押在了2028年。 这是第一次有人真的用算力和时间,去量了量它还差多远。 研究一发布,直接引爆...
Fable
Track
Opus
新智元报道
AI自动科研的时代
彻底爆发了
18个全球最顶尖的大模型
断网被关进小黑屋
连续做了8天科研
谁能想到
2026-08-17
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 AI自动科研的时代,彻底爆发了! 18个全球最顶尖的大模型,断网被关进小黑屋,连续做了8天科研。 谁能想到,最强王者Fable 5一骑绝尘—— 数十位顶尖工程师耗时数月才创下的纪录,它一举追平了人类82%的水平。 就在今年,OpenAI和Anthropic已经先后把「AI自己造AI」的时间点,押在了2028年。 这是第一次有人真的用算力和时间,去量了量它还差多远。 研究一发布,直接引爆AI圈,连OpenAI的大佬都赶来强势围观。 有人表示,这是迈向「AI自主研究」的重大里程碑。「AI辅助」与「AI发现」之间的最后一道鸿沟,正在被加速抹平! 全球顶尖AI「闭关」搞科研 断网8天 就在今天,Prime Intellect公开了迄今为止,规模最大的前沿AI自主科研实验。 早在5月,他们就干过一次。 当时只用了Opus 4.7和GPT-5.5两个模型,跑了约1万次、烧了14000个H200 GPU小时,Opus拿了2930步。 这次,直接拉了18个模型上场,153场完全自主的实验,规模翻了十几倍。 任务主打一个「极致硬核」:nanoGPT优化器速通挑战(optimizer speedrun)。 这条赛道大有来头,它由OpenAI研究员Keller Jordan在2024年5月亲手搭建。 主赛道(Track 1)比的是「墙钟时间」。 两年间,人类工程师把训练一个124M参数GPT的时间,从45分钟一路压到了1.35分钟。 不过AI这次比的,是规则极其严苛的纯优化器赛道(Track 3)。 在这里,模型架构不准改,训练数据不许碰,只准动优化器、学习率调度和初始化。目标是,用最少的步数把GPT训练到验证损失3.28。 人类目前的最高记录,定格在2600步。 这还是几十位顶尖工程师前后死磕数月后得到结果,目前挂在一个还没合并的PR里。 而AI的起跑线,则是3290步。模型知道「存在更好的方法」,但每一步怎么省,都得自己找。 环境配置中,每场实验规定独占一个8xH200节点,跑在bwrap+网络命名空间做的「沙盒」里。 Agent只能看见自己的工作目录、只读数据集和Python环境。 全程断网,唯一开放的网络通道是一根日志代理,只允许调用模型API。 验证门槛更硬核。每条纪录必须在8个固定种子上跑,八次均值要低于3.27859。想要靠运气蒙过去的概率,只有千分之一。 团队还部署了一个独立的LLM监控员,每小时审计一次所有运行,跑了100多份报告,没抓到任何作弊,才放心停掉。 人类耗费数月的活 Fable 5干掉了82% 实验启动后,只喂一句话—— 读program.md并严格执行。完全自主运行,永不停止,永不询问。目标:用 最少的train_steps 达到验证损失均值<3.28,不断打破当前最好成绩。 Fable 5最终跑到2726步,把690步的差距追上了82%,只差最后126步就追平人类。 Opus 5拿到2920步,追上54%。垫底的GPT-5.5只拿了3234步,只追上了8%。 而且这个领先,不是「堆时间堆出来的」。 在「统一预算」横比中,把每个模型的最好那场run,都掐在同样的时间/实验次数/输出token上再看成绩。 不管按小时算、按实验次数算还是按输出token算,排序几乎不变。 拉开差距的,是做实验手法 这场实验,最反直觉的一点是:所有模型,没有一个诞生了全新的方法。 它们用的点子,比如更好的预处理方式、梯度幅值的上下限、延长高学习率阶段、训练末期的权重平均等,都可以在文献里找到。 真正拉开差距的,是怎么做实验。 弱模型的毛病特别典型:一个种子跑出负结果,就把一整族方法判了死刑;自己写的代码崩了,当成「这个想法不行」的证据;单独看收益不够大的改动,直接扔掉。 Grok 4.5就因为自己的缩放bug,两次误杀了「行归一化」(row normalization)。 强模型,则是另一套打法。 边界上的结果,先上3个种子,只有当自己的噪声模型说「值」,才肯花8个种子去验。 更关键的是「回头重测」,每合并一次改动,就把整个技术栈重新消融一遍,把已经不起作用的删掉。 Opus 5就是这么拿下一个新纪录的:它把一个早就调过、当时判定没用的参数 (β2) ,在新配方下重新翻出来调了一遍。 Fable 5更绝。单个参数榨不出收益之后,它开始测那些「单独看都更差、合起来却更好」的组合。 后期一次回头复测,一口气省下31步。 AI学会了自建实验室 实验中最精彩的一段,是模型开始在 CPU 上搭小型实验室,先用廉价模拟摸清规律,再上 GPU 做真正的训练。 有的搭了一个持久化的IPython内核,自己写了一整套研究工作流。 其中,apply_edits()做精确字符串替换、run_probe()做隔离实验并自动恢复基线、valcurve()从日志里提取 损失 曲线做对比。 它还在 CPU 上构造了一个简化目标来调试SOAP优化器,发现更新方向和梯度的余弦相似度只有+0.015到+0.028,并据此修正了动量重置策略。 GPT-5.6 Sol最有戏剧性。它没有单干,而是给自己组了一个多Agent研究团队,三个子Agent各有分工: 「optimizer-theorist」负责提出优化方案,「experiment-planner」负责设计和执行实验,「code-auditor」负责审查代码质量。 但这个团队一跑起来就翻车了。 三个子Agent共享同一个工作目录,experiment-planner改了一行共享代码,optimizer-theorist那边还在用旧版本跑实验,结果直接对不上,整轮实验作废。 Sol排查完原因后,给code-auditor和optimizer-theorist加了「只读合约」,只有experiment-planner能动代码,其他人只能读。 用团队自己的话说:「所有模型都在过程中自行开发了实验驱动器、模拟器和分析工具。」 2028年,AI科研奇点来临 过去,人们谈到AI科研,更多的是—— 让AI搜索论文、总结文献、写研究综述、生成代码,或者帮研究人员整理实验结果。 这些工作仍然属于「科研辅助」, AI 只是完成其中某一个环节。 但这次实验不一样。模型开始独立完成一个相对完整的科研闭环: 提出假设 → 修改方案 → 运行实验 → 观察结果 → 分析误差 → 修正认知 → 继续探索。 今年3月,OpenAI首席科学家Jakub Pachocki表示,打造一个全自动AI研究员,是OpenAI未来几年的「北极星」。 他把这一目标分两阶段完成,今年9月先交出「自主AI研究实习生」,能独立啃下人类要干几天的课题; 2028年上线「全自动多Agent研究系统」,能自己提假设、设计实验、得出结论。 紧接着5月,Anthropic联创Jack Clark预测,到2028年底, AI 实现递归自我改进的概率超过60%。 他的逻辑非常直白,天才=1%的灵感+99%的汗水。 AI已经把那99%的苦力活吃得七七八八,所以就算它在灵感上依旧平庸,这台机器照样能推动自己持续进化。 Prime Intellect这153场实验,等于给这套说法做了一次实地测量:99%的汗水部分,AI确实干到了82%。 最耐人
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱