智能AI
morning
1300张卡叫板10万卡!前OpenAI副总裁出手,硬核难题击败GPT-6 Astra
摘要
新智元报道 只用1300张H200,在一项硬核科学基准上,赢了GPT-6 Astra。 近日,前OpenAI研究副总裁Liam Fedus在X上发帖,亮出Periodic Labs的第一个模型:Periodic Neon。 帖子最抓人的是这一句: 只用1300张H200,加上几个月的实验数据,Neon在他们自家的分析基准上超过了GPT-6 Astra。 Periodic门洛帕克高磁场材料实验室实拍...
Periodic
只用1300张H200
Astra
Fable
新智元报道
在一项硬核科学基准上
赢了GPT
前OpenAI研究副总裁Liam
Fedus在X上发帖
亮出Periodic
2026-09-18
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 只用1300张H200,在一项硬核科学基准上,赢了GPT-6 Astra。 近日,前OpenAI研究副总裁Liam Fedus在X上发帖,亮出Periodic Labs的第一个模型:Periodic Neon。 帖子最抓人的是这一句: 只用1300张H200,加上几个月的实验数据,Neon在他们自家的分析基准上超过了GPT-6 Astra。 Periodic门洛帕克高磁场材料实验室实拍,机械臂正在样品上方作业。 上图里,一排排样品托上放着刚合成出来的候选材料,它们会被送进X射线衍射仪拍下「指纹」,再变成Neon要读的图谱。 实验室24小时连轴转,合成、测量、喂数据。 Fedus说,他们第一批要啃的,是超导体、磁体和半导体材料里的硬骨头。 一个做大模型出身的人,为什么跑去啃材料? Fedus曾是ChatGPT的核心创造者之一,在OpenAI负责后训练,最清楚模型靠什么变强。 去年创立Periodic时,他就把话挑明了: 互联网上的文本总共约10T token,最好的前沿模型已经把它读完了。AI要再往前走,需要互联网上没有的新数据。 去哪找?实验室。 于是,他拉上前谷歌DeepMind化学与物理研究负责人Ekin Dogus Cubuk,从第一天起就自己建实验室、自己造数据,目标只有一个:造一个AI科学家。 一年后,第一份答卷来了。 Neon约1T参数,在一套高难度的X射线衍射(XRD)分析测试上,成功率跑到55.3%,把GPT-6 Astra和Claude Fable 5.1都甩在了身后。 论参数,据业内传闻,Astra总参数在数万亿量级,Neon只有1T; 论算力,按黄仁勋的公开说法,Astra背后是10万张以上的Grace Blackwell;Neon最终训练的峰值规模,只有1300张H200。 这样的反差,很快在圈内炸开。 Jeff Dean第一时间在Fedus的帖子下留言祝贺。 1300对10万,这组数字背后,藏着让AI继续变强的另一条路。 一张考卷 把2.7%拉到55.3% Neon解决的问题叫X射线衍射分析(简称XRD)。 X射线衍射是什么? 打个比方:一束X射线照进晶体,会在几个固定角度衍射出亮峰。材料不同,亮峰的位置也不同,就像指纹。 合成出来的东西是不是超导体、磁性材料或半导体材料,先要看这枚「指纹」对不对得上。 Periodic Lab里的X射线衍射仪。Neon学习的XRD数据,就由此类仪器产生。 麻烦在于实验室合成的样品往往极不纯净,多种物质重叠在一起,就像几百个人的指纹乱七八糟印在同一张纸上。 材料学家要认清里面有什么,通常得开软件、翻数据库、对比论文,折腾很久。 Periodic挑选了134道这种「连专家都头疼」的硬骨头,组成基准测试FrontierXRD。 Neon的55.3%,就是在这134道题上拿到的。 所有模型用的都是Periodic自己搭的科学工具环境,Periodic Harness。 与基于Claude Code、配标准XRD工具的方案相比,在单题成本差不多的情况下,Periodic Harness的成功率是后者的3.8倍。 AI做科研,一半靠脑子,一半靠手边的工具。 为了防止模型「背答案」,团队还另外准备了198道题,题目涉及的化学体系在训练数据里都被刻意剔除。Neon依然领先一众前沿模型。 不过官方也承认,这套题比FrontierXRD简单。 成本上,Neon也更划算。 最高档下,Neon成功率55.3%,每题成本约4美元多;GPT-6 Astra每题约7美元多,成绩反而低于Neon;Claude Fable 5.1成本和Astra相近,成功率只有约40%。 互联网就要被AI读完了 他们想造一口永不干涸的「数据水井」 抛开跑分,Periodic真正想让人看到的,是它在门洛帕克建起的高通量材料实验室。 Periodic Lab实拍:机械臂夹取样品送入设备。 从最初的第一批实验,到如今24小时连续运转,Periodic把材料发现拆成了一个循环: 先猜要做什么,依据是对材料稳定性和性质的预测; 再预测怎么把它合成出来; 最后搞清楚实际做出了什么,性质对不对。拿到结果,修正猜想,再来一轮。 Periodic的材料发现循环:做什么、怎么做、做了什么,三段首尾相接。 每循环一圈,实验室就吐出一批新鲜、私有、带着物理反馈的数据。这些数据,就是Neon的原料。 Periodic的中训练语料,混合了学术文献、代码和实验数据,规模目前每个月翻一倍。 他们还发现,先靠中训练把科学知识灌进去,后面的RL效果更好。 而且实验跑的时候,GPU不用干等。模型可以拿已有的实验数据继续分析、继续改进预测。 Periodic那篇研究博客的标题,叫「自然就是学习环境」(Nature Is Our Learning Environment)。 它瞄准的是AI圈绕不过去的一道坎: 过去几年,Scaling靠的是把互联网数据越堆越多。可互联网上的文本,已经快被前沿模型读完了。 接下来,谁手里有能不断产出新数据的环境,谁就多了一条继续Scaling的路。 互联网是一座挖一点少一点的数据矿,实验室是一口能源源不断出水的井。 自然不给标准答案 Periodic请了个AI裁判 把RL搬进物理世界,难度完全不在一个量级。 数字世界的RL,已经让智能体写出了几乎所有代码,还解开了悬而未决的数学猜想,秘诀是派出海量智能体,去做又快、又能自动判分的题。 到了物理世界,这三样全卡住了: 智能体不能说加就加,多跑一路实验,就要多一份电力、设备和工程;一次实验可能要好几天;结果还经常模棱两可。 最后一条最要命。Periodic在研究博客里说很精辟:科学可以被证伪,却不容易被验证。 一张XRD图谱,光看拟合对不对得上,没法低成本判定分析是否成功。还得有专家来判断,每个物相有没有图谱支持,化学上说不说得通。 Periodic的办法,是把专家的判断「蒸馏」成裁判。 他们请材料专家给数千个XRD图谱打标签,再用这些标签校准一个由Opus 5和GPT-5.6 Sol组成的LLM裁判组,三组数字很能说明问题: 专家和专家之间,一致率77.2%; LLM裁判和单个专家,一致率74.6%; LLM裁判和专家共识,一致率84%。 也就是说,这个AI裁判的靠谱程度,已经逼近人类专家彼此之间的水平。 能把「说不清」变成能训练的奖励,是Neon的一项硬核技术点。 1300对10万 这些卡到底怎么省出来的 1300张H200,是Neon最终训练时,中训练和强化学习两个阶段同时在跑的峰值卡数。 而Astra的10万张以上Blackwell,对应的是一个前沿通用模型的大规模训练。 所以,1300对10万,算不出一个效率倍数,但它至少说明,这1300张卡被Periodic用到了极致。 科学任务上的强化学习,有个怪毛病:模型做一道题,要边想、边查资料、边跑工具,一趟下来可能一个多小时;可拿这道题的结果去更新模型,只要几分钟。 Periodic的办法是,让做题和学习分开,各用各的GPU,互不等待。 这里有个真实的翻车故事。 他们最早的RL循环,训练、推理和模型写的代码全挤在一起,没有任何隔离。 直到有一次,模型写的代码申请了80GB内
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱