智能AI
morning
OpenAI连破10道数学难题,Fable 24小时「复现」5道
摘要
新智元报道 10项数学难题,24小时反转。 这个周末,OpenAI与Anthropic两大AI巨头,在数学的最前沿短兵相接。 先是8月1日,OpenAI研究员Sébastien Bubeck宣布,他们未公开的下一代主力模型Astra,一口气证明了10项前沿数学成果,还甩出了10份Lean证书、10份逐题思路复盘。 别小看这10个问题。 它们的主要结论至少10年没人推动过,不少一搁就是几十年,是货真...
新智元报道
10项数学难题
24小时反转
这个周末
OpenAI与Anthropic两大AI巨头
在数学的最前沿短兵相接
先是8月1日
OpenAI研究员Sébastien
Bubeck宣布
他们未公开的下一代主力模型Astra
2026-08-04
1 阅读
约8分钟阅读
新智元
字号:
新智元报道 10项数学难题,24小时反转。 这个周末,OpenAI与Anthropic两大AI巨头,在数学的最前沿短兵相接。 先是8月1日,OpenAI研究员Sébastien Bubeck宣布,他们未公开的下一代主力模型Astra,一口气证明了10项前沿数学成果,还甩出了10份Lean证书、10份逐题思路复盘。 别小看这10个问题。 它们的主要结论至少10年没人推动过,不少一搁就是几十年,是货真价实的开放难题。 虽算不上数学里最深的未解之谜,却个个都是难啃的硬骨头。 Epoch AI旗下FrontierMath的负责人Elliot Glazer直言:光是非索菲克群这一篇,就肯定能进数学界公认的顶级期刊Annals of Mathematics。 这10道难题一甩出,AI圈直接炸了,有人当场喊出「数学奇点已经到来」。 Anthropic这边迅速接招。 不到24小时,研究员Levent Alpöge在Bubeck的帖子下回了一句:「我用Fable完成了一半。」 紧接着他又补充,自己做出来的是OpenAI榜单上的第4、5、6、7、8项,一共5项。 实验条件, Levent称 很干净:完全自主、通用提示词、全程无网络,为了防止OpenAI的解法泄漏进上下文,还特意加了一层防护。 当然,Levent目前还没放出Fable的完整证明细节,他表示会上传。 但如果得到证实,这件事的分量就变了: OpenAI用未发布的模型Astra抢到的首发先机,只保住了24小时。而追上来的Fable,是Anthropic早就公开、人人都能调用的模型。 一项「数学首发」 保鲜期只剩24小时 网友Chubby转帖:「公开可用的Fable,复现了Astra一半成果。」 评论区有人调侃:这么看,OpenAI是不是只抢到了一个首发? 过去,一项数学成果的优先权之争,通常以年为单位。 谁先想到、谁先证出、谁先发表,中间隔着漫长的投稿、审稿、修改。 而现在,Astra还没正式发布,它公布的成果,仅仅24小时,就已经被一个公开模型追平了一半。 首发的含金量还在,但保质期却大大缩短。 不少网友已经在喊「数学奇点」,两个AI巨头也紧紧咬上了。 2000美元背后 还有更贵的账 OpenAI还甩出一个数字:找到这10项解法,成本不到2000美元。 按研究员Noam Brown的说法,它对应的是寻找这些解法所需的token,再按Sol API价格折算出来的。 也就是说,这只是成功跑出10个解法那一刻的边际推理成本。 在这之外,还有Astra本身的训练研发、那些试了却没成功的问题、人类把论证整理成249页论文的工时、把每个证明形式化成Lean的成本,以及最后外部数学家审查的成本。 Noam自己也承认,他们还尝试过其他重大问题,但都没成功,千禧年大奖难题一个都没拿下。 即便如此,2000美元仍然把AI解出一道前沿难题的边际成本,打到了地板。 有人甚至调侃,OpenAI是不是明天会再公布10项数学突破,或者等到下周一次发100项。 从「互相刷榜」到「互相验货」 Fable去重做Astra的同一批题,这件事要比普通刷榜有意思得多。 刷榜测的是已知答案:题目和标准答案都摆在那儿,比谁分高。 而两个模型在无网络、防泄漏的条件下,各自独立抵达同一个前沿结论,测的是完全不同的东西:这个结果到底可不可靠,能不能被独立复现。 这更像同行评审。 Levent目前只是在X上「作出了声明」,并没有放出那5项证明的PDF、提示词、完整运行日志、token成本或Lean证书。 网友Haider质疑:就算是真的,为什么要用Fable去复现Astra,而不是直接拿它去解新的开放问题? 事实上,Fable并不是只会蹭Astra热度,它也会解新题。 7月,Levent就用Fable给出过Jacobian猜想的三维反例,事后还有人专门写了一份7页的代数验证材料,确认那个显式映射确实推翻了三维及更高维的猜想。 绝大多数人看不懂的成果 谁来验收 这10项成果,到底有多重要,绝大多数人很难去判断。 Ethan Mollick一语道破:对地球上几乎每一个人来说,这不只是超出能力,而是超出理解范围。我们只能相信专业数学家告诉我们它厉不厉害。 代码、图片、聊天,普通人还能亲手体验AI强在哪。 可非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理,这些只有极少数专家看得懂。 AI能力越往科学前沿走,公众能依靠的就越不是亲身体验,而是一条长长的信任链。这种「连惊叹都无从惊叹」的状态,正在越来越多领域同时发生。 数学家Thomas Bloom提醒,这些成果用的是上百年积累的数学理论、数学家亲手搭好的形式化系统,把它简单描述成「AI取代了数学家」,并不诚实。 他给出的标准是:这份证明,有没有教给我们关于这个问题的新东西? 所以真正的问题来了:当AI能低成本、批量地生产前沿数学证明,我们到底该拿什么衡量它的成果? 答案也许不在它的产出端,而在验收端:一份证明能不能被读懂、被核对、被判断出分量,才能最终决定它的真实价值。 最稀缺的能力,正在从「做出证明」转向「看懂并验收证明」。 当AI一夜之间就能证出十道难题,真正的考验才刚开始:证明越造越快,我们的验证,还追得上吗? 参考资料: https://x.com/haider1/status/2083908869915611554 https://x.com/polynoamial/status/2083470822258467194 https://x.com/kimmonismus/status/2083950641978679363 https://x.com/Dr_Singularity/status/2083653287463571742 编辑:元宇 秒追ASI ⭐ 点赞、转发、在看一键三连 ⭐ 点亮星标,锁定新智元极速推送! 文章原文
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱