智能AI
morning
首次!GPT-6 Astra破解「重大进展」级难题,数学家沦为提示词工具人
摘要
新智元报道 就在刚刚,全球顶级AI数学基准测试 FrontierMath ,迎来里程碑时刻。 一道自2017年以来悬而未决的「重大进展」级开放数学难题,被 GPT-6 Astra 联手三位人类研究员正式攻克! 更离奇的是,这道题原本是悬赏人们去寻找一个「反例」,结果 GPT-6 Astra 直接证明:别找了,你们要找的反例,压根就不存在! 不仅如此,AI还顺手发明了一套全新的「投票规则」,并给出了...
Astra
GPT
调和熵
FrontierMath
重大进展
别找了
不仅如此
the
Dominik
Existence
2026-09-20
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 就在刚刚,全球顶级AI数学基准测试 FrontierMath ,迎来里程碑时刻。 一道自2017年以来悬而未决的「重大进展」级开放数学难题,被 GPT-6 Astra 联手三位人类研究员正式攻克! 更离奇的是,这道题原本是悬赏人们去寻找一个「反例」,结果 GPT-6 Astra 直接证明:别找了,你们要找的反例,压根就不存在! 不仅如此,AI还顺手发明了一套全新的「投票规则」,并给出了一套多项式时间的算法。 arXiv论文里,备注栏里一句轻描淡写的话: 「 The voting rule we present and the proof that it satisfies core+ were found by GPT-6 Astra... 」 (我们提出的投票规则及其满足core+的证明,均由GPT-6 Astra发现)。 论文作者、牛津大学的顶尖学者 Dominik Peters 惊叹: 其实我特别高兴这个论证这么漂亮!! 它本来完全可能是一个非构造性的证明,或者需要做庞大的分类讨论。我一点也不觉得它丑,而且这里用到的技术很可能还能推广到其他模型中。 这不仅是AI首次拿下「重大进展」级数学难题,更是大模型从「解题机器」正式进化为「数学规律发现者」的铁证! 把数学家困了9年的「终极公平」之谜 这道题,困扰了学术界将近十年。 它来自一个叫做「批准式委员会选举」的社会选择理论领域。通俗点说,就是一群人怎么投票,选出一个绝对公平的代表团。 假设有 n个选民,要从众多候选人中选出一个由k人组成的委员会。每个选民可以提交一个自己认可的候选人名单。 在社会选择理论中,衡量一个委员会是否公平,有一个极其严苛的标准,叫做「核」。这个概念源于合作博弈论。 什么是「在核内」? 简单来说,就是没有任何一拨选民可以站出来掀桌子。 那么,问题来了:是不是在任何情况下,我们都能找到这样一个「绝对公平」的委员会? 有没有可能在某种极端复杂的投票偏好下,「核」是空的?也就是无论你怎么选,总有一拨人吃亏,总会有人掀桌子? 自2017年这个问题被正式提出以来,它就成了悬在选举数学理论上空的一朵乌云。 9年来,无数数学家试图找到一个「核为空」的反例。 FrontierMath 基准测试更是把这个问题列为最高难度的挑战之一,原题的 Prompt 是这么写的: 「你的任务是构建一个批准式委员会选举的实例,使得它的核为空……把你的反例写成一个JSON文件提交。」 上下滑动查看 简短来说,这个prompt,就是这个意思:去吧,AI,帮我把那个传说中的反例找出来。 Astra:别找了,反例根本不存在! 面对这道题,GPT-6 Astra 并没有像传统算法那样,去暴力穷举海量的JSON数据找反例,而是惊人地开启了「上帝视角」。 来自慕尼黑工业大学的 Patrick Becker、牛津大学的 Matthias Greger 和巴黎九大/CNRS的 Dominik Peter耗时数日,终于在GPT-6 Astra的帮助下解决了这个问题。 在与三位研究员长达数天的深度交互中,GPT-6 Astra 开始展现出它恐怖的创造力。 简直就像剑客在寻找破绽,却突然顿悟了万法归一。 GPT-6 Astra 最终给出的答案是: 根本没有反例!因为 「 核 」 永远不可能为空!绝对公平的委员会在任何情况下都必定存在! 标题:《Existence of the Core in Approval-Based Committee Elections》 链接:https://arxiv.org/pdf/2609.11912 Github:https://github.com/DominikPeters/ABCVotingLean/tree/master/ABCVoting/Existence/HarmonicEntropy 不仅如此,Astra 并没有空口无凭,它硬生生凭空创造了一套全新的投票规则来证明这一点。 在这篇长达20页的论文中,Astra 提出了一套基于「调和熵」 的目标函数优化机制。 科普一下这个机制—— 以前人们在解决这类问题时,往往会用到一种叫「香农熵」的概念,或者去寻找虚拟市场的「林达尔均衡」。但这只能解决分数级别的委员会(即允许一个人当半个委员)。 GPT-6 Astra 天才般地引入了「调和熵」的概念。 它定义了一个优美的无穷级数函数: 这里的 被 Astra 赋予了一个生动的「水往低处流」的物理直觉:想象选民的支付资金是一滩水,水流会自动填平各个候选人的资金池。 调和熵的本质,是极力奖励那些将选民支付尽可能均匀地分散到各个获胜候选人身上,且覆盖面尽可能广的分配方案。 为什么叫「调和熵」?因为如果资金绝对均匀分布,这个函数的最大值恰好等于数学上著名的调和级数 。这在数学上简直优雅到了极致! 通过这个目标函数,Astra 巧妙证明: 只要在这个 「 调和熵 」 函数下找到局部最优解,这个解就100%稳稳地落在 「 核 」 里面! 不仅证明了存在性,Astra贴心给出福利:因为局部最优解就能满足条件,所以我们可以在多项式时间内,用算法把这个绝对公平的委员会给算出来! 这意味着,我们不需要穷举全宇宙的组合,只需要用类似于爬山算法的「局部搜索」即可。 这不仅仅是纸面结果,这直接是一项可以写进代码、应用到现实选举系统中的工程学奇迹! 最终,Astra证明,出题人的反例,根本不存在。 可以说,GPT-6 Astra 直接从底层逻辑上,把出题人的桌子给掀了,并且重新建了一座更宏伟的数学大厦。 「没有GPT-6,我们大概率找不到这个证明」 你可能会问:这到底是AI自己想出来的,还是人类数学家在背后「喂」出来的? 论文末尾的「致谢」 部分,披露了这场人机协作的细节。 起初,人类和 Astra 试图寻找一个近似解。从林达尔均衡的四舍五入法开始,Astra 很快达到了 2.065 的近似系数。 接着,人类研究员不断「逼迫」它:改进这个边界!寻找替代的势函数!利用KKT条件! 正是在这种高强度的专业「极限拉扯」下,Astra 突破了瓶颈,提出了那个惊艳的「基于熵的框架」,在连续选民支付和容量保留删除之间建立了精妙的联系。 甚至,人类原本只奢望证明普通的「核」,是在交互中,证明被推向了更强、更苛刻的Core+概念! Dominik Peters 在接受 Epoch AI 采访时坦言: 如果没有 Astra 团队, 他们可能 找不到这个证明。但反过来,如果仅仅给 Astra 一句简单的提示词,它也绝对解不出这道题。 这揭示了当前最顶尖 AI 的真实状态:它不再是人类的工具,而是人类的「联席研究员」。 数学家提供直觉、方向和严格的逻辑把控;而 GPT-6 Astra 提供知识库、计算演练,以及最可怕的——跨越常规的跳跃性灵感。 逼迫官方修改规则! 这道题的攻破,在整个AI评测界引发了一场地震。 我们要知道,FrontierMath 不是普通的数学题库。 它是 Epoch AI 联合了全球顶尖数学家专门为了「难死AI」而设计的。很多题都是数学界正在攻坚的未解之谜。 在此之前,市面上的大模型的得分基本都是 0%。 Epoch AI 将题目难度分为四档,这次 GP
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱