首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化

2026-09-06 1 阅读 约10分钟阅读 IT之家
分享:
字号:
IT之家 9 月 6 日消息,据 Fortune 报道,OpenAI 自当地时间 9 月 3 日下午首次发布 GPT-6 Astra 模型公告以来,已经多次修改其中的评测基准数据。一些更新后的数据显示,Astra 的表现有所提升,而 OpenAI 最大竞争对手 Anthropic 旗下模型的部分成绩则出现下调。 这些变化发生在一次颇为反常的公告发布过程中。 据IT之家了解,OpenAI 最初计划在美国东部时间 9 月 3 日下午 2 点发布博客文章,但又过了近两个小时,文章才终于能够在网上被大多数用户正常访问。 当地时间下午 3 点 32 分,OpenAI 官方 X 账号发布博客链接,但页面无法正常打开,访问者会看到错误提示。下午 3 点 50 分,OpenAI CEO 萨姆・奥尔特曼(Sam Altman)也发布了链接,并写道:“我们在部署博客文章时遇到了一点小问题,但它真的非常棒。” 不过,当时仍有多名用户表示无法打开页面。大约一小时后,页面才终于能够正常访问。 事实证明,OpenAI 实际上在下午 2 点过后不久就发布了这篇博客,但随后又将其撤下。OpenAI 表示无法披露撤稿的具体原因,但强调此事与基准测试成绩无关。 OpenAI 最初解释称,问题源于内容管理系统的故障,随后又表示是互联网中断所致。 然而,当博客重新上线后,其中的多项评测数据已经发生变化,而且部分数据此后仍在继续调整。一些更新后的指标似乎让 Astra 的表现更加突出。 这一事件发生之际,人工智能行业正处于激烈竞争之中。各家公司以极快的速度更新大语言模型,都希望在能力上领先竞争对手。围绕这些指标的争议,也再次凸显出一个长期存在的问题:如何利用标准化基准测试准确衡量大语言模型的能力,以及这些测试成绩是否容易被人为优化甚至“刷分”。 OpenAI 发言人表示:“我们非常重视评测结果的准确性。由于具体使用的模型检查点、测试框架和评测运行方式不同,大多数评测结果本身都会存在几个百分点范围内的波动。对于发布公告中的数据,我们进行了修正,以确保这些数字能够代表我们对模型可用性能的最佳估计,让用户能够进行有意义的比较。” 首版与最终版数据存在差异,而且部分数字仍在变化 最引人关注的变化之一,是 Astra 的幻觉率。 根据互联网档案中保存的一份页面快照,在美国东部时间 9 月 3 日下午 2 点 23 分发布的最初版本中,Astra 的幻觉率为 4.2%。之后的多份页面快照中,这一数字都没有变化,直到下午 3 点 11 分的第五份快照仍然如此。 大约 10 分钟后,OpenAI 才在 X 上发布了最终版本的博客链接。 但在下午 5 点 20 分保存的第六份网页快照中,也就是页面基本已经能够被公众正常访问之后,Astra 的幻觉率以及另外四项指标发生了变化。Astra 的幻觉率从 4.2% 直接降至 2%,几乎减半。 与此同时,Astra 的前代模型 GPT-5.6 Sol 的幻觉率也从 12.2% 降至 9.4%。 不过,OpenAI 此后仍在继续修改这一指标。截至本文撰写时,Astra 和 GPT-5.6 Sol 的幻觉率又分别回到了最初的 4.2% 和 12.2%。 OpenAI 似乎还大幅提高了 GPT-5.6 Sol 在其内部 ExploitBench 网络安全评测中的成绩,从最初版本的 5.5% 提高到后续版本中的 11.5%。 OpenAI 表示,公司目前正在研究是否将这一数字恢复至 5.5%,因为 11.5% 的成绩对应的是 GPT-5.6 Sol 当前并未向商业用户提供的推理能力等级。 OpenAI 在公告开头重点强调,Astra 在数学能力方面表现尤其出色。 从网页快照来看,Astra 在 FrontierMath Tier 4(v2)评测中的成绩始终保持在 97.6%,并没有发生变化。但 OpenAI 曾短暂修改 GPT-5.6 Sol 和 Anthropic 最新模型 Fable 5.1 的成绩。 这些调整一度让 Astra 看起来明显领先于另外两款模型。 在 9 月 3 日下午 2 点 23 分保存的首份网页快照中,Anthropic Fable 5.1 在该数学评测中的成绩为 87.8%。到下午 5 点 17 分,这一成绩下降近 10 个百分点至 78%。截至目前,该成绩又回升至 83%。 GPT-5.6 Sol 的成绩也经历了类似变化,从 83% 下降至 80.5%,随后又恢复至目前的 83%。 这些数据调整甚至早于 OpenAI 下午 2 点首次发布博客之前。 OpenAI 此前向媒体提供的一份受发布禁令限制的预发布草稿显示,Astra 在 ARC-AGI-3 评测中的成绩为 98.6%。而在目前公开的博客中,这一数字已经变成 99.99%。 OpenAI 当时回应称:“我们始终会在正式发布前验证评测结果,因此草稿与最终版本之间出现调整是正常的。” OpenAI 还指出,该基准测试的创建方 Arc Prize Foundation 在独立评估中发现,如果为 Astra 配备一套特别强大的测试工具框架,也就是让模型能够调用更多工具完成任务,Astra 的成绩可以达到 99.9%。 而在使用该基准测试的标准工具框架时,Astra 的成绩为 63%。尽管如此,这一成绩仍明显领先于目前所有公开发布的其他 AI 模型。 OpenAI 表示,测试工具框架、推理等级以及其他因素都会影响最终的评测结果。 是在提高准确性,还是在“刷榜”? OpenAI 内部由不同的研究团队负责不同的评测指标。这些团队负责计算和上报成绩,再由一个中央团队统一发布。 OpenAI 也公开承认,这些数字是在最佳条件下获得的,因此可能与普通用户通过正式版 ChatGPT 实际能够使用的模型表现存在一定差异。 博客中的免责声明写道:“评测分数是在任何计算资源投入下能够达到的最高成绩。” 此外,OpenAI 还在每项评测指标的脚注中加入了更多说明和限制条件。 问题在于,评测结果的“准确性”并不总是唯一的。由于测试条件不同,多个不同的成绩都可能是合理的。 但一些 AI 专家认为,其中可能还存在所谓的“Benchmaxxing”现象,也就是通过反复调整测试条件、重新运行评测,以尽可能提高基准测试成绩。 斯坦福智能系统实验室和斯坦福可信 AI 实验室的研究人员 Anka Reuel 和 Mike Hardy 表示,这类操作可以在很短的时间内完成,而且“对公司的营销更有利”。 两人还指出,GPT-6 Astra 的系统卡本应提供更多有关评测方法的技术信息,但其中部分内容并没有得到充分说明。 例如,对于 OpenAI 的内部幻觉率评测,系统卡“几乎没有提供任何有关评测方法的细节”,甚至“连测试项目的数量都没有列出”。 他们认为,反复重新运行测试,可能也是 Astra 在后续版本中编码能力成绩略有提高的原因之一。 Astra 的代码能力评分从 57.7% 提高至 57.9%。虽然只有 0.2 个百分点的变化,但 OpenAI 仍然选择将原来的数字替换成新的、更高成绩。 当然,并非 OpenAI 的所有调整都让 Astra 看起来更有优势。 例如,在面向医
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱