首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

GPT-6 Astra 在人工分析编码代理指数中取得重大进展

2026-09-04 1 阅读 约7分钟阅读 wertyk
分享:
字号:
GPT-6 Astra 在人工分析编码代理指数方面取得了显着进步,以更低的成本获得与《神鬼寓言 5》相同的得分。在情报指数中,它使用比 GPT-5.6 Sol 更少的代币来实现类似的性能,但这被更高的价格所抵消。定价是 GPT-5.6 Sol 当前价格的 2.5 倍,从每百万输入/输出代币 4/20 美元上涨到 10/50 美元,缓存读取同样有 90% 的折扣,缓存写入有 25% 的溢价。我们在两个旗舰指数中看到了不同的故事。在人工分析编码代理指数中,GPT-6 Astra 与《神鬼寓言 5》相当,但成本不到一半,这得益于显着的代币效率提升。在人工智能分析指数中,GPT-6 Astra 比其前身具有更高的代币效率,具有类似的性能,但这被价格上涨所抵消。人工分析编码代理指数 - 关键要点: ➤ 竞争对手顶级模型:在 Codex 中,GPT-6 Astra 在指数中得分为 67 - 大约等于 Claude Code 中的 Claude Opus 5 和 Fable 5,以及 Muse Code 中的 Muse Spark 1.3。 Claude Code 中的 Fable 5.1 以 70 分领先该指数。 ➤ 代币效率比 GPT-5.6 Sol 高出 70%:GPT-6 Astra 的代币效率有了显着提高,与 Codex 工具中的 GPT-5.6 Sol(最大)相比,使用了三分之一的代币,是 Claude Opus 5(xhigh)的五分之一的代币。模型的各种努力水平占据了代币效率的帕累托前沿。 ➤ 领先编码代理指数成本效率前沿:在最大努力下,GPT-6 Astra 的成本与 GPT-5.6 Sol(最大)大致相同,但指数得分高出 2 分。对于相同的分数,该模型的每项任务成本还不到 Claude Fable 5 的一半。人工分析智能指数 - 关键要点: ➤ 在智能方面与 GPT-5.6 Sol 并列:GPT-6 Astra 在该指数中的得分与 GPT-5.6 Sol 相同,均为 61。这比 Claude Fable 5.1(带回退的最大值)低 5 分。该模型还落后于 Meta 新发布的 Muse Spark 1.3(最大)。 ➤ 输出代币减少约 10%,被价格上涨所抵消:GPT-6 Astra 为智能指数与每个任务的输出代币定义了新的帕累托前沿 - 与 GPT-5.6 Sol 相比,最大努力时代币使用量减少了约 10%。然而,由于价格上涨了 2.5 倍,该模型在最大努力下每项任务的成本比其前身高出 75%。 ➤ 幻觉数量是 GPT-5.6 Sol 的一半:GPT-6 Astra 在我们的知识和幻觉基准 AA-Omniscience 上看到了巨大的飞跃。这是由于在最大努力下幻觉率从 92% 显着下降到 51%。与某些模型不同,这种改进并不以牺牲准确性为代价——Astra 同时将准确性提高了 4 个点。 ➤ AA-Briefcase Elo 提高了约 80 分:GPT-6 Astra 在 AA-Briefcase(我们的前沿长期知识工作评估)中提高了约 80 分。模型在为期数周的项目上进行了测试,其中包含许多链接的任务和数千个源文件。与之前的版本相比,Astra 在 AA-Briefcase 中的评分和分析质量 Elo 都有显着提高。另一方面,我们观察到演示质量 Elo 有所下降,其中 GPT-5.6 Sol(最大值)仍然领先于所有模型。 ➤ 其他评估的进展参差不齐:该模型在 Humanity’s Last Exam 中取得了 6 分的进步,这是一项长期强调数学、科学和人文的评估。这被 GDPval-AA v2 中大约 80 个 Elo 点的下降所抵消,GDPval-AA v2 是我们根据 OpenAI 数据集改编的基准,用于衡量 44 个职业中具有经济价值的任务。我们还观察到跨多种功能的其他评估的 2-3 点回归,包括 τ³-Banking(客户支持)、SciCode(科学领域中的 Python 问题)和 AA-LCR(大型文档的长上下文推理)的减少。编码代理索引成本的改进是由代币效率驱动的,与 GPT-5.6 Sol(最大)相比,在最大努力下代币减少了约 3 倍。 GPT-6 Astra 在编码代理指数与每任务成本方面处于帕累托前沿,其最大工作量设置成本与 GPT-5.6 Sol(最大)大致相同,但指数得分高出 2 分。 GPT-6 Astra 为智力指数与每个任务的输出代币定义了一个新的帕累托前沿 - 与 GPT-5.6 Sol 相比,最大努力时的输出代币减少了约 10%。在最大努力下,GPT-6 Astra 比 GPT-5.6 Sol 贵 75%,并且在智能指数与每任务成本前沿方面很大程度上落后于其前身。这是由价格上涨 2.5 倍推动的,但部分被代币使用的减少所抵消。 GPT-6 Astra 的 AA-Omniscience 出现了大幅跃升,其驱动因素是最大努力下幻觉率从 92% 显着下降至 51%,同时准确性略有提高。该模型显示代理知识工作的进展参差不齐——在 AA-Briefcase 中提高了约 80 分,但在 GDPval-AA v2 中出现了类似的退步。在 AA-Briefcase 中,Astra 发现评分标准分数和分析质量 Elo 均显着提高,但演示质量 Elo 有所下降。布雷克多
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱