开发者生态
morning
人工智能分析智能指数 v4.2
2026-09-05
1 阅读
约7分钟阅读
nojs
字号:
宣布人工智能分析智能指数 v4.2 我们正在加速即将发布的 v5 版本的各个部分,并进行临时更新,以跟上前沿的步伐。 Index v4.2 有更复杂和现实的任务,以及更多的私人测试集来防止游戏情报指数 v4.2 变更日志: + AA-Briefcase,我们使用私人测试集进行代理知识工作评估 + Surge 的 GDP.pdf,跨 4,592 个 PDF 页面的长上下文文档推理 - GPQA Diamond,一种特殊的科学推理评估,现已饱和......加上对保留的测试集更大的权重,以防止游戏,并对基础设施升级进行分级以增加鲁棒性此更新使索引更接近现实世界的用例,具有更具挑战性、更复杂和更现实的任务以及防止博弈的私人测试集。我们几个月来一直在规划和构建 Index v5 的元素 - 自 1 月份推出 Index v4 以来已经过去了 8 个月。我们故意推迟更新,以通过最近的主要型号发布保持指数稳定。然而,由于过去几周前沿发展如此之快,我们认为立即提供临时更新非常重要,以确保我们的指数对用户仍然具有相关性和有用性。除了这次临时更新之外,我们的团队还在努力开发索引 v5。我们计划在不久的将来发布更多增量版本。敬请关注! Intelligence Index v4.2 详细变化: ➤ 添加 AA-Briefcase:我们使用私人保留的测试集进行内部评估,AA-Briefcase 测试由行业专家构建的复杂项目中的实际代理知识工作任务的模型。模型在为期数周的知识工作项目中进行评估,每个项目都有许多链接的任务和数千个输入源文件。 AA-Briefcase 结合了评分标准和成对评分来评估可验证的任务成功、分析质量和演示质量,从而全面了解知识工作中的整体代理能力。 ➤ 添加 GDP.pdf:GDP.pdf 由 Surge AI 创建,可评估 100 个 PDF 和 10 个领域的单轮专业文档推理。模型必须综合分布在 4,592 页的证据,包括文本、表格、图表、脚注和排除项。根据 1,275 条专家编写的原子标准对回答进行评分;仅当满足所有标准时,标题“全通过率”才算完成一项任务。 ➤ 用于衡量现实世界使用情况并防止游戏的权重:我们的指数权重的 40% 现在是私有的、保留的测试集 - 是 v4.1 的数字的两倍。保留的数据包括 AA-Briefcase、AA-Omniscience 和 CritPt 的解决方案。这降低了实验室进行游戏评估的能力。 Index v5 中的保留百分比将进一步增加。 ➤ 改进我们的评分基础设施:在 AA-LCR v1.1 中,我们添加了评分系统提示并纠正了答案中的错误和歧义,提高了评分准确性。对于 GDPval-AA v2 和 AA-Briefcase,我们改进了采样并重新锚定了 Elo 量表,随着新模型的添加,评级更加稳定。对于 SciCode,我们提高了分级沙箱的稳健性,以确保缓慢但正确的代码不会被视为失败。主要结果: ➤ Anthropic 和 OpenAI 领先指数:Anthropic 的 Claude Fable 5.1 领先指数,其次是 OpenAI 的 GPT-6 Astra,它比 GPT-5.6 Sol 增长了 4pt。 Meta 是排行榜上排名第三的实验室,其次是 SpaceXAI、Moonshot/Kimi、Z.AI 和 Google。 ➤ 每个任务成本帕累托前沿由四个实验室共享:Anthropic、OpenAI、Meta 和 Z.AI 占据更新的每个任务成本前沿。 ➤ GPT-6 Astra 在输出代币前沿占据主导地位:GPT-6 Astra 的代币效率比几乎所有其他接近智能前沿的模型都要高,其中 Claude Fable 5.1、Grok 4.5 和 Gemini 3.5 Flash-Lite 位于曲线的两端(不包括指数低于 25 的模型) GPT-6 Astra 比几乎所有其他接近智能前沿的模型都具有更高的代币效率,其中 Claude Fable 5.1、 Grok 4.5 和 Gemini 3.5 Flash-Lite 位于曲线两端(不包括指数低于 25 的型号)Anthropic 的 Claude Fable 5.1 和 Opus 5 领先 AA-Briefcase,其次是 GPT-6 Astra 和 Muse Spark 1.3。 GPT-6 Astra 显示出比 GPT-5.6 Sol 大幅提升约 85 Elo 点 AA-Briefcase 是我们使用私人保留测试集进行的前沿内部评估。该评估测试了由行业专家构建的复杂项目中现实代理知识工作任务的模型。模型在为期数周的知识工作项目中进行评估,每个项目都有许多链接的任务和数千个输入源文件。 AA-Briefcase 结合了评分标准和成对评分来评估可验证的任务成功、分析质量和演示质量,从而全面了解知识工作中的整体代理能力。 OpenAI 以 GPT-6 Astra(33.2%)和 GPT-5.6 Sol(28.2%)领先 GDP.pdf,其次是 Claude Fable 5.1(26.2%) 由 Surge AI 创建,GDP.pdf 评估了 100 个 PDF 和 10 个域的单轮专业文档推理。型号必须
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱