首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

SpaceXAI 的 Grok 4.6 在人工智能分析指数上得分 61

摘要

SpaceXAI's Grok 4.6 scores 61 on the Artificial Analysis Intelligence Index, joining the frontier in line with GPT-5.6 Sol, with standout agentic performance at lower cost Grok 4.6 gains 5 points over...

Grok the with and Claude tokens per Opus scores Intelligence
2026-08-13 1 阅读 约6分钟阅读 wertyk
分享:
字号:
SpaceXAI 的 Grok 4.6 在人工智能分析智能指数上得分为 61 分,与 GPT-5.6 Sol 保持一致,以较低的成本实现了出色的代理性能。在发布仅一个多月后,Grok 4.6 的智能指数就比 Grok 4.5 提高了 5 分,比 Grok 4.3 提高了 23 分。这使得 SpaceXAI 与 OpenAI 一起重返智能前沿,仅次于 Anthropic。要点: ➤ Grok 4.6 跻身人工智能分析指数前沿:得分为 61,与 GPT-5.6 Sol(最大值)一致,落后于 Claude Opus 5(最大值,63)和 Claude Fable 5(带后备的最大值,62),略高于 Kimi K3 ➤ 强大的代理性能:Grok 4.6 的 GDPval-AA v2 Elo 达到了1753,仅落后于 Claude Opus 5,并且与 Claude Fable 5 和 Qwen3.8 Max 具有重叠的置信区间。它在 𝜏³-Banking 上得分为 50.7%,与 Qwen3.8 Max (51.3%) 并列前两名,在 Terminal-Bench v2.1 上得分为 88.4%,与领先模型一致 ➤ 以更低的成本实现前沿级智能:总体定价与 Grok 4.5 持平,为每 100 万个输入/输出代币 2/6 美元,比 Claude Opus 5 低 60% 以上(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)。每个任务的成本为 0.84 美元,与智能稍高的 Kimi K3 相同,将其置于智能与每个任务成本的帕累托前沿 ➤ Grok 4.6 在 AA-Briefcase 上位于 Fable 5 层,AA-Briefcase 是我们长期代理知识工作任务的私人基准,Elo 为 1577 - 落后于 Claude Opus 5 系列。它的轮次效率非常高,平均需要约 53 个轮次和约 0.5B 个输入令牌来完成任务,而 Claude Opus 5(最大)则需要约 103 个轮次和约 2.0B 个输入令牌。缓存命中折扣为每 1M 令牌 0.5 美元,比 Grok 4.5 的缓存命中每 1M 令牌 0.3 美元有所增加 代理性能 Grok 4.6 的最强结果是在代理工作而不是静态推理上。在我们对现实世界代理知识工作的主要衡量标准 GDPval-AA v2 上,它的 Elo 得分为 1753 - 仅落后于 Claude Opus 5,并且在给定重叠置信区间的情况下,在统计上与 Claude Fable 5 和 Qwen3.8 Max 没有区别。该模式适用于各种任务类型。 𝜏³-Banking (50.7%) 通过工具使用测试了多轮客户服务,并将 Grok 4.6 排在前两名,而 Terminal-Bench v2.1 (88.4%) 则在基于终端的软件任务上与领先者持平。很少有模型能够同时在知识工作、客户服务和终端使用方面具有竞争力;结合其定价,Grok 4.6 在智能指数中的每项代理评估中都处于成本与性能帕累托前沿。在前沿领域,成本控股的总体定价在一代人内持平是不寻常的,因为情报的增长通常伴随着价格的上涨。 Grok 4.6 以 2 美元/6 美元不变的定价提供了 5 点智力指数增益,我们测量的每项任务成本为 0.84 美元,反映了该定价和合理的代币效率。对于买家来说,重要的比较是与得分相差两分以内的型号进行比较:Claude Opus 5 为 5 美元/25 美元,GPT-5.6 Sol 为 5 美元/30 美元。 Grok 4.6 实际上以输出代币价格的一小部分提供了与 GPT-5.6 Sol 相同的智能指数分数,这是在推理繁重的工作负载中主导成本的维度。长期知识工作 Grok 4.6 在 AA-Briefcase 上首次亮相,AA-Briefcase 是我们长期代理知识工作任务的私人基准,Elo 为 1577。这使其处于 Fable 5 级别,落后于 Claude Opus 5 系列,在评分标准、演示质量和分析质量方面始终表现强劲,而不是在一个维度上的优势抵消了在另一个维度上的劣势。效率概况与分数一样引人注目。 Grok 4.6 平均需要约 53 个回合和约 0.5B 个输入令牌来解决任务,而 Claude Opus 5(最大)则需要约 103 个回合和约 2.0B 个输入令牌。长期代理工作会快速积累上下文,因此在一半的回合和四分之一的输入令牌中达到可比答案的模型具有远远超出其每个令牌定价的成本优势。完整结果 人工分析智能指数中各个评估的完整细分:有关 Grok 4.6 的更多详细信息和基准,请参阅人工分析:https://artificialanalysis.ai/models/grok-4-6
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱