首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

ARC-AGI-3 上的 OpenAI GPT-6 Astra

摘要

OpenAI's GPT-6 Astra on ARC-AGI-3 Summary GPT-6 Astra scores 62.7% for $26K on ARC-AGI-3 Semi-Private with our Standard harness Standard harness enables a model to carry forward notes it chooses to ke...

AGI ARC the and environments with human GPT Astra for
2026-09-04 1 阅读 约6分钟阅读 vignesh_warar
分享:
字号:
OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上的总结 GPT-6 Astra 在 ARC-AGI-3 半私有上以 26K 美元的价格获得了 62.7% 的成绩,使用我们的标准线束 标准线束使模型能够在整个环境中传递它选择保留的注释。 ,99.9% 的成本为 19,000 美元,使用 Provider Adapter 工具。 Provider Adapter 工具保留请求之间不透明的推理状态,并使用压缩来实现更长的对话,从而允许模型重用之前的工作。 。 GPT-6 Astra 在 ARC-AGI-3 上的行动效率超过了人类基线。在 96% 的水平上,它使用的动作比接受测试的人类中位数要少。 GPT-6 Astra 中观察到的一个关键行为是它能够将不熟悉的环境转变为紧凑的符号世界模型。它将游戏机制表示为逻辑规则,并开发了自己的特定领域语言速记来跟踪状态和计划动作。 ARC-AGI-3 ARC-AGI-3 是通过新颖、抽象、回合制环境研究代理智能的基准。智能体必须探索、推断目标并构建环境的内部模型,以便在没有明确指令的情况下有效地规划行动。你可以自己玩ARC-AGI-3。您的浏览器不支持嵌入视频。这些环境仅包含核心知识先验,并通过人类参与者的受控测试来校准难度。人类可以解决100%的环境问题。 ARC-AGI系列的目标是衡量当前人工智能与AGI之间的“剩余差距”。我们将 AGI 定义为系统能够像人类一样高效地获取人类能够获得的任何技能。 ARC-AGI-3是ARC-AGI基准测试系列的第三代。它测试 ARC-AGI-1 和 ARC-AGI-2 之外的代理能力。每一代都在前一代的基础上进行扩展——随着前沿人工智能能力的进步,我们的基准也必须随之进步。 ARC-AGI-3 测试代理智能的四个组成部分: 探索:在现实环境中,信息很少是被动提供的。特工必须通过与周围环境的互动来主动获得它。建模:智能体必须将原始观察结果转化为可以预测未来状态和结果的通用模型。目标设定:智能体必须确定目标未来状态,而奖励很少。规划和执行:代理必须绘制从当前状态到目标的路径,并在新信息出现时纠正路线。 Astra 结果 GPT-6 Astra 通过标准和提供商适配器线束在 ARC-AGI-3 上取得了最先进的分数。较高的推理水平通常成本较低,因为 Astra 以较少的动作解决游戏,从而减少了模型调用和令牌的总数。查看完整结果。使用我们的标准线束 标准线束使模型能够在整个环境中携带它选择保留的笔记。 ,OpenAI 的 Astra(最大)在 ARC-AGI-3 Semi-Private 上得分为 62.7%,售价为 26K 美元。使用提供者适配器工具 提供者适配器工具保留请求之间的不透明推理状态,并使用压缩来进行较长的对话,从而允许模型重用之前的工作。 ,Astra(高)得分 99.9%,售价 19,000 美元。两者都是最先进的分数。查看完整排行榜。在最大推理努力下,Astra 可以更有效地解决游戏,需要更少的操作,因此相对于其他推理努力水平降低了总成本。推理工作 标准线束 标准线束使模型能够在整个环境中传递它选择保留的注释。提供者适配器工具 提供者适配器工具保留请求之间的不透明推理状态,并使用压缩来进行较长的对话,从而允许模型重用之前的工作。最大 62.7%, $26,098 98.6%, $17,332 高 59.3%, $37,317 98.4%, $18,147 高 54.8%, $40,705 99.9%, $18,817 中等 38.6%, $48,090 98.4%, $19,285低 17.5%, $38,166 98.0%, $21,298 无 35.2%, $49,791 96.7%, $23,457 为了进行成本比较,在我们的对照测试期间,人类参与者每 90 分钟的会话支付 115 美元,每完成一场游戏另加 5 美元。参与者每次尝试大约 9 场游戏,每次尝试游戏大约 12.78 美元(不包括奖金)。大部分费用用于支付参与者的时间和参加测试的意愿,而不是他们的大脑使用的能量(与人工智能相比更接近的代理)。如果我们只考虑大脑的能量,并将其定价为电力,则估算值会下降至每次训练 0.6 美分左右,或每场比赛 0.067 美分。 1 分析 除了分数之外,Astra 的重播还展示了它如何将不熟悉的游戏机制转变为有用的工作模型。三个突出的发现:它开发的紧凑代数符号、与人类相比的行动效率以及它构建的自定义工具。自定义代数符号 在玩 ARC-AGI-3 时,Astra 选择要继承的策略注释。它跟踪对象、坐标、规则和未完成的计划,同时还使用为环境生成的自定义领域特定语言符号。瓦
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱