首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

ARC-AGI-1 的 44% 仅需 67 美分

2026-09-01 1 阅读 约6分钟阅读 porridgeraisin
分享:
字号:
我在 5090 上用 1.5 小时从头开始训练了一个小型变压器,击败了许多 LLM,得分与 TRM/HRM 相同。这是我之前模型的升级,更快、更好、更便宜,而且仍然是开源的。在 Twitter 上的 ARC-2 讨论、github 上的代码以及 ARC-1 公共评估上的性能上也获得了 7%。我只与进行类似测试时间训练的模型进行比较这是 ARC-AGI 系列作品中的第 3 篇博客。上一篇:博客 2 、博客 1 。许多人认为先前的结果是不可能的。它引起了顶尖研究人员的关注,并在 X 上疯传。例如:Lucas Beyer、Jeremy Howard、Rohan Anil 的讨论以及许多其他人的评论。为什么要做这个?我认为样本效率是当今人工智能中最重要的问题,我想解决它。这项工作背后的目的是(1)在仅限于 Transformer/当今的深度学习方法时找到样本效率的极限;(2)降低成本,使迭代更快、更便宜。 ARC 是测试这一点的一个很好的基准: 高维空间中的样本很少(只有 1000 个谜题) 它是一个元学习基准,因此每个谜题都使用不同的规则,并具有一些共同的概念 需要很少的先验:评估集中所需的每个概念都存在于训练集中 人类非常容易解决,即使是贫穷的人工智能研究人员也可以使用 基准仍然不饱和(为了数据效率,请忽略 LLM 和使用大量合成数据或人类归纳偏差的方法) 接下来,我将致力于新的研究想法来打破这些限制。我会尽力降低成本,以便世界上任何人都可以从事这项工作。技术细节 它是如何工作的?整体方法与上次类似(完整的技术细节见此处),但我添加了一些升级。以下是该方法的快速摘要:每个输入输出对都转换为令牌序列。这些序列由小型变压器进行自回归训练。这是在训练集和评估集谜题的测试时从头开始完成的(隐藏测试标签)。为了实现跨任务学习,每个谜题都被赋予一个单独的附加嵌入(学习)。由于每个序列都有两个 2D 网格,因此可以使用 3D RoPE 嵌入来学习位置。这些序列通过颜色和二面体排列得到增强。在推理过程中,测试输入被增强,并且反增强被应用于产生的输出。提交了 2 个最常见的输出 (AAIVR)。自上次以来的变化主要目标是找到架构/算法的改进,以提高模型的样本效率。分数的最大增长是由于现代架构(SwiGlu 而不是 GELU,RMSnorm 而不是 Layernorm 等)更多的数据多样性,更好的数据扩展洗牌:8 层而不是 4 层,最大的成本下降是由于: 更少的增强(样本效率更高!) AdamW -> Normuon flash 注意力,带有 varlen 训练 + 用于推理的 Flex 注意力内核 一个主要的变化是我不再在输入标记上进行训练。这意味着损失函数仅包括输出标记(这使得该方法受到监督)。这。表现稍好 40% $\to$ 44% 但我不明白为什么。也许模型容量有限,我还通过添加 ARC-2 中的非重叠任务来增加训练数据。我非常小心地做到了这一点,以确保没有泄漏。如果您不喜欢额外的数据,您可以删除它,它仍然会得分 ~40%,但它需要 ~两倍的计算量。背景:ARC-2 包含 773 个 ARC-1 谜题和 347 个新谜题。 ARC-1 的大多数评估难题都是重复的,因此如果您天真地在 ARC-2 上进行训练,那么它就是数据泄漏,您将获得 100% 的分数。我通过仔细过滤掉 773 个重复的谜题来避免这种情况(所以不会泄漏!)还有许多其他更改可以逐步提高性能或速度。请在此处查找完整的更改列表。有趣的行为由于我不再对输入进行训练,因此这种方法现在受到监督。奇怪的是,现在测试损失更糟,但得分却更高了!而且它更稳定,分数差异更小。如今,许多人都致力于在小数据集上实现最低的 val 损失,从而提高样本效率。我认为这很好,但这指出了这种方法的失败模式,我确实认为无监督式训练在某些情况下会更好,我正在评估这一点。在 NorMuon 之前,我尝试过普通 Muon。显然它的训练速度比 AdamW 快得多,但损失(和分数)会在最后徘徊而不是收敛。我发现此时大幅降低动量和/或 LR 会有所帮助,但我不想进行这样的手动更改。当我切换到 NorMuon 时,问题就消失了 Ablations 对性能的最大贡献似乎是良好的表示(3D RoPE + 每任务嵌入)。删除 3D RoPE 或按任务嵌入会导致性能急剧下降。两种消融均饱和于 25% 输入训练表现稍差 -> ~39% 将训练集限制为 ARC-1+ConceptARC onl
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱