智能AI
morning
当前的系统泛化任务遗漏了什么?以推理为中心的分析
摘要
arXiv:2609.19212v1 Announce Type: new Abstract: Systematic generalization, the ability to solve novel problems by recombining known atomic elements, is central to human intelligence but difficult to s...
the
that
and
TranSGrid
generalization
test
set
but
simplifications
action
2026-09-18
1 阅读
约1分钟阅读
Chengwen Qi, Deheng Ye, Yatao Bian
字号:
arXiv:2609.19212v1 公告类型:新 摘要:系统泛化,即通过重组已知原子元素解决新问题的能力,是人类智能的核心,但很难在受控环境下进行严格研究。因此,现有的研究依赖于简化,例如近似线性的动作组合、基于生产力的测试和动作明确的目标,这使得系统概括更容易研究,但忽略了这种能力的一些基本方面。为了描述这些简化所遗漏的内容,我们采用了以推理为中心的视角,并引入了 TranSGrid,这是一个将演绎、归纳和溯因推理整合到一个统一任务中的测试平台。在 4,800 个 TranSGrid 实例上使用 7 个 Transformer 进行的实验表明,所有模型在 TranSGrid 上的表现都比在保留的测试集上差得多:最大的模型解决了测试集的 79.6%,但仅解决了 TranSGrid 的 55.3% 和最难子集的 15.8%。差距仍然在训练长度范围内,这表明仅靠生产力不足以评估系统泛化能力。此外,我们在 TranSGrid 中重新引入了另外两种简化:一种变体使动作几乎线性组合(减少归纳需求),另一种使目标动作明确(减少溯因需求)。在这两种情况下,解决率都大致返回到测试集水平,这表明单独进行任一简化都足以将 TranSGrid 降低到普通的保留测试集。总之,我们的结果表明,现有任务减少了归纳和归纳需求中的一个或两者,并且全面衡量系统泛化需要涉及所有三种推理形式的任务。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱