智能AI
morning
可测试的人类知识的时间胶囊:41 年的危险!在单一免费本地模型中
摘要
arXiv:2608.27459v1 Announce Type: new Abstract: In 2011, IBM's Watson was something like a sealed capsule of its era's queryable knowledge. Its DeepQA system defeated the strongest human Jeopardy! cha...
the
and
model
clues
Watson
was
knowledge
that
answer
The
2026-08-31
1 阅读
约2分钟阅读
David Noever, Forrest McKee
字号:
arXiv:2608.27459v1 发布类型:新 摘要:2011 年,IBM 的 Watson 就像一个密封的胶囊,里面装有那个时代的可查询知识。其DeepQA系统击败了人类最强的Jeopardy!冠军,但让它这样做的知识存在于一个运行在 POWER7 服务器集群上的、包含数十亿文档的语料库中,在构建时被冻结,无法移动或复制。我们证明,同样类型的人工制品,一种文化可以回答的快照,现在是可移植的并且基本上是免费的。我们针对完整的开放 Jeopardy! 评估单个 9 GB 开放权重模型(Qwen2.5-14B,4 位)。线索数据集,涵盖 1984 年至 2025 年所有 41 个广播季的 529,939 条线索。据我们所知,这是第一次在整个语料库上运行模型。 41年仅标志着问题收集的时间。他们测试的内容更加古老和广泛:一种文化认为值得了解的人类常识知识的积累,从古代历史和消逝的语言到科学、文学和地理,每个项目都有经过验证的答案。该模型在严格的强制响应协议下通过精确和模糊匹配回答了 67.0% 的所有线索,并且在事实类别上超过了 85%。我们将训练数据暴露视为两个系统共享的东西,而不是语言模型特有的缺陷。事实上,沃森的情况更为极端。它的语料库是为了包含《危险边缘》的答案而组装的,它是根据过去的线索进行调整的,它无法回答除精选分布之外的任何内容。决定性的考验是模型是否能够回答构建时不存在的线索。根据训练截止后公布的线索,本地模型占 65%,Claude Opus 4.8 占 95%,而 Watson by Construction 得分为零。从服务器机房转移到可以密封在时间胶囊中的文件后,该功能仍然存在,并且与 Watson 不同的是,它不会冻结在自己的时刻。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱