首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

经过专家验证的 STEM QA

摘要

arXiv:2608.28591v1 Announce Type: new Abstract: Recent advancements in AI are helping scientists achieve breakthroughs in fields such as mathematics, medicine, and materials sciences. New evaluation d...

the and for dataset datasets STEM domain model with are
2026-09-02 1 阅读 约2分钟阅读 Kihwan Han, Saurabh Patil, Chinmayee Shukla, Abhinav Sharma, Marko Pavlovic, Anshuman Lall, Mahesh Joshi
分享:
字号:
arXiv:2608.28591v1 公告类型:新 摘要:人工智能的最新进展正在帮助科学家在数学、医学和材料科学等领域取得突破。人工智能模型的新评估数据集有助于人工智能的进步。在 STEM 领域,前沿模型消耗了大部分可用的在线数据,这就产生了对人工创建的数据集的需求,这些数据集将该领域领先专家的知识编纂成文。该领域的研究界有多个 STEM 数据集可用。然而,这些数据集还存在一些差距,还有改进的空间。差距的例子包括(1)这些数据集上的模型性能饱和,没有留下有意义的评估空间,(2)分类分布不平衡,(3)多项选择题格式与科学家在现实世界中使用人工智能的方式不一致,以及(4)不准确的答案和理由,部分由基于竞赛的数据收集和有时限的审查过程导致。在这项研究中,我们提出了“专家验证的 STEM QA”,这是一个高质量、经过专家验证的物理、化学、生物学和数学 STEM 数据集 (N=398),由 241 名领域专家创建。我们(1)精心设计了一个平衡分布的分类法,(2)以质量驱动的激励方式审查问题贡献者,(3)进行了多轮审查,并由领域专家基于共识验证了修订,以及(4)以可验证的问答格式创建了数据集。我们的研究表明,以数据集为基准的前沿人工智能模型的性能较低($<25\%$)。相对于 HLE 验证数据集的 STEM 子集上的基线模型 (p=0.045),在单独的私有版本数据集 (N=2,000) 上进行后训练,开源模型的性能提高了 15%$,这表明该数据集对于模型训练的潜在效用。我们为人工智能研究社区开源了部分数据集。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱