开发者生态
morning
物理学前沿模型有多好?
摘要
Computer Science > Artificial Intelligence arXiv:2609.13009 (cs) [Submitted on 11 Sep 2026] Title: How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Satura...
and
with
physics
Ali
Wang
models
Artificial
Intelligence
2026
How
2026-09-17
1 阅读
约8分钟阅读
qt31415926
字号:
计算机科学 > 人工智能 arXiv:2609.13009 (cs) [提交于 2026 年 9 月 11 日] 标题:物理学前沿模型有多好?专家重新评级揭示了领先基准的评估不完善和接近饱和作者:Ali Ansari、Haoran Sun、Andy Zeyi Liu、Mark Jabbour、Yongshan Ding、Steven Girvin、Yu He、Sohrab Ismail-Beigi、Aleksander Kubica、Owen D. Miller、Corey O'Hern、Vidvuds Ozolins、David Polish、 A. Douglas Stone、Frank C. van den Bosch、Logan Wright、Navid Akbari、Santanu Antu、Kangle Cai、Andrew Calabrese-Day、Mateo Cárdenes Wuttig、Meng Cheng、Barry T. Jiang、Ali Ghorashi、顾守贞、黄浩阳、康志博、Lukas Kienesberger、Hantian Liu、Charles Lomba、钟灵陆文超、Rohin E. McIntosh、Evan McKinney、Ivan Rojkov、孙旭雷、Yarone Meir Tokayer、Naveen Balaji Umasankar、Mira Varma、Leda Wang、王启民、Tyler Wang、魏浩宇、杨金明、赵金晨、Sherlock Tingrui、Zheng Qingyuan Cheng、Jay S. Zou 、Lucas Baker、Arman Cohan、John Sous 查看题为《物理学前沿模型有多好?》的论文 PDF。专家重新评分揭示了领先基准的破碎评估和接近饱和,作者:Ali Ansari 和其他 50 位作者 查看 PDF HTML(实验) 摘要:领先物理基准(包括人工智能分析智能指数 (2026) 中的那些)的低报告分数表明,前沿语言模型仍在与高级物理作斗争,这是对其科学推理和定量问题解决能力的严格考验。然而,这种印象并不总是与领域专家在工作中使用这些模型的经验相符。我们通过评估六个广泛使用的物理基准的前沿模型并与专家进行审核来重新审视这些报告的发现,重点关注具有可验证的最终答案的纯文本问题。对于物理学的每个子领域,具有相关专业知识的教师和研究生研究人员仔细审查问题陈述、参考解决方案和模型响应,以区分真正的模型错误与评分者错误、不正确的参考解决方案以及模糊或不明确的问题。大多数最初被评估为不正确的审计案例反映了这些基准测试问题,而不是模型物理推理中的错误。然后,我们要求专家通过纠正错误的参考解决方案并修复或排除有缺陷的问题来解决这些基准测试问题。我们发现,GPT-5.6-Sol 在 HLE-Physics 上的测量平均值@4 从 47.3% 上升到 78.7%,在 CMT-Benchmark 上从 61.0% 上升到 87.2%,而其在 54 个保留的 CritPt 挑战中的校正 pass@4 达到 94.4%。根据专家评审后保留的评估子集计算校正分数。校正后,UGPhysics、PRISM-Physics 和 PHYBench 审核子集的分数也大幅上升。这些发现表明,当前的基准大大低估了前沿模型解决适定物理问题的能力。这些封闭式任务的接近饱和凸显了对更严格、经过专家验证的评估的需求。主题:人工智能 (cs.AI) 引用为:arXiv:2609.13009 [cs.AI](或此版本的 arXiv:2609.13009v1 [cs.AI]) https://doi.org/10.48550/arXiv.2609.13009 arXiv 通过 DataCite 发布的 DOI(待注册) 提交历史记录发件人:Ali Ansari [ 查看电子邮件 ] [v1] 2026 年 9 月 11 日星期五 16:06:50 UTC (178 KB) 全文链接:访问论文:查看题为《物理学前沿模型有多好?》的论文 PDF。专家重新分级揭示了领先基准的破碎评估和接近饱和,作者:Ali Ansari 和其他 50 位作者 查看 PDF HTML(实验性)TeX 源代码 查看许可证 当前浏览上下文:cs.AI < 上一页 | 上一页 | 下一页下一页 > 新 |最近 | 2026-09 更改浏览方式: cs 参考文献和引文 NASA ADS Google Scholar 语义学者正在加载... BibTeX 格式的引文正在加载... 数据提供者: 书签 书目工具 书目和引文工具 书目浏览器切换 书目浏览器(什么是浏览器?) 关联论文 切换 关联论文( 什么是关联论文?) Litmaps 切换Litmaps(什么是 Litmaps?) scite.ai 切换 scite 智能引文(什么是智能引文?) 与本文相关的代码、数据、媒体代码、数据和媒体 alphaXiv 切换 alphaXiv(什么是 alphaXiv?) 代码链接 切换 CatalyzeX 论文代码查找器(什么是 CatalyzeX?) DagsHub 切换 DagsHub(什么是DagsHub?)GotitPub 切换 Gotit.pub(什么是 GotitPub?)Huggingface 切换拥抱脸(什么是 Huggingface?)ScienceCast 切换 ScienceCast(什么是 ScienceCast?)演示演示复制切换复制(什么是复制?)空间切换拥抱脸空间(什么是空间?)空间切换 TXYZ.AI(什么)是 TXYZ.AI?) 相关论文推荐器和搜索工具 影响力花链接 影响力花(什么是影响力花?) 核心推荐器切换 CORE 推荐器(什么是 CORE?)
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱