首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

当人工智能基准达到稳定水平时:基准饱和度的系统研究

摘要

[Submitted on 18 Feb 2026 ( v1 ), last revised 29 Jun 2026 (this version, v3)] Title: When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation Authors: Mubashara Akhtar , Anka Reuel , Pr...

2026 and benchmarks saturation that Mubashara Akhtar UTC Feb Jun
2026-08-05 1 阅读 约3分钟阅读 doppp
分享:
字号:
[提交于 2026 年 2 月 18 日( v1 ),最后修订于 2026 年 6 月 29 日(本版本,v3)] 标题:当 AI 基准达到高原时:基准饱和度的系统研究 作者: Mubashara Akhtar , Anka Reuel , Prajna Soni , Sanchit Ahuja , Pawan Sasanka Ammanamanchi , Ruchit Rawal , Vilém Zouhar , Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šuppa, Jan Batzner, Jenny Chim, Jeba Sania, Yanan Long, Hossein A. Rahmani, Christina Knight, Yiyang Nan, Jyoutir Raj, Yu Fan, Shubham Singh, Subramanyam Sahoo, Eliya Habba、Usman Gohar、Siddhesh Pawar、Robert Scholz、Arjun Subramonian、Jingwei Ni、Mykel Kochenderfer、Sanmi Koyejo、Mrinmaya Sachan、Stella Biderman、Zeerak Talat、Avijit Ghosh、Irene Solaiman 查看标题为“当 AI 基准高原:基准饱和度的系统研究”的论文的 PDF,作者: Mubashara Akhtar 和其他 36 位作者 查看 PDF HTML(实验) 摘要:人工智能基准测试是衡量模型进度和指导部署决策的重要机制。然而,基准测试很快就会“饱和”,使得区分模型变得困难,并削弱了它们的长期价值。在这项研究中,我们定义了基准饱和度,并使用 14 个与饱和度相关的属性在 60 个语言模型基准上对其进行了分析。我们发现近一半的基准表现出饱和度,并且比率随着年龄的增长而增加。此外,我们发现饱和弹性受到专家策划的影响​​,而不是公共测试数据的影响。我们的结果表明,设计选择可以延长基准寿命并为更持久的评估方法提供信息。提交历史来自: Mubashara Akhtar [ 查看电子邮件 ] [v1] 2026 年 2 月 18 日星期三 16:51:37 UTC (222 KB) [v2] 2026 年 5 月 30 日星期六 16:41:50 UTC (640 KB) [v3] 2026 年 6 月 29 日星期一 17:01:58 UTC (636 KB)
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱