首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

没有中立的束缚:现代法学硕士排行榜是由配置脆弱的物品制造的

摘要

arXiv:2608.21382v1 Announce Type: new Abstract: Multiple-choice benchmarks fix the questions and the correct answers, but not the harness: the order of the options, the wording of the prompt, and whet...

the and items harness from model that order answer one
2026-08-25 1 阅读 约2分钟阅读 V. S. Raghu Parupudi
分享:
字号:
arXiv:2608.21382v1 公告类型:新摘要:多项选择基准修复了问题和正确答案,但没有解决问题:选项的顺序、提示的措辞以及语言模型的答案是从生成的文本还是从每个选项的可能性中读取。处理此利用敏感性将其报告为总分方差,而未检查方差落在哪些项目以及它们是否是将一个模型与下一个模型分开的项目。我们将大型语言模型(LLM)的评估工具视为自变量,并将其影响分解为单个项目。我们引入了 \textit{脆弱性网格}:来自 4 个系列的 12 个开放权重指令调整的 LLM 在 26 个同样具有防御性的线束配置下回答了来自 4 个基准(ARC、HellaSwag、MMLU、TruthfulQA)的相同 3{,}679 个项目,为每个模型、项目和配置记录了一个正确性位。比较是匹配的,因为项目、权重和贪婪解码保持固定,而只有线束发生变化。在网格下,模型的分数是一个带而不是一个点:gemma4-31b 的分数在 31% 到 89% 之间,仅取决于安全带。以下是三个结果。在两个相邻模型都稳定回答的项目上,这对是平局的,而配置脆弱的项目平均占一对差距的 95.7%。 12 个模型中有 4 个在某些配置下达到了第一名,因此安全带选择了获胜者。项目歧视是基准压缩方法最大化的属性,与脆弱性的相关性为 0.28(95% CI 0.25 至 0.30),因此压缩会保留易碎项目,而不是删除它们。评分选择,而不是协议通常确定的选项顺序,是承载轴。我们发布了每个项目的记录和分析脚本,每个数字都会在几秒钟内在 CPU 上重新生成,并且我们将脆弱性网格定位为排行榜在报告订单之前可以运行的检查。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱