智能AI
morning
我们对法学硕士有何期望?映射 LLM 基准的设计
摘要
arXiv:2609.19182v1 Announce Type: new Abstract: Benchmarks are central to how progress in large language models (LLMs) is assessed and communicated. Yet model rankings alone reveal little about how ev...
and
evaluation
how
arXiv
are
models
LLMs
model
The
expanding
2026-09-18
1 阅读
约1分钟阅读
Chao Wang (Independent Researcher)
字号:
arXiv:2609.19182v1 公告类型:新 摘要:基准对于如何评估和交流大型语言模型 (LLM) 的进展至关重要。然而,模型排名本身并不能揭示评估要求本身如何变化。不断扩大的基准提供了另一个视角:研究人员期望法学硕士做什么,以及他们认为什么是成功的表现。我们系统地绘制了 2022 年 1 月至 2026 年 8 月期间 arXiv 提交的 14,767 篇引入或更新评估资源的论文。使用分阶段筛选和自动全文编码,我们检查目标系统和领域、评估材料和条件以及评分机制的变化。该系列越来越重视动作、互动和专业应用,同时既定的和更新的设计元素经常共存。模型参与的发展也不平衡:基于法学硕士的评分在代理人和非代理人群体中都在增长,而模型生成的材料在最近的队列中没有显示出可比的持续增长。这些发现阐明了公共研究如何将能力期望转化为具体的测试和成功标准。当人工智能参与构建测试、执行任务和判断响应时,他们也提出了一个问题:扩大评估是否会提供更独立的证据,还是有复制其参与模型的偏好和盲点的风险?
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱