首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

我们对法学硕士有何期望?映射 LLM 基准的设计

摘要

arXiv:2609.19182v1 Announce Type: new Abstract: Benchmarks are central to how progress in large language models (LLMs) is assessed and communicated. Yet model rankings alone reveal little about how ev...

and evaluation how arXiv are models LLMs model The expanding
2026-09-18 1 阅读 约1分钟阅读 Chao Wang (Independent Researcher)
分享:
字号:
arXiv:2609.19182v1 公告类型:新 摘要:基准对于如何评估和交流大型语言模型 (LLM) 的进展至关重要。然而,模型排名本身并不能揭示评估要求本身如何变化。不断扩大的基准提供了另一个视角:研究人员期望法学硕士做什么,以及他们认为什么是成功的表现。我们系统地绘制了 2022 年 1 月至 2026 年 8 月期间 arXiv 提交的 14,767 篇引入或更新评估资源的论文。使用分阶段筛选和自动全文编码,我们检查目标系统和领域、评估材料和条件以及评分机制的变化。该系列越来越重视动作、互动和专业应用,同时既定的和更新的设计元素经常共存。模型参与的发展也不平衡:基于法学硕士的评分在代理人和非代理人群体中都在增长,而模型生成的材料在最近的队列中没有显示出可比的持续增长。这些发现阐明了公共研究如何将能力期望转化为具体的测试和成功标准。当人工智能参与构建测试、执行任务和判断响应时,他们也提出了一个问题:扩大评估是否会提供更独立的证据,还是有复制其参与模型的偏好和盲点的风险?
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱