智能AI
morning
评估评估者:LLM 评估的 Rasch 测量理论
摘要
arXiv:2608.27463v1 Announce Type: new Abstract: LLMs now sit on every side of evaluation: as examinees scored on benchmarks, judges of other models' outputs, and raters of human-generated content. Eac...
and
the
RMT
LLMs
evaluation
raters
from
that
rater
models
2026-08-31
1 阅读
约1分钟阅读
Pratik S. Sachdeva, Nathan Boudol
字号:
arXiv:2608.27463v1 公告类型:新 摘要:法学硕士现在参与评估的各个方面:作为在基准上评分的考生、其他模型输出的评判者以及人类生成内容的评分者。每个范式都可以被视为一个测量问题,其中评估者使用仪器(例如基准)中的项目来探测对象的潜在属性。标准评估实践常常忽略每个核心组成部分对最终结果的贡献,限制了我们对所测量内容的理解。拉希测量理论(RMT)非常适合此类问题。 RMT 将顺序评级分解为通用尺度上的可分离的方面。它还提供了一系列诊断功能,可以识别错误校准的测量结果和评估者偏差。我们使用测量仇恨言论语料库提出了将 RMT 应用于法学硕士作为评估者范式的案例研究,其构造本身是在 RMT 下构建的。我们将一系列多方面的 Rasch 模型与跨越家庭和能力级别的九个法学硕士的注释进行拟合。我们的分析表明,法学硕士在严重性、项目级校准、问题顺序稳健性、目标身份敏感性和评级量表使用方面与人类评估者存在系统性差异,而所有这些都会被标准评估实践所掩盖。总的来说,我们认为 RMT 属于评估 LLM 考生、法官和评估者范式的工具包。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱