智能AI
morning
协议并不一致:人类和法学硕士道德判断中不同的道德基础
摘要
arXiv:2608.12368v1 Announce Type: new Abstract: Agreement with human judgments is a common proxy for evaluating the alignment of large language models (LLMs). Yet agreement in final labels does not sh...
the
and
human
models
labels
moral
with
agreement
final
annotator
2026-08-15
1 阅读
约1分钟阅读
Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklav\v{c}i\v{c}, Marko Robnik \v{S}ikonja
字号:
arXiv:2608.12368v1 公告类型:新 摘要:与人类判断的一致性是评估大型语言模型 (LLM) 一致性的常用指标。然而,最终标签的一致并不表明人类注释者和模型依赖相同的道德基础。两个主体在诉诸不同的原则、情境假设或对情况的解释时可能会得出相同的判断。我们使用涵盖道德判断五个领域的 500 项 ETHICS 衍生基准测试来测试这种区别,并使用新的人类注释器和 LLM 对最终标签和支持理由进行注释。在前沿和开放模型系列中,与人类注释者大多数标签的一致性通常很高。然而,理性层面的分析揭示了人类注释者和模型所表达的道德基础存在系统性分歧。特别是,模型会在伤害、尊重、信守诺言、正义、应得和借口相关性等类别之间重新分配注意力,即使它们的最终标签与大多数人类注释者匹配。我们的结果表明,一致不应被视为等同于一致。因此,基于标签的评估可能会产生误导性的安慰,除非辅之以对模型判断中表达的原因、原则和道德优先事项的分析。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱