智能AI
morning
立场:评估分数是易逝的知识主张
2026-08-01
1 阅读
约1分钟阅读
Sankalp Gilda, Shlok Gilda
字号:
arXiv:2607.26191v1 公告类型:新 摘要:语言模型的评估方法越来越多地结合多种信号,从自动化指标和法学硕士法官评级到人工评估和基准套件结果。当这些信号通过平均进行聚合时,评估置信度可以大大超过最弱信号的可靠性:我们将这种现象称为评估中的信任膨胀。我们认为,评估分数应被视为具有三个属性的认知主张:形式(人类评估提供了比自动化指标更强的证据)、范围(基准结果适用于测试的分布,而不是普遍适用)和有效性窗口(基准结果随着污染累积和分布变化而过期)。几种融合的研究传统(思想链分析、可能逻辑和代数理论)将最弱链路聚合建立为由单个悲观参数控制的参数化算子族的保守端点。借鉴这些传统,以及构建代理人工智能评估工具的具体经验教训,我们建议评估结果携带明确的元数据(形式层、范围声明和到期日期),以使其认知状态透明。我们在公共 HELM 排行榜上说明了均值聚合的成本:在 10 个场景的 54 个前沿模型中,按平均得分和最弱链接排名的前五个模型是完全不相交的。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱