智能AI
morning
EvalDetectBench:衡量前沿语言模型评估意识的基准
摘要
arXiv:2609.01611v1 Announce Type: new Abstract: Frontier large language models can often recognize when they are being evaluated, a capability known as evaluation awareness. If models behave different...
and
the
are
evaluation
for
that
model
can
evaluations
deployment
2026-09-03
1 阅读
约1分钟阅读
Xinning Li, Kemunto Ochwang'i, Aryasomayajula Ram Bharadwaj, Alexandra Souly, Robert Kirk
字号:
arXiv:2609.01611v1 公告类型:新 摘要:前沿大型语言模型通常可以在评估时进行识别,这种能力称为评估感知。如果模型在评估中的表现与在部署中的表现不同,就会破坏评估结果的有效性,而评估结果是当前人工智能安全框架的重要组成部分。我们推出了 EvalDetectBench,这是一个开放式管道和基准,用于测量评估意识,可与任何 Inspect 兼容的评估配合使用,允许从业者根据当前和未来的基准进行测试。 EvalDetectBench 附带了一个新策划的转录套件,涵盖当前前沿系统卡评估和不同的部署源。该基准有两个目的:衡量前沿法学硕士认识到他们正在接受评估的可靠性,以及评估单个基准作为评估的可检测性。我们在现有文献中确定了两种引入系统偏差的方法选择:生成部署记录的模型的身份占测量方差的 11.25%,并且可以重新排序模型排名;在一种模型上为高性能而选择的启发提示在其他模型上也有可能表现良好。 EvalDetectBench 通过每个模型的探头校准和分层发生器协调程序进行校正。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱