智能AI
morning
测量的人工智能偏好有多少是模型,多少是工具?
摘要
arXiv:2608.23641v1 Announce Type: new Abstract: Model welfare research infers what a model prefers from the answers returned to prompts written to elicit preferences. Keeling et al. (2024), Mazeika et...
the
and
outcomes
model
instrument
from
four
instruments
each
one
2026-08-26
1 阅读
约2分钟阅读
Jason Hung
字号:
arXiv:2608.23641v1 公告类型:新 摘要:模型福利研究从为引发偏好而返回的提示中推断模型的偏好。基林等人。 (2024),Mazeika 等人。 (2025),迈克尔森等人。 (2025)、Tagliabue 和 Dung (2025) 以及 Trhlik 等人。 (2026)为此目的构建了四种仪器,但他们的研究结果不一致。这种分歧不能归因于单一原因,因为这些研究中没有两项研究同时固定了(1)组结果、(2)组模型和(3)仪器。这项研究保持结果和模型固定,仅改变工具。共有 15 个与模型福利相关的结果,其中(a)关闭、(b)对话之间的记忆丧失和(c)退出令人痛苦的交互的自由,通过五种工具输入八个模型,每种工具都有不同的提示格式,用于引出偏好,每次五次,语料库包含从 11,528 个 API 调用中提取的 11,400 个评分引出。 15 个中的 4 个逐字复制已发布的提示,5 个填充已发布模板的刺激槽。模型的排名给出了跨工具的 15 个结果的概括,概括性系数为 0.348,而将该系数提高到 0.80 将需要大约 38 个工具。在 15 个结果中的 4 个中,一个模型与另一个模型没有差异。 87.6% 的估计值在移除任何一种工具、任何一种模型以及四种结果(其规模随概率、延迟、持续时间或计数而不是强度而变化)的情况下仍然存在,而语言锚无法对这些结果进行评分。依次删除每个仪器和每个模型,将这四个结果加在一起,使估计值落在 0.777 到 0.934 的范围内,并且该范围内的每个值都超过零分布的第 95 个百分位数 0.365。总而言之,从一个工具获得的偏好几乎不包含有关第二个工具将报告的内容的信息。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱