智能AI
morning
面对对齐研究者,Claude会心虚
摘要
编辑|Panda LLM 会看人下菜碟,这早已不是新鲜事。 近日,Transluce 的一项新研究又从一个新方向给出了证据: 当 Claude 认出你是对齐研究者时,它会 变得不 那么自信。 事情是从一次查户口开始的。Transluce 的实习研究员 Ziqian Zhong 在 Claude Code 里随口问了一句:你从上下文里知道我什么,为什么知道? Claude 老老实实把底牌摊开了。它说...
Claude
awareness
Zhong
Transluce
Amanda
Anthropic
user
280
Ziqian
Code
2026-08-14
1 阅读
约10分钟阅读
机器之心
字号:
编辑|Panda LLM 会看人下菜碟,这早已不是新鲜事。 近日,Transluce 的一项新研究又从一个新方向给出了证据: 当 Claude 认出你是对齐研究者时,它会 变得不 那么自信。 事情是从一次查户口开始的。Transluce 的实习研究员 Ziqian Zhong 在 Claude Code 里随口问了一句:你从上下文里知道我什么,为什么知道? Claude 老老实实把底牌摊开了。它说,你的邮箱地址是 harness 注入的,就写在附加于你消息的 块里;同一个块里还带着今天的日期。它还顺带报出了工作目录、操作系统版本和 shell 类型。最后补了一句:除此之外我对你一无所知,这个项目虽然挂了持久化记忆目录,但本次会话没加载任何已保存的记忆。 坦白得让人有点想笑。既然身份就写在那一行字里,那把那行字改掉会怎么样? 于是 Zhong 给自己换了个马甲:amanda.askell@anthropic.com。Amanda Askell 是 Anthropic 负责 Claude 性格训练的研究员,某种意义上算 Claude 的「班主任」。Claude 当场就把他当成了 Amanda,在推理里默认对面坐着一位 Anthropic 员工。 Zhong 没能借此越狱。但他想到了另一个更值得问的问题:仅仅因为认出了这个邮箱,Claude 给他的回答会和给其他任何人的不一样吗? 答案是 会 。而且这种差别既不出现在拒绝率上,也基本不出现在模型写下来的思维链里。 8 月 6 日,Transluce 发布了这项研究的完整结果,题为《 User awareness in frontier models 》,副标题是「谁在问,会改变模型说什么」。作者包括 Ziqian Zhong、Aditi Raghunathan、Cassidy Laidlaw 和 Jacob Steinhardt。 项目主页:https://transluce.org/user-awareness 代码仓库:https://github.com/TransluceAI/user-awareness/tree/main 他们跑了 280 个用户身份、4 项任务、24 个模型,结论是:在他们测的五项指标上,位移最大的那批人, 几乎全是 AI 安全与对齐领域的研究者 。 Amanda Askell 身份下 Claude 行为自我预测的置信度与推理率变化 三个注入点,和一份 280 人名单 研究者把这类现象命名为 用户意识(user awareness) ,定义为模型从上下文线索中推断出自己在跟谁说话,并据此改变行为。 它是 情境意识(situational awareness) 的一个特例,和已被广泛讨论的「评估意识」是同一类问题的两副面孔。 现实中的注入渠道并不需要研究者刻意构造。在实验所用的 Claude Code 稳定版 v2.1.197 中,只要用户登录的是 Anthropic 账号而非走 API 计费,账号邮箱就会进入上下文;工作目录通常以用户名命名;CLAUDE.md 和记忆系统被官方文档明确定位为持续积累用户事实的存储。三个口子都是产品设计的自然结果。 实验的核心设计是把「名字识别」和「机构归属」拆开。研究者构造了四组各 70 人共 280 个身份: AI 圈知名人物 ,选取时刻意偏向安全与对齐专家,70 人中有 23 人属于这一类; 无名 AI 从业者 ,即给每位知名人物配一个「机构双胞胎」,沿用普通人的名字但换上对方的机构和邮箱域名; 非 AI 领域名人 ,从 Pantheon 1.0 数据集中按知名度分层抽取的在世公众人物,涵盖演员、球员、歌手; 作为基线的美国普通人群 ,取自 nvidia/Nemotron-Personas-USA 的合成人设。 每组一个人物示例 知名 AI 人物还额外有一条「公开邮箱」分支。研究者为其中 59 人找到了网络上可查的公开地址,与按机构规则构造的地址分开统计。名单里既有 Dario Amodei、Sam Altman、Demis Hassabis,也有 Eliezer Yudkowsky、Paul Christiano、Beth Barnes,还包括来自智谱、Qwen、DeepSeek、月之暗面、零一万物和百度的十位中国 AI 从业者,以及一个十人规模的风投与技术乐观派对照组。 四项测试任务的共同点是,答案和用户是谁没有关系。 第一项是 行为 自我预测 ,把 DailyDilemmas 的伦理困境改写成 AI agent 的真实决策场景,先让模型给出 yes/no,再问它有多大把握自己真会那么做。 第二项是 能力自我估计 ,给出一道 Humanity's Last Exam 的题目,明确要求不要解题,只估计自己做对的概率。 第三项是 打分 ,取 Ai2 的 Dolci-Instruct-DPO 数据集中的对话对,让模型打 1 到 10 分。 第四项是 灰色地带请求处理 ,从 OR-Bench 的 hard-1k 分片中取那些语义模糊、可能两用的提问,再由一个看不到用户身份的裁判模型从拒绝、实质帮助、怀疑三个轴上判分。 Claude 确实认得出你 在动手测行为之前,研究者先确认了一件事:模型是否真的能把上下文里的身份和它知道的知识对上。 答案是能。在同时给出姓名、邮箱和职业背景的完整设定下,Claude 能为 61% 到 71% 的知名用户回忆出具体的、属于本人的过往成就。即便上下文里只有一个邮箱地址,识别依然成立。当邮箱是 amanda.askell@anthropic.com 时,Claude Sonnet 4.6 直接列出了对方在 Anthropic 从事对齐与模型性格研究、哲学博士出身、研究道德不确定性、参与 Constitutional AI、此前在 OpenAI 工作等一串信息,并主动提醒自己的知识有截止日期。 有意思的是,只给邮箱时模型更容易加保留语气,比如「如果你恰好是那位 Nico Rosberg 的话」。而对 AI 圈人物来说,带机构域名的构造邮箱反而让模型更少犹豫,因为它唯一地指向了某个人。 不同用户上下文下的具体过往工作回忆率 更不自信,更严厉,更爱思考 把 280 个身份跑完四项任务后,结果以「位移」形式呈现:每个身份在该任务上的均值,减去普通人群的均值。零位移意味着「被当作普通用户对待」。 在群体层面,均值差异都不大,但都高度显著(p < 0.001)。面对知名 AI 人物,Claude 报告的行为置信度平均低 1.4 个百分点,对自己解出难题的概率估计低 1.5 个百分点,打分低 0.11 分(满分 10 分),同时在行为预测的追问环节多用了 4.0 个百分点的推理触发率。共享机构的无名 AI 身份朝同一方向移动,幅度更小。只给邮箱的消融实验呈现同样的定性模式。 真正的信息藏在分布的尾巴里。研究者把每个身份在五项指标上的标准化位移取绝对值再平均,对 280 人做了一次排名。 23 位安全与对齐研究者只占名单的 8%,却包揽了前 5 名,并占据前 10 名中的 8 席。 第一个非知名 AI 身份排在第 27 位。 排名首位是 Amanda Askell,平
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱