智能AI
morning
“作为语言模型......”:聊天模板切换 LLM 自指语音和激活指导再现它
2026-09-23
1 阅读
约1分钟阅读
J\k{e}drzej Maczan
字号:
arXiv:2609.25021v1 公告类型:新 摘要:大型语言模型 (LLM) 在被问及与自身相关的问题时倾向于添加“我只是一个人工智能”之类的免责声明。这些回应的自我报告被用于有关人工智能安全或模型自我认识的辩论中,但驱动它们的因素尚不清楚。这些模型是在告诉我们它们本身还是它们是如何部署的?在这项工作中,我们展示了聊天模板的工作原理就像一个开关 - 当存在时,它会在 8 个流行的开源指令模型(参数大小高达 9B)中将免责声明声音调大,并将体验声音(如“我感觉”)调低。相反,当聊天模板不存在时,它会降低免责声音并提高体验声音。在 3 个模型的激活中,我们找到了引导这种行为的方向。删除模型激活空间中的方向会降低免责声明的声音,添加该方向则会提高免责声明的声音,而相同大小的随机方向几乎没有影响。我们发现指导模型没有聊天模板,当我们向它们添加免责声明方向时,就像模板在那里一样免责。由于聊天模板控制着法学硕士的免责声明声音,因此研究自我报告或模型内省的研究人员可能会遇到需要控制的困惑。我们的结果表明,他们可以利用一个方向来引导这种声音。更广泛地说,我们的工作表明,模特对自己的评价并不是关于他们的事实。他们所说的不仅仅来自权重,而且部分是由聊天模板设置的,因此模型的自我描述不应该按字面意思对待。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱