首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

大型语言模型中涌现的内省意识

摘要

Computer Science > Computation and Language arXiv:2601.01828 (cs) [Submitted on 5 Jan 2026] Title: Emergent Introspective Awareness in Large Language Models Authors: Jack Lindsey View a PDF of the pap...

models and the their can that Language internal arXiv 2601
2026-08-12 1 阅读 约6分钟阅读 doener
分享:
字号:
计算机科学 > 计算和语言 arXiv:2601.01828 (cs) [提交于 2026 年 1 月 5 日] 标题:大型语言模型中的紧急内省意识 作者:Jack Lindsey 查看杰克·林赛 (Jack Lindsey) 题为“大语言模型中的紧急内省意识”的论文的 PDF 查看 PDF HTML(实验) 摘要:我们研究大型语言模型是否可以内省其内部状态。仅通过对话很难回答这个问题,因为真正的内省和虚构是分不开的。在这里,我们通过将已知概念的表示注入模型的激活中,并测量这些操作对模型自我报告状态的影响来解决这一挑战。我们发现,在某些情况下,模型可以注意到注入概念的存在并准确识别它们。模型表现出一定的能力来回忆先前的内部表征并将其与原始文本输入区分开来。引人注目的是,我们发现一些模型可以利用它们回忆先验意图的能力来区分它们自己的输出和人工预填充。在所有这些实验中,我们测试的最有能力的模型 Claude Opus 4 和 4.1 通常表现出最大的内省意识;然而,跨模型的趋势是复杂的,并且对训练后策略敏感。最后,我们探索模型是否可以显式控制其内部表征,发现模型可以在被指示或激励“思考”概念时调节其激活。总的来说,我们的结果表明当前的语言模型对其自身内部状态具有一定的功能性内省意识。我们强调,在当今的模型中,这种能力非常不可靠并且依赖于环境;然而,随着模型功能的进一步改进,它可能会继续发展。科目:计算和语言(cs.CL);人工智能 (cs.AI) 引用为:arXiv:2601.01828 [cs.CL](或此版本的 arXiv:2601.01828v1 [cs.CL]) https://doi.org/10.48550/arXiv.2601.01828 arXiv 通过 DataCite 发布的 DOI 提交历史记录 来自:Jack Lindsey [ 查看电子邮件] [v1] 2026 年 1 月 5 日星期一 06:47:41 UTC (33,806 KB) 全文链接: Access Paper:查看 Jack Lindsey 撰写的题为 Emergent Introspective Awareness in Large Language Models 的论文的 PDF 查看 PDF HTML(实验性)TeX 源代码查看许可证 当前浏览上下文:cs.CL < 上一页 |下一页 > 新 |最近 | 2026-01 更改为浏览方式:cs cs.AI 参考文献和引文 NASA ADS Google Scholar 语义学者正在加载... BibTeX 格式的引文正在加载... 数据提供者: 书签 书目工具 书目和引文工具 书目浏览器 切换书目浏览器(什么是浏览器?) 已连接的论文 切换已连接的论文(什么是已连接的论文?) Litmaps切换 Litmaps(什么是 Litmaps?)scite.ai 切换 scite 智能引文(什么是智能引文?)与本文相关的代码、数据、媒体代码、数据和媒体 alphaXiv 切换 alphaXiv(什么是 alphaXiv?)代码链接 切换 CatalyzeX 论文代码查找器(什么是 CatalyzeX?) DagsHub 切换 DagsHub (什么是 DagsHub?) GotitPub 切换 Gotit.pub (什么是 GotitPub?) Huggingface 切换 Hugging Face (什么是 Huggingface?) ScienceCast 切换 ScienceCast (什么是 ScienceCast?) 演示 演示 Replicate 切换 复制 (什么是 Replicate?) Spaces 切换 Hugging Face 空间(什么是 Spaces?) Spaces 切换TXYZ.AI(什么是 TXYZ.AI?)相关论文推荐器和搜索工具链接到 Influence Flower Influence Flower(什么是 Influence Flowers?)核心推荐器切换 CORE 推荐器(什么是 CORE?)作者地点机构主题关于 arXivLabs arXivLabs:与社区合作者的实验项目 arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。与 arXivLabs 合作的个人和组织都接受并接受了我们开放、社区、卓越和用户数据隐私的价值观。 arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。您有一个能为 arXiv 社区增加价值的项目想法吗?了解有关 arXivLabs 的更多信息。这篇论文的哪些作者是认可者? |禁用 MathJax(什么是 MathJax?)
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱