安全攻防
morning
语言不清对法学硕士安全的影响
摘要
Computer Science > Machine Learning arXiv:2609.02852 (cs) [Submitted on 2 Sep 2026] Title: The Implications of Linguistic Illegibility for LLM Security Authors: James Mickens View a PDF of the paper t...
linguistic
model
for
the
that
LLM
language
can
illegibility
activation
2026-09-19
1 阅读
约7分钟阅读
tomjakubowski
字号:
计算机科学 > 机器学习 arXiv:2609.02852 (cs) [于 2026 年 9 月 2 日提交] 标题:The Implications of Linguistic Illegibility for LLM Security 作者:James Mickens 查看 James Mickens 题为“The Implications of Linguistic Illegibility for LLM Security”的论文 PDF 查看 PDF HTML(实验) 摘要:LLM 接受过生成自然语言的训练。然而,各种证据表明,法学硕士的外化语言输出和机械提取的语言特征可能是理解内部模型计算的不可靠的镜头。我们引入术语“语言难以辨认”来广泛指代法学硕士的外化或机械探测的语言工件无法代表模型实际思考方式的场景。我们认为,对于法学硕士来说,语言难以辨认的幽灵是不可避免的,因为法学硕士的内部计算不是直接通过语言表达,而是通过激活空间上的数学表达(激活空间和自然语言之间的有损翻译发生在书挡上)。如果语言上的难以辨认总是可能的,那么依赖于模型的语言自我报告(例如,思想链监控、宪法自我批评、语言定义的特征向量的激活探测)的安全机制永远不可能是完全健全的;模型沙箱始终需要隔离技术,其保证根本不依赖于读取模型的语言状态。我们认为,使用污点跟踪观察模型的输出是有效沙箱的一种有前景的方法:无论模型如何在语言上自我报告,污点跟踪策略都可以先验地定义各种系统状态,这些状态永远不会受到模型生成的数据的影响。我们还讨论了几种额外的沙箱机制(例如,强大的虚拟化、沙箱配置的第三方审核),这些机制共同为语言监控提供了关键基础,并且可以减轻前沿模型最近对沙箱的利用。主题:机器学习 (cs.LG);密码学和安全 (cs.CR) 引用为:arXiv:2609.02852 [cs.LG](或此版本的 arXiv:2609.02852v1 [cs.LG]) https://doi.org/10.48550/arXiv.2609.02852 arXiv 通过 DataCite 发布的 DOI(待注册) 提交历史记录 来自: James Mickens [ 查看电子邮件 ] [v1] 星期三,2026 年 9 月 2 日 17:37:22 UTC (33 KB) 全文链接:访问论文:查看由 James Mickens 撰写的题为 The Implications of Linguistic Illegibility for LLM Security 的论文的 PDF 查看 PDF HTML(实验性)TeX 源代码 查看许可证 当前浏览上下文:cs.LG < 上一页 |下一页 > 新 |最近 | 2026-09 更改为浏览方式:cs cs.CR 参考文献和引文 NASA ADS Google Scholar 语义学者正在加载... BibTeX 格式的引文正在加载... 数据提供者: 书签 书目工具 书目和引文工具 书目浏览器 切换书目浏览器(什么是浏览器?) 已连接的论文 切换已连接的论文(什么是已连接的论文?) Litmaps切换 Litmaps(什么是 Litmaps?)scite.ai 切换 scite 智能引文(什么是智能引文?)与本文相关的代码、数据、媒体代码、数据和媒体 alphaXiv 切换 alphaXiv(什么是 alphaXiv?)代码链接 切换 CatalyzeX 论文代码查找器(什么是 CatalyzeX?) DagsHub 切换 DagsHub (什么是 DagsHub?) GotitPub 切换 Gotit.pub (什么是 GotitPub?) Huggingface 切换 Hugging Face (什么是 Huggingface?) ScienceCast 切换 ScienceCast (什么是 ScienceCast?) 演示 演示 Replicate 切换 复制 (什么是 Replicate?) Spaces 切换 Hugging Face 空间 (什么是 Spaces?) Spaces 切换TXYZ.AI(什么是 TXYZ.AI?) 相关论文 推荐器和搜索工具 链接到 Influence Flower Influence Flower(什么是 Influence Flowers?) 核心推荐器切换 CORE 推荐器(什么是 CORE?) IArxiv 推荐器切换 IArxiv 推荐器(什么是 IArxiv?) 作者地点 机构 主题关于 arXivLabs arXivLabs:与社区合作者的实验项目 arXivLabs是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。与 arXivLabs 合作的个人和组织都接受并接受了我们开放、社区、卓越和用户数据隐私的价值观。 arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。您有一个能为 arXiv 社区增加价值的项目想法吗?了解有关 arXivLabs 的更多信息。这篇论文的哪些作者是认可者? |禁用 MathJax(什么是 MathJax?)
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱