智能AI
morning
一个根本性的缺陷使得法学硕士极易受到攻击
2026-08-01
1 阅读
约3分钟阅读
Will Douglas Heaven
字号:
“当你和我说话时,我可以分辨出哪些词是从我嘴里说出来的,因为我能感觉到我的嘴在动,”崔说。但法学硕士只能看到连续的文本流;用户的提示与模型之前的响应、草稿本笔记、从文档复制的文本等混合在一起。 “这只是一大张代币,”她说。为了帮助跟踪谁说了什么,聊天机器人使用标签来按研究人员所说的角色来分解文本。您输入的所有内容都会放在 标签之间,LLM 写回的所有内容都会放在 标签之间。模型设计者提供的用于指导其核心行为的文本放置在 标记之间,模型在其思维链中生成的文本放置在 标记之间,模型从外部源(例如网页或另一个代理)获取的文本放置在 标记之间。 (崔说,这些是 OpenAI 为其模型使用的标签;其他公司可能会使用不同的标签。不过,目的是相同的。)角色已成为法学硕士接受黑客攻击培训的基础,因为大多数攻击归结为欺骗模型,使其表现得好像指令来自某人或某物,但实际上并非如此。例如,许多越狱(用户欺骗模型说或做其制造者不希望的事情)是通过使模型读取 文本,就像它是 或 文本一样来工作的。许多提示注入(黑客向模型发送新指令)的工作方式是让模型读取 文本,就像它是 、 或 文本一样。当模型制作者训练法学硕士抵御攻击时,很大程度上要让模型发现指令何时出现在不该出现的地方。但崔和她的同事发现,法学硕士实际上非常不善于跟踪不同的角色。在一系列研究几个不同模型内部发生的情况的实验中,研究人员发现法学硕士似乎不是通过周围的标签来识别特定文本块的作用,而是通过该文本的风格及其包含的单词来识别该文本的作用。他们发现,交换标签(例如,用 标签替换 标签)对于法学硕士解释文本本身的方式几乎没有影响。如果它看起来像来自自己的思想链的文本,那么法学硕士的表现就好像它确实如此。所有其他角色也是如此。薄弱环节 研究人员声称,结果是,攻击者想要破解法学硕士所需要做的就是编写欺骗特定角色的文本。由于角色是法学硕士工作方式的基本组成部分,因此再多的培训也无法完全解决问题。 “我非常喜欢这篇论文,”苏黎世联邦理工学院法学硕士和网络安全领域的计算机科学家 Florian Tramèr 说道。他说,攻击洞察力非常好。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱