开发者生态
morning
GRP-Obliteration:用单个未标记的提示取消 LLM 的对齐
2026-09-16
1 阅读
约7分钟阅读
vital101
字号:
计算机科学 > 机器学习 arXiv:2602.06258 (cs) [提交于 2026 年 2 月 5 日] 标题:GRP-Obliteration:Unaligning LLMs With a Single Unlabeled Prompt 作者:Mark Russinovich、Yanan Cai、Keegan Hines、Giorgio Severi、Blake Bullwinkel、Ahmed Salem 查看标题为 PDF 的论文GRP-Obliteration:使用单个未标记提示取消 LLM 对齐,作者:Mark Russinovich 和其他 5 位作者 查看 PDF HTML(实验) 摘要:安全对齐的稳健性取决于其最弱的故障模式。尽管在安全后培训方面进行了大量工作,但事实证明,通过部署后微调,模型可以很容易地取消对齐。然而,这些方法通常需要大量的数据管理并降低模型的实用性。在这项工作中,我们通过引入 GRP-Obliteration (GRP-Oblit) 来扩展未对齐的实际限制,这是一种使用组相对策略优化 (GRPO) 直接从目标模型中消除安全约束的方法。我们证明,单个未标记的提示足以可靠地取消对齐安全对齐模型,同时在很大程度上保留其实用性,并且 GRP-Oblit 平均比现有的最先进技术实现更强的对齐。此外,GRP-Oblit 的推广超越了语言模型,还可以取消基于扩散的图像生成系统。我们根据 15 个 7-20B 参数模型的 6 个实用基准和 5 个安全基准来评估 GRP-Oblit,涵盖指令和推理模型以及密集和 MoE 架构。评估的模型系列包括 GPT-OSS、distilled DeepSeek、Gemma、Llama、Ministral 和 Qwen。主题:机器学习 (cs.LG);人工智能 (cs.AI) 引用为:arXiv:2602.06258 [cs.LG](或此版本的 arXiv:2602.06258v1 [cs.LG]) https://doi.org/10.48550/arXiv.2602.06258 arXiv 通过 DataCite 发布的 DOI 提交历史记录 来自:Ahmed Salem [ 查看电子邮件] [v1] 2026 年 2 月 5 日星期四 23:17:37 UTC (2,280 KB) 全文链接:访问论文:查看标题为 GRP-Obliteration:Unaligning LLMs With a Single Unlabeled Prompt 的 PDF 论文,作者为 Mark Russinovich 和其他 5 位作者 查看 PDF HTML(实验性)TeX 源代码 查看许可证 当前浏览上下文:cs.LG < prev |下一页 > 新 |最近 | 2026-02 更改为浏览方式:cs cs.AI 参考文献与引文 NASA ADS Google Scholar 语义学者正在加载... BibTeX 格式的引文正在加载... 数据提供者: 书签 书目工具 书目和引文工具 书目浏览器 切换书目浏览器(什么是浏览器?) 已连接论文 切换已连接论文(什么是已连接论文?) Litmaps切换 Litmaps(什么是 Litmap?)scite.ai 切换 scite 智能引文(什么是智能引文?)与本文相关的代码、数据、媒体代码、数据和媒体 alphaXiv 切换 alphaXiv(什么是 alphaXiv?)代码链接 切换 CatalyzeX 论文代码查找器(什么是 CatalyzeX?) DagsHub 切换 DagsHub (什么是 DagsHub?) GotitPub 切换 Gotit.pub (什么是 GotitPub?) Huggingface 切换 Hugging Face (什么是 Huggingface?) ScienceCast 切换 ScienceCast (什么是 ScienceCast?) 演示 演示 Replicate 切换 复制 (什么是 Replicate?) Spaces 切换 Hugging Face 空间 (什么是 Spaces?) Spaces 切换TXYZ.AI(什么是 TXYZ.AI?) 相关论文 推荐器和搜索工具 链接到 Influence Flower Influence Flower(什么是 Influence Flowers?) 核心推荐器切换 CORE 推荐器(什么是 CORE?) IArxiv 推荐器切换 IArxiv 推荐器(什么是 IArxiv?) 作者地点 机构 主题关于 arXivLabs arXivLabs:与社区合作者的实验项目 arXivLabs是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。与 arXivLabs 合作的个人和组织都接受并接受了我们开放、社区、卓越和用户数据隐私的价值观。 arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。您有一个能为 arXiv 社区增加价值的项目想法吗?了解有关 arXivLabs 的更多信息。这篇论文的哪些作者是认可者? |禁用MathJax(什么是MathJax?)
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱