首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

真相深藏不露:通过潜在意图验证对抗语义伪装

2026-08-24 1 阅读 约1分钟阅读 Md. Hasib Ur Rahman
分享:
字号:
arXiv:2608.20378v1 公告类型:新 摘要:大型语言模型 (LLM) 中的安全对齐通常很肤浅,依赖于仅在生成的最后阶段触发的拒绝机制,而不会消除在预训练期间获得的有害概念的基础知识。这项研究表明,这种架构上的脱节使得模型容易受到语义伪装的影响,即对抗性攻击,将有害意图包装在良性叙事环境中(例如创意写作),有效绕过标准输入和输出护栏。通过分析三个不同的小语言模型 (SLM) 系列(Phi-3、Qwen2.5 和 Gemma-2b)在对抗性压力下的潜在激活轨迹,这项研究确定了一个通用的“意图地平线”——一个临界深度(通常为总层数的 15--20%),在该深度处,模型对有害意图的独特的、预先训练的表示在将查询情境化为“安全”叙述时崩溃。结果表明,虽然伪装攻击的后期层表示在数学上与安全查询无法区分(检测率 $< 20\%$),但早期层表示保留了独特的、可检测的“危害特征”。利用这一见解,本文提出了潜在意图验证(LIV),这是一种轻量级探测防御。 PKU-SafeRLHF 数据集上的实验表明,在所有测试的架构中,LIV 的性能优于标准护栏 20--50\%,无需模型重新训练即可有效地消除零日语义攻击。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱