首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

NeuronFuzz:用于法学硕士安全评估的安全神经元引导模糊测试

摘要

arXiv:2608.26222v1 Announce Type: new Abstract: Safety evaluation is critical for assessing whether aligned Large Language Models (LLMs) remain robust against jailbreak attacks. Existing automated tes...

and safety models the NeuronFuzz for response feedback fuzzing harmful
2026-08-28 1 阅读 约2分钟阅读 Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu
分享:
字号:
arXiv:2608.26222v1 公告类型:新 摘要:安全评估对于评估一致的大型语言模型 (LLM) 是否仍能抵御越狱攻击至关重要。然而,现有的自动化测试方法在很大程度上依赖于响应级别的反馈:每个候选提示通常需要生成目标模型响应来评估其攻击有效性。这个过程成本高昂,更重要的是,它只为强一致性模型提供稀疏的指导,其中大多数候选者都会因相同的失败结果而被拒绝。本文介绍了 NeuronFuzz,这是一种白盒模糊框架,利用内部安全神经元作为 LLM 安全评估的连续执行反馈。 SafetyOracle 将安全神经元激活转换为连续的安全警报分数,作为模糊测试的反馈,并且可以在预填充期间获得,从而消除了模糊测试循环中的响应生成。为了构建 SafetyOracle,NeuronFuzz 使用模板不变的有害和良性输入以及稳定性感知选择来识别一组紧凑的安全神经元,其激活捕获有害意图识别。此外,由于安全警报分数是可微分的,NeuronFuzz 使用其梯度来识别安全敏感的模板位置,并使用掩码语言模型来生成流畅的、上下文兼容的突变,同时保留原始的有害负载并避免额外的优化变量。我们评估了 21 个文本和多模态模型的 NeuronFuzz。在五个白盒源模型中,它实现了 76-100% 的越狱发现率,比基线高出高达 48 个百分点。其优化模板进一步将零样本转移到开放重量和六个专有目标模型,实现平均 ASR 和 top-5 集成 ASR (EASR) 分别为 69.6%/92.6% 和 44.1%/60.0%。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱