首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

语言模型的安全纠错:具有能力保留的冻结基调整

摘要

arXiv:2609.16145v1 Announce Type: new Abstract: We study a practical question: can a small correction module fix errors in a frozen language model's outputs without degrading its base capabilities? We...

correction the logit module model base only frozen CRN and
2026-09-17 1 阅读 约2分钟阅读 Gautam Kishore
分享:
字号:
arXiv:2609.16145v1 公告类型:新 摘要:我们研究一个实际问题:一个小型校正模块能否在不降低其基本功能的情况下修复冻结语言模型输出中的错误?我们提出了 CRN v2,一个轻量级的 logit 级校正模块(约 34M 可训练参数,4.65B 文本模块的 0.73%),位于完全冻结的 Gemma 4 E2B 模型之上。基础模型永远不会更新;只有校正模块通过监督微调进行学习,然后对 83,400 个纠错对进行无参考 DPO。在 60 个问题的领域考试(CEHRI:认证的人类机器人智能,涵盖事实、算术和隐式目标推理)中,CRN v2 纠正了 53.3% 的基本模型错误(改写变体:43.3%),同时在测试的能力基准上没有出现任何退化(MMLU/BoolQ N=200;洗车 N=8)。 LoRA 基线在匹配的 CRN v1 预算(660 万参数,排名 19)下实现了 83.3% 的校正,但在相同的基准上遭受了 30-75% 的能力损失——校正能力权衡。消融表明 KL 保留项 (lambda=0.1) 至关重要:将其降低到 0.01 会将校正降低到 35.0%。早期层的隐藏状态注入变体(1.6M 参数,仅 SFT)达到 50.0%/55.8%,但不超过 logit 校正;较浅注入(第 4 层)下降至 30.0%/28.3%;多深度logit校正(~35M)仅达到40%;更长的训练(5,000 SFT + 2,000 DPO)保持在 53.3%——我们测试的替代配置没有一个超过排名 128 Logit 结果,与 ~53% 的最佳结果一致,而不是下限。这是对设计原理(冻结底座+logit校正+KL锚定)的研究,而不是建筑新颖性的主张。所有代码、主要结果权重和评估脚本均已发布(深度变体仅作为代码 - 没有经过训练的深度检查点)。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱