首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

GEOSTEER:大型语言模型中激活引导的测地线优化

摘要

arXiv:2609.10658v1 Announce Type: new Abstract: Activation steering provides a lightweight way to control large language models (LLMs) by modifying their hidden activations at inference time. Among th...

steering norm the activation and preserving GeoSteer activations step optimization
2026-09-12 1 阅读 约1分钟阅读 Xuan Cuong Ngo, Hao Vo, Ngan Le
分享:
字号:
arXiv:2609.10658v1 公告类型:新 摘要:激活控制提供了一种通过在推理时修改其隐藏激活来控制大型语言模型 (LLM) 的轻量级方法。在这些方法中,规范保持引导旨在在不改变激活规范的情况下改变模型行为,从而降低表示崩溃和退化的风险。然而,现有的范数保持方法受到预定义的转向轨迹及其对一步更新的依赖的限制,这可能无法捕获激活分布的复杂结构。我们提出了 GeoSteer,一种基于优化的方法,用于保持规范的激活控制。 GeoSteer 将转向表述为黎曼优化问题,并通过表示流形上的一系列小测地线步骤更新激活。为了避免固定的转向方向,GeoSteer 学习一个非线性激活空间目标,该目标区分所需激活和不需要的激活,并使用此函数自适应地引导每个转向步骤。这种多步公式可产生更平滑、更稳定和更一致的转向行为,同时保留激活范数。在 TruthfulQA、RealToxicityPrompts 和 UltraFeedback 基准测试中,GeoSteer 持续改进最先进的激活转向基线。这些结果表明,通过用自适应、几何感知优化替换预定义的一步编辑,可以使保持规范的转向更加有效。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱