智能AI
morning
GEOSTEER:大型语言模型中激活引导的测地线优化
摘要
arXiv:2609.10658v1 Announce Type: new Abstract: Activation steering provides a lightweight way to control large language models (LLMs) by modifying their hidden activations at inference time. Among th...
steering
norm
the
activation
and
preserving
GeoSteer
activations
step
optimization
2026-09-12
1 阅读
约1分钟阅读
Xuan Cuong Ngo, Hao Vo, Ngan Le
字号:
arXiv:2609.10658v1 公告类型:新 摘要:激活控制提供了一种通过在推理时修改其隐藏激活来控制大型语言模型 (LLM) 的轻量级方法。在这些方法中,规范保持引导旨在在不改变激活规范的情况下改变模型行为,从而降低表示崩溃和退化的风险。然而,现有的范数保持方法受到预定义的转向轨迹及其对一步更新的依赖的限制,这可能无法捕获激活分布的复杂结构。我们提出了 GeoSteer,一种基于优化的方法,用于保持规范的激活控制。 GeoSteer 将转向表述为黎曼优化问题,并通过表示流形上的一系列小测地线步骤更新激活。为了避免固定的转向方向,GeoSteer 学习一个非线性激活空间目标,该目标区分所需激活和不需要的激活,并使用此函数自适应地引导每个转向步骤。这种多步公式可产生更平滑、更稳定和更一致的转向行为,同时保留激活范数。在 TruthfulQA、RealToxicityPrompts 和 UltraFeedback 基准测试中,GeoSteer 持续改进最先进的激活转向基线。这些结果表明,通过用自适应、几何感知优化替换预定义的一步编辑,可以使保持规范的转向更加有效。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱