智能AI
morning
失重微调:通过 Logit-Space Transport 个性化法学硕士
摘要
arXiv:2608.11342v1 Announce Type: new Abstract: Supervised fine-tuning (SFT) is a standard approach for adapting LLMs to a target distribution, but in settings such as personalization, where each auth...
the
WFT
SFT
and
personalization
author
weight
training
that
distributional
2026-08-13
1 阅读
约1分钟阅读
Bohan Zhang, Anqi Ni, Yixin Wang, Paramveer S. Dhillon
字号:
arXiv:2608.11342v1 公告类型:新 摘要:监督微调(SFT)是使 LLM 适应目标分布的标准方法,但在个性化等设置中,每个作者都需要单独的权重访问、优化、存储和再训练,其成本变得令人望而却步。我们提出了无权微调(WFT),这是一种无需训练的解码时间方法,可以在没有权重更新的情况下近似 SFT 的分布效果。 WFT 计算作者训练序列的监督残差,并通过根据 dropout 引起的互协方差估计的交叉前缀传输算子将其传输到当前提示。该算子捕获一个上下文中的扰动如何传播到另一上下文中的预测,用对数空间校正替换基于梯度的参数更新。在三个 LaMP 个性化基准上,WFT 在整个数据集上实现了最佳平均性能,在单个任务上匹配或超过了 SFT,并且平均优于其他轻量级基准。在预算控制比较中,WFT 使用不到 7% 的有效计算来接近 SFT 性能。 Logit 水平分析显示,WFT 和 SFT 引起的 logit 偏移之间的余弦相似度为 0.875,超过了下一个标记概率质量的 95%,这表明 WFT 在不修改模型权重的情况下捕获了监督适应的分布效应。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱