首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

前向传播域适应(无跨层反向传播)

摘要

arXiv:2608.14563v1 Announce Type: new Abstract: Forward-Pass-Only MLP training (FPO) adapts large language models without a backward pass through the model body, achieving 2.7--3.2x the throughput of ...

FPO the layer and model layers training models fine tuning
2026-08-18 1 阅读 约1分钟阅读 Rivaan Patil, Simon Dennis, Hao Guo, Kevin Shabahang
分享:
字号:
arXiv:2608.14563v1 公告类型:新 摘要:仅前向传递 MLP 训练 (FPO) 无需向后传递模型主体即可适应大型语言模型,以约 40% 的峰值训练内存实现标准微调吞吐量的 2.7--3.2 倍,同时将域外基准保留在基线的种子噪声内,这是全网络微调无法可靠再现的属性。 FPO 依赖于单一的经验观察:在 Transformer 的后期层,输出层预测误差在我们调查的六个公共模型中以余弦相似度 0.47--0.59 逼近真实梯度。我们引入了一个两分钟的诊断,可以量化任何模型每层的近似值,从而确定后期层适应的可行性。根据诊断信息,FPO 在输出处计算单个误差信号,并将其应用到每个目标层。层与层之间没有信号传播,并且在任何点都不会构建自动梯度图。我们在三个模型系列(OLMo-2-7B、Qwen3-8B、Falcon3-7B)上评估 FPO。在这三者中,FPO 都产生了域内困惑度的改善,并将 MMLU、ARC-Challenge、HellaSwag 和 Winogrande 留在基线的种子噪声范围内。将 SFT 本地化到 FPO 的目标层以进入该状态也是可行的,但成本是 FPO 的 2.2 倍。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱