智能AI
morning
性能、效率与崩溃——Code LLM离线后培训的优势与挑战
2026-09-15
1 阅读
约1分钟阅读
Abhinav Anand, Sanjana Reddy Pachika, Shweta Verma, Mira Mezini
字号:
arXiv:2609.11956v1 公告类型:新 摘要:强化学习 (RL) 后训练是代码生成大型语言模型 (LLM) 开发的关键阶段,因为它确保遵守指令并生成功能正确的代码。此过程通常需要从基于 Transformer 的 LLM 生成计算密集型代码样本,以及用于序列验证的大量 GPU-CPU 通信。为了解决这些计算挑战,这项工作研究了是否可以通过利用现有数据集而不是生成新样本来完全离线执行基于强化学习的后训练。研究结果表明,只需几个小时的训练,LLM 的零样本代码生成性能就可以在无需在线采样的情况下得到显着提高。此外,离线强化学习在 0.5B 到 7B 参数范围内的模型中产生了性能提升,尽管改进的程度因模型系列而异。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱