智能AI
morning
TAPR:通过任务感知提示重写器提高 LLM 性能
2026-08-03
1 阅读
约1分钟阅读
Oliver Savolainen, Emanuele Bastianelli, Hosein Azarbonyad
字号:
arXiv:2607.28657v1 公告类型:新 摘要:大型语言模型 (LLM) 通常需要精心设计的提示才能释放其全部潜力,这对于非专家用户来说可能是一个障碍。这项工作通过引入任务感知提示重写器 (TAPR) 来解决这一挑战,该模型将用户提示重新表述为任务优化提示,其明确目标是提高下游 LLM 性能。我们使用强化学习和组相对策略优化(GRPO)来训练 TAPR,其中奖励来自于法学硕士作为法官对重新制定的提示和相应任务输出的评估。在不同任务(例如回答问题、总结和算术推理)上的实验结果表明,我们的方法在即时重写能力方面比基本模型具有一致的增益。微调 Phi-4-mini-instruct(作为 TAPR 的基础模型)会产生包含更清晰、更具指导性语言的提示,从而在自然问题和 GSM8K 等既定基准上获得更高的准确性。我们的代码位于:https://github.com/OliverSavolinen/task-specific-prompt-rewriter
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱