首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

COPE:通过用户嵌入和自我评估在稀疏用户反馈下持续个性化法学硕士

摘要

arXiv:2609.26853v1 Announce Type: new Abstract: While Large Language Models (LLMs) have achieved remarkable results across various benchmarks, their alignment with normative values often results in ho...

and training user self with optimization COPE feedback evaluation results
2026-09-24 1 阅读 约1分钟阅读 Ruike Cao, Fugen Yao, Liang Dong, Jian Xu, Guanjun Jiang, Li Xiao
分享:
字号:
arXiv:2609.26853v1 公告类型:新 摘要:虽然大型语言模型 (LLM) 在各种基准测试中取得了显着的成果,但它们与规范值的一致性往往会导致同质化的响应,无法满足不同的用户偏好。现有的免训练方法通常通过即时工程占据宝贵的上下文窗口,而基于训练的方法通常在训练后保持静态,无法支持现实环境中所需的持续优化。为了应对这些挑战,我们提出了 COPE(带有个性化嵌入和自我评估的持续优化),这是一种新颖的优化框架,专为具有稀疏用户反馈的现实世界驱动的交互设置而定制。我们的框架为每个用户分配可学习的个性化嵌入,并在单个更新步骤中协同集成偏好捕获、自我评估校准和个性化响应优化。我们方法的一个关键创新是使用自我评估来生成代理奖励,即使在无法获得明确的用户反馈的情况下也能实现持续的模型更新。实验表明,COPE 在稀疏反馈下始终优于强大的无训练和基于训练的基线,并且仍然是检索增强提示 (RAP) 的补充。进一步的分析证实了 COPE 可靠的自我评估、有意义的偏好模式、稳定的一般能力以及在偏好变化和替代评估者下的稳健性。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱