智能AI
morning
不断发展的角色扮演代理的对抗性闭环课程
摘要
arXiv:2609.28609v1 Announce Type: new Abstract: Role-playing agents based on large language models have been widely applied in areas such as personalized assistance and social simulation. Recent RL me...
the
and
that
playing
scenario
AdvRole
role
Actor
new
pool
2026-09-25
1 阅读
约1分钟阅读
Zheng Zhang, Liu Liu, Qi Chai, Deheng Ye, Peilin Zhao, Mao Zheng, Hao Wang
字号:
arXiv:2609.28609v1 发布类型:新增 摘要:基于大语言模型的角色扮演智能体已广泛应用于个性化援助、社交模拟等领域。最近的强化学习方法通常在学习开始之前收集的固定场景池上进行训练。这造成了分布瓶颈:随着代理的改进,其表现不佳的场景也会发生变化,而训练分布保持不变。因此,我们提出了 AdvRole,一种对抗性上下文重写框架,可将角色扮演强化学习转变为闭环课程。 AdvRole 在学习角色扮演的 Actor 和将角色配置文件和对话上下文编辑为特定于演员的困难场景的 Rewriter 之间交替。重写器接受了性能差距奖励的训练,这有利于重写,从而降低当前演员相对于原始场景的分数。因此,场景池随着演员的发展而不断发展,并不断瞄准角色上下文空间中未掌握的区域。对涵盖英语和中文的三个角色扮演基准以及我们发布的新多语言基准的实验表明,AdvRole 始终优于基准。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱