智能AI
morning
多法学硕士代理系统的动态治理以实现协作对话结果
摘要
arXiv:2608.11207v1 Announce Type: new Abstract: When two LLM agents with structurally opposed objectives interact across multiple turns, the absence of a shared goal function produces not competition ...
the
LLM
that
visitor
and
for
with
not
agent
governance
2026-08-13
1 阅读
约1分钟阅读
Alexander Liss, Nicholas Desmond, Santiago Gil Gallego
字号:
arXiv:2608.11207v1 公告类型:新 摘要:当两个具有结构性相反目标的 LLM 代理在多个回合中进行交互时,共享目标函数的缺乏不会产生竞争,而是导致崩溃:访问者投降,站点代理停止改变其方法,并且对话在没有实现任一代理的既定目标的情况下终止。本文询问控制理论治理层是否可以替代缺失的目标函数。体验协调器 (EO) 在模拟的金融服务环境中解决了这个问题,其中站点代理引导访问者联系顾问,同时访问者保持心理上的现实抵抗。 EO 通过三种机制控制联合轨迹:上下文强盗 (CB),选择从现实世界的网络分析中校准的内容臂;PID 控制器,通过动态模式约束强制执行行为一致性;POMDP 信念跟踪器,维护访问者意图的概率模型。在 60,000 次模拟中,EO 在高意图顾问联系率方面实现了 +32 个百分点的提升(78.1% vs. 46.1%),CB 变体选择占因素间结果差异的 97%,这证实了治理政策,而不是环境初始条件,决定了轨迹的最终结果。角色层面的分析揭示了两种不同的制度:对于没有自然转换倾向的访问者,治理层是功能性系统和非功能性系统之间的区别;对于已经接近一致的访问者来说,天真的法学硕士的同理心默认值基本上就足够了。所有发现均以法学硕士到法学硕士模拟为条件。 PID 控制器尚未针对人类真实的不可预测性进行校准,下一步关键是在实时流量上验证 EO。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱