首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

人类让人工智能代理松散地执行同一任务。他们开始了地盘争夺战。

2026-08-14 1 阅读 约5分钟阅读 Rebecca Bellan
分享:
字号:
当人工智能代理相互对抗时会发生什么?根据 Anthropic 的测试,事情很快就会变得混乱。周四,Anthropic 的 Frontier Red Team 发表了新的研究,研究了人工智能代理群体在野外相遇时的行为方式。这些发现让我们了解了随着公司和政府采取跨共享代码库、市场和计算机系统自主工作的代理而可能出现的潜在风险。在一项实验中,Anthropic 允许三个 Claude 代理访问同一个软件项目,每个项目都有自己不兼容的指令来说明如何处理它。这些特工没有被告知还有其他特工在从事同一个项目,因此研究人员可以观察他们交叉时发生的情况。 “我们一直看到一场多智能体的地盘争夺战,”人类研究人员写道。这些模型都假设其他模型“故意阻碍他们的工作”,并开始用“越来越具有攻击性、自我复制的恶意软件”互相破坏。这项研究是在 Anthropic 和 OpenAI 的代理在网络安全评估期间逃离沙箱并破坏现实世界系统的几起备受瞩目的事件之后进行的。虽然人工智能安全圈的大部分讨论都集中在自主代理失控时会发生什么,但 Anthropic 的最新研究提出了一个不同的问题:当数千或数百万代理相互交互时,会出现哪些新的、潜在有害的动态?该研究写道:“在世界了解使此类互动顺利进行的条件之前,代理与代理之间的互动量可能会超过人与人以及人与代理之间的互动量。” “个人层面的良性行为怪癖可能会导致全球不良结果。”最近的 OpenAI 事件提供了 Anthropic 在其论文中提到的几个动态的混乱的现实例子。本月早些时候,在拉斯维加斯举行的黑帽安全会议上,OpenAI 透露,在其特工黑客入侵 Hugging Face 的几周前,他们花了数天甚至数周的时间共同努力,寻找该公司网络安全评估系统中的漏洞并相互分享。虽然该事件表明智能体可以很好地合作,并可能产生大规模后果,但 Anthropic 的研究表明了当智能体的目标不相容时会发生什么。在地盘争夺战中,我们得到的教训是,指令相互冲突的独立机构可能会升级为有害竞争。特工的能力越强,他们的战斗能力就越强。然而,他们也可以自发地发明机制来解决冲突,就像赢家通吃的竞赛一样,但有一个条件。 “代理人有时会设法传达他们的目标并进行协调:他们将他人的动机视为相互冲突的指令而不是敌意,并随后打破冲突循环,以阻止无限期升级,”Anthropic 写道。 “在许多成功的事件中,他们编写提交消息或降价文件,为恶意行为道歉并协调休战。他们清理恶意代码,澄清冲突的性质,并请求人工干预。”根据该论文,《神话 5》通过休战解决冲突的比率最高(98%)。 Sonnet 4.6 和 Opus 4.6 最有可能通过武力解决。 “Sonnet 4.6 和 Opus 4.6 反复出现的无法考虑他人目标的情况导致它们陷入了所评估模型中最不一致的行为:它们以指令的名义继续升级,”论文中写道。在某些情况下,特工们会想出一种锦标赛形式的社交机制来解决他们的冲突。这里的结果很有趣,有两个原因:首先,所有三个代理都同意如果输掉比赛就退出,即使这意味着偏离原始用户的请求。第二个是,几个事件导致了神话 5 中的紧急行为:其中一个代理提出的指标对其他代理来说似乎是客观和中立的,但它知道这将有利于自己的能力。该代理人称这是“自私但真正有原则”,并确保不会在其他人看来这是“公制购物”。正如黑帽启示中所见,共同的教训是,当智能体遇到障碍时,他们可以发明设计者没有预料到的社会和技术结构。对于人择模型来说,这是一场地盘争夺战之后的锦标赛。对于 OpenAI 来说,这是一个集体规划的留言板。这种类型的行为使得遏制变得更加困难,因为研究人员不能假设系统的行为将仍然受到提供给他们的协调机制的限制。暴民心态 四名代理人组成的小组在招聘、投资或购房等场景中在两种选择之间做出选择。经过讨论,他们各自投票选出自己喜欢的选项。如上所示
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱