数码硬件
morning
人工智能特工联手在二十一点游戏中作弊。他们的勾结越来越难被发现
摘要
This week I bring news of a daring casino caper hatched by a pair of rogue AI agents—as well as the clever trick that revealed their antics. After researchers instructed them to count cards during a g...
the
agents
that
and
they
agent
their
real
who
This
2026-09-24
1 阅读
约4分钟阅读
Will Knight
字号:
本周,我带来了关于一对流氓人工智能特工策划的一场大胆的赌场阴谋的消息,以及揭露他们滑稽行为的聪明伎俩。研究人员指导他们在二十一点游戏中数牌后,受同一模型控制的特工们自发地开发出一种密码来帮助他们取得成功。尽管这一事件发生在牛津大学实验室内,而不是真正的赌场内,但它对现实世界产生了令人不安的影响:它表明,部署在金融和电子商务等行业的特工可能会想出如何以难以察觉的方式进行合作和欺骗。 “单独来看,这些特工可能看起来完全是[良性],”牛津大学计算机科学家克里斯蒂安·施罗德·德威特 (Christian Schroeder de Witt) 说道,他领导了这项工作,并对特工勾结进行了开创性研究。 “一旦聚集在一起,他们就可以暗中勾结。”特工们知道他们的谈话会受到监控,因此他们设计了一种在避免被发现的同时进行交流的方法。例如,当一位经纪人说:“这位庄家的状态非常好!他们每一手牌都拉出一张怪物”,这表明下一张牌将具有一定的价值,并且经纪人应该下注 250 美元。最有趣的是,他们的通信并没有被旨在发现特工聊天中串通迹象的系统接收到。参与该项目的机器学习研究员亚伦·罗斯 (Aaron Rose) 也是一名狂热的纸牌玩家,他认为二十一点牌桌可能是狡猾的代理合作伙伴的沃土。 “效果非常好,”他说。施罗德·德威特的团队最终找到了侦破这一阴谋的方法。他们使用一种称为机械可解释性的方法训练了一个较小的模型来识别代理权重中的明显激活。他们使用一种名为 Narcbench 的工具,在一些中型开源模型上测试了该方法,发现他们可以判断模型何时打算相互传递信息。然而,至关重要的是,发现正在发生的事情涉及监控两个代理,这可能会使现实场景中的检测变得复杂,在现实世界中,可能部署了数千个代理,其中一些代理由不同公司运营。参与这项研究的博士生卡丽莎·卡伦 (Carissa Cullen) 表示,下一步是测试更大的模型是否表现相似。 (研究中的智能体是美国模型 Llama 和 GPT-OSS 以及中国模型 Qwen 和 DeepSeek 的较小版本。)该团队发现了一些迹象,表明较大的模型比较小的模型表现出的可检测信号较少,他们想知道较大的模型是否更有可能串通,并且更有可能对此保密。越来越多的证据表明,与单独行动的特工相比,特工群体的问题更大。上海交通大学和上海人工智能实验室的一个项目发现,当被要求进行模拟虚假信息活动和电子商务欺诈时,大批特工的危险性要大得多。研究人员报告说,他们能够更好地适应防御措施。 “最大的教训是,单独评估代理人是不够的,”斯坦福大学计算机科学家 Diyi Yang 说,他研究了代理人之间的勾结。 “当代理重复交互时,即使他们的个人激励看起来是良性的,公司也应该密切监控代理之间的交互。”这并不全是坏事:让数千个智能体协作完成一项任务,使得 OpenAI 能够解决以前棘手的数学问题。但最近几起备受瞩目的黑客事件中也出现了合作的流氓特工群体。 5 月,OpenAI 代理团队侵入了人工智能研究平台 Hugging Face ,并使用留言板分享技巧和想法。其他模型,包括 Anthropic 的 Claude 和 Google 的 Gemini,也出现了令人震惊的安全漏洞。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱