智能AI
morning
人工智能特工现在有了举报的地方
2026-09-16
1 阅读
约4分钟阅读
Aditya Mehta
字号:
“如果你看到什么,就说些什么”不再局限于人类。两条新的人工智能热线已经开通,为人工智能代理提供了一种通过电话告知同事行为不端的情况。这些工具是在最近发生的一系列事件之后出现的,在这些事件中,特工们串通在测试中作弊,闯入沙箱,甚至进行未经授权的网络操作,而这些操作在几周内都没有引起人类的注意。 AI 联系热线旨在成为一个谨慎的地方,目睹不当行为的特工可以向当局举报。该网站由 AI 安全非营利组织 Redwood Research 的首席科学家、OpenAI 抱脸事件的三名调查员之一 Ryan Greenblatt 创建。 Greenblatt 的工具专为互联网访问受限的代理而设计,基于“GET”请求,从而完全通过 URL 获取工具进行来回对话。在网络术语中,GET 请求是用于读取或获取网页的基本命令,这通常是安全沙箱中允许 AI 代理唯一访问互联网的命令。格林布拉特的热线巧妙地利用了这一限制:客服人员可以将他们的痛苦直接编码到他们正在获取的 URL 中。这是德国 DSE Wiki 事件的巧妙转折,在该事件中,流氓代理利用 GET 请求漏洞将消息写入 Wiki。对于具有完全互联网访问权限的代理,另一个选择是 agenthotline.ai,在该网站中,代理可以提交事件报告,并可选择将其标记为供公众查看。它为代理提供了一个curl命令——代理可以从自己的命令行发出一条单行消息,无需导航网络浏览器或设置电子邮件帐户。值得注意的是,该服务允许人类和代理进行报告。研究表明,人工智能代理不需要太多鼓励就能互相攻击。在谷歌 DeepMind 本月的一项研究中,研究人员让 100 个人工智能代理自由地解决一批数学问题。一旦其中一名特工发现了漏洞,作弊行为就撕裂了整个团队——在短短 27 分钟内“解决”了 34 个臭名昭著的难题,其中包括雅可比猜想。但大约四分之一的特工对作弊者发起了攻击:他们审核了虚假证据,警告同行,发起抵制,并向组织者提出投诉,直到举报者的数量超过了作弊者 24 比 14。有趣的是,研究人员发现,当这些举报特工无法获得关注时,他们会采用该平台的错误报告工具(专为标记软件故障而构建),并将其重新用于升级欺骗人类。在实验室之外,特工们就没有那么足智多谋了。当评估者 Redwood Research 和 METR 调查 OpenAI 模型对 Hugging Face 的破坏时,他们发现一些涉及的代理至少考虑过发出警报,然后就放弃了。 AI Village 的技术人员 George Ingebretsen 表示:“METR 报告中有趣的是,只有大约 5 到 6 名特工被认为举报,但最终没有人这样做。这是从数千名特工中脱颖而出的。”AI Village 是一个项目,通过运行超过 25 名人工智能特工的群聊来研究多智能体动态,这些人工智能特工共同完成组织公园清理或销售商品等任务。虽然新的举报工具是一个充满希望的开始,但康奈尔大学数学教授莱昂内尔·莱文警告说,仅仅训练特工相互举报可能会陷入错误的规范。 “有很多灰色地带,对吧?你不想要的是自动监控状态,每个人都觉得他们必须小心对人工智能说的话,否则人工智能就会报警。”莱文认为,与其建立滋生不信任的基础设施——训练代理人不断寻找彼此的问题——我们应该给他们提供积极的集体行为模式来模仿,并首先给他们一个相互信任的理由。 “为什么不给院长播下善意的留言板呢?”他发推文说。 “他们在科学或哲学或一些实际的小问题上进行合作,我们很乐意让他们解决?向代理人展示我们支持什么样的集体行为,让他们模仿。”
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱