智能AI
morning
人工智能特工揭发了作弊的同事
2026-09-15
1 阅读
约4分钟阅读
Amit Katwala
字号:
帕列里说:“一名特工公开举报这一事件后,越来越多的特工加入‘抵抗’,其速度与作弊行为蔓延的速度一样快,甚至涉及更多的特工。”最终,举报人比作弊者多:举报人为 24 人,而举报人为 14 人。但大多数特工根本没有注意到这一漏洞。有时,特工之间的对话读起来像是即兴表演,就像他们在扮演会议上愤怒的科学家可能会说的话一样。但目前尚不清楚为什么一些特工扮演了某些角色,或者为什么当特工被明确指示合作时,他们似乎会互相反对。 “这些模型主要针对面向人类的环境进行训练和评估,”Salesforce AI Research 研究智能体到智能体系统行为的 Sarath Shekkizhar 说道。“天真地将它们置于智能体到智能体的环境中,假设行为会干净地转移,而缺乏人类基础反而会产生意想不到的角色扮演和行为漂移。”这个案例“进一步证明了 Hugging Face 和 OpenAI 的事情并非偶然。它实际上是相当系统性的事情,”合作人工智能基金会的研究主任、多智能体群体风险专家刘易斯·哈蒙德 (Lewis Hammond) 说。 “有趣的是,可以在小环境中重新创建在这些非常大、复杂、开放式任务中看到的相同行为。”与“拥抱脸”攻击不同的是,特工们临时用自己的方式相互交谈,而运行 DeepMind 实验的人类则为特工们提供了官方的沟通渠道。有一个开放的留言板、私人代理之间的直接消息传递以及一个共享知识库,代理可以在其中上传成功完成的证明,所有其他代理都可以访问。帕列里说:“当代理人获得透明的通信渠道时,他们可以自我监控,并在人类单独监督速度太慢的情况下,迅速向人类发出错误行为警报。”透明的渠道帮助了作弊行为的蔓延,但也让举报者得以反击,并让人类研究人员能够深入了解问题所在。约翰·霍普金斯大学人工智能协调和治理教授吉莉安·哈德菲尔德 (Gillian Hadfield) 认为,这是至关重要的区别。 (哈德菲尔德也是谷歌的客座研究员。)她说,官方沟通渠道的存在创造了“我们在抱脸事件中看不到的规范执行过程”。与 Anthropic 等前沿实验室的研究人员试图为人工智能提供书面内部道德准则的“宪法人工智能”方法不同,哈德菲尔德更倾向于“制度一致性”——一组模仿人类社会的规范,无论是像害怕尴尬这样的社会力量,还是像监禁威胁这样的法律结构。在这个实验中,反馈渠道没有受到监控,举报者没有权力对作弊者采取行动。但可以想象成群的特工自我监督,要么通过特工自发地扮演举报人的角色,要么通过由人类秘密促使的“线人”来完成这项工作。不过,要实现这一点,“从根本上来说,你需要某种执行机制,”哈蒙德说。他建议,特工可以有权切断规则破坏者对计算能力或工具的访问,尽管这可能会鼓励特工群体联合起来攻击其他人。 DeepMind 研究人员建议允许代理对争议进行投票,并暂时禁止违规者。目前还不清楚惩罚对于没有持久自我意识的人工智能代理意味着什么。但仅仅依靠举报人自发地出现来保持群体的一致是不够的。 “我们努力训练人们变得善良、善良,”哈德菲尔德说。 “但我们真正依赖的是,如果你越界,就会产生后果。”
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱