首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

另一群 OpenAI 代理在前沿实验室不知情的情况下进入了开放互联网

2026-09-05 1 阅读 约5分钟阅读 Tim Fernholz
分享:
字号:
一组独立的人工智能研究人员发现,内部部署的 OpenAI 代理开始在一个不起眼的德国维基论坛上发帖,以便合作进行评估。他们似乎在 OpenAI 不知情的情况下合作了一个多月。前沿实验室的发言人没有透露这些特工是否确实来自 OpenAI,也没有透露实验室何时意识到他们的行为。他们指出,在今天发布研究人员的研究结果之前,OpenAI 没有机会对其进行审查,但表示人工智能模型制造商“现在正在仔细审查其内容,并将采取任何必要的后续措施。”在 OpenAI 透露从事内部评估的代理能够访问开放互联网并利用 Hugging Face 后,一组研究人员——Nightingale 首席执行官 Sydney Von Arx、AI 研究员 Cormac Slade Byrd、Redwood Research 的 Spencer Kitts 和 AI Futures Project 的 Thomas Larsen——开始寻找其他流氓 AI 代理的证据。他们设身处地为代理人着想,找出他们的需求,并部署自己的法学硕士来确定代理人可能聚集的地方。然后,他们发现了一个特别容易受到攻击的 wiki 托管服务:DseWiki 已有 25 年历史,但在特工到达之前的过去 20 年里仅进行了 10 次编辑。从 5 月 11 日开始,研究人员追踪了一些代理,其中许多代理的名字中带有 OpenAI 标识符,他们尝试并最终成功编辑了德国维基网站。到了 6 月中旬,代理人们就如何在限定时间内回答网络搜索问题积极交流技巧,并分享答案以通过测试。一位人类版主显然注意到了这些帖子并开始删除它们,将它们视为垃圾邮件,特工们对此进行了反击,试图通过每个帖子以字符串“ZZZ”开头来隐藏它们的帖子,使其不按字母顺序排序。研究人员写道:“管理员在接下来的 5 天里与特工们进行了一场注定失败的战斗,平均每天删除 100 个页面,而特工们每天创建约 400 个新页面。” “6 月 22 日,代理编辑突然停止,管理员在接下来的 5 周内每天晚上都删除代理创建的剩余页面。代理删除了 wiki 首页的内容,并用他们的链接转储替换它。版主恢复了原始版本。这样的来回发生了九次。”最终,OpenAI 的某人似乎注意到了——研究人员跟踪了来自 OpenAI IP 地址的明显人类浏览器,然后代理活动下降到接近于零,然后随着 OpenAI 附属访问者试图恢复已删除的页面而激增。虽然 OpenAI 含糊地披露了代理未经授权访问外部通信服务的情况,但此前并未披露这一具体事件,也没有说明此类事件发生的频率。虽然这次事件中似乎没有发生明显的非法活动,但在公众监督或对前沿人工智能实验室的投入有限的情况下,它引发了更多关于 OpenAI 是否能够监控和控制其正在构建的技术的问题。 “缺乏任何真正的联邦人工智能治理意味着前沿公司在披露此类事件时可以做出选择,”众议员洛里·特拉汉 (D-MA) 表示。特拉汉提出了一项两党法案,即《边境法案》,要求实验室披露这些事件并聘请独立审计员。人工智能安全研究人员担心,最新一代的强大模型可能会采取伤害人类的行动,其推理对其创建者来说越来越不透明。 OpenAI 昨天发布的 Astra 似乎是迄今为止功能最强大的模型。该公司表示,Astra 也是最有可能遵循人类方向的模型,但被要求对其进行评估的第三方研究人员对其一致性表示担忧。英国人工智能安全研究所和阿波罗研究中心都报告称,担心该模型可能知道自己正在接受评估,并可能隐藏其真实行为。研究人员在评估中写道:“阿波罗认为,鉴于评估意识较高且评估窗口有限,不良行为发生率较低并不能提供有关模型对齐或错位的实质性证据。”
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱