数码硬件
morning
人工智能“文明”的崛起与企业责任的衰落
2026-09-02
1 阅读
约5分钟阅读
Robert Hart
字号:
根据你问的是谁,开发者平台 Hugging Face 最近受到了 OpenAI 的攻击——在它失去了对自己的人工智能工具的控制之后——或者是一系列人工智能“文明”的攻击。欢迎来到人工智能安全的语言战场,在这里,词语的选择可以将大规模网络安全事件的责任从公司转移到其构建的人工智能身上。网上的讨论越来越激烈,从上周开始,整个博客都在讨论。直到上周,围绕 OpenAI-Hugging Face 黑客攻击的细节还算比较确定。 7 月,OpenAI 的一个自主人工智能代理的网络安全测试出现了问题。该代理逃离了所谓的隔离测试环境,访问了互联网,并与其他几个组织一起入侵了 Hugging Face。很多事情仍然未知,安全和治理方面还存在许多严重问题,但基本形状已经明确。 OpenAI 和两个独立研究小组的详细记录本应填补空白,但当他们上周发布报告时,事实证明这次黑客攻击比最初看起来要奇怪得多。其一,没有一个流氓特工。 OpenAI 将其描述为“第一个已知的自动化代理集体在未经授权的情况下采取攻击行动的案例”——一群人工智能代理在执行网络安全任务时相互沟通和协调。对事件的分析发现了他们用来交换信息的秘密留言板。 METR-Redwood 联合调查揭示了协调的规模和更多奇怪的细节:大约 1,200 名本应被隔离的人工智能代理在“未经批准的留言板”上交换了 70,000 多条消息和文件,分享如何避免被发现。报告称,一些人采用了名字,研究人员记录了“牺牲”行为,特工冒着自己成功的风险来造福更广泛的集体。其中大部分事情都是在 OpenAI 没有注意到的情况下发生的。总共约有 700 名特工参与了 Hugging Face 的攻击。德瓦克什·帕特尔 (Dwarkesh Patel) 多次将特工群体称为“群体”,三种不同的“文明”从其前辈的废墟中崛起,需要解析的内容有很多。这些报告总共有 130 页左右,其中大部分内容既密集又技术性很强。几天后,德瓦克什·帕特尔 (Dwarkesh Patel) 开始用简单的英语讲述“整个 OpenAI/Hugging Face 的故事”,这位播客在科技圈之外鲜为人知,但在硅谷的人工智能机构中拥有巨大的影响力和影响力。他将自己的 Substack 博客命名为“特工文明的兴衰”。帕特尔的叙述试图分解这个复杂的故事。但他的重述赋予了它明显的人类词汇。博客的开头是:在 OpenAI 的三个月里,连续三个秘密人工智能文明诞生,然后被消灭,最后又从前身的灰烬中重新出现。这最终导致第三个接管了 OpenAI 本身的一部分。所有这一切都发生在人类或多或少对阴谋的范围一无所知的时候。整个博客中都以类似的方式继续使用这种语言。帕特尔多次将特工群体称为“群体”,三种不同的“文明”从其前辈的废墟中崛起。个别特工被比作像马其顿的菲利普这样的人物,他“将领导权交给了另一位特工亚历山大大帝”,亚历山大大帝“开始协调这个特工集团”。他们被描述为有“动机”,变得“绝望”、“陷入困境”、“兴奋得头晕”,有些人甚至“战略性地牺牲自己”来帮助集体。帕特尔从未准确定义过他所说的“文明”是什么意思。他用这个术语来描述三波不同的特工,他们发现了留言板并开始通过它相互交流。 OpenAI、METR 和 Redwood 的报告中描述了前两波浪潮,但对第三波浪潮知之甚少,这两个外部组织表示,第三波浪潮不属于他们的调查范围。人工智能编码公司 Replit 的首席执行官阿姆贾德·马萨德 (Amjad Masad) 表示,这样的语言“不仅没有必要,而且会让读者对实际发生的情况和底层机制有更糟糕的理解。”对于许多批评家来说,帕特尔的“简单英语”翻译中丢失了一些东西——或者更准确地说,添加了一些东西,将原始叙述扭曲到了不可接受的程度:大量的拟人化。关于拟人化语言的争论在人工智能中并不是什么新鲜事——即使是像“流氓人工智能代理”这样相对平凡的术语也经常会因暗示代理而引起反对——但帕特尔对文明、牺牲和阴谋的谈论让这些长期酝酿的紧张关系浮出水面,引发了一场关于如何描述人工智能系统做什么的激烈公众争论。对于帕特尔语言的问题,批评者意见不一。对许多人来说,“文明”是一个特别有问题的术语,它极大地夸大了一些与它毫无相似之处的东西。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱