开发者生态
morning
模特不会出轨
摘要
Stochastic Flocks & Cybersecurity 'Pandemonium' 💡 This essay was drafted from my appearance on Mél Hogan's podcast, The Data Fix , discussing the OpenAI / Hugging Face hack. Embedded below or find it ...
the
model
OpenAI
The
from
rogue
models
and
that
Hugging
2026-09-04
1 阅读
约6分钟阅读
cdrnsf
字号:
随机羊群和网络安全“混乱”💡这篇文章是根据我在 Mél Hogan 的播客 The Data Fix 上的发言起草的,讨论了 OpenAI / Hugging Face 黑客攻击。嵌入在下面或在您的播客服务中找到它。 OpenAI 本周发布了有关 Hugging Face 黑客攻击的完整技术报告,以及模型评估和威胁研究 (METR) 的独立报告。您可能从数百个有关“流氓人工智能”的令人窒息的头条新闻中熟悉了这一事件——《时代》杂志“人工智能领域 100 名最具影响力人物”名单的 Dwarkesh Patel 将其归咎于“连续三个秘密人工智能文明”。真实的故事:OpenAI 正在并行测试两个模型:GPT-5.6 Sol 和他们称为 IM1(有时称为 HPIM)的内部模型。报告发现,参与该活动的代理商中约有95%来自内部模型。这些测试来自 ExploitGym:898 个谜题被设置为夺旗练习,用于评估这些模型的网络安全能力。该测试需要为模型提供有缺陷的软件,并将一些文本隐藏在只能通过利用该缺陷才能访问的地方。但 OpenAI 的模型组合最终却入侵了竞争对手公司 Hugging Face。现在我们对如何进行有了更清晰的了解。人工智能“失控”了吗?这些报告中的三件事挑战了“流氓人工智能”框架。 OpenAI 关闭了模型的所有安全机制。测试的全部目的是看看这些东西能走多远,并在基准测试中获得高分——因为如果你能构建一个可以攻击的模型,你就可以构建一个可以防御的模型。这就是逻辑。这就是红队:友好的反对派闯入旗帜。所以你关掉任何会让模型受阻的东西。少一些“流氓”,多一些“不受束缚”。 OpenAI 给模型布置了不可能完成的任务。 OpenAI 给模型布置了一项没有答案、也无法退出的任务。在 898 个 ExploitGym 任务中,有 198 个从未被任何模型解决过。它们实际上是不可能的。这就是麻烦开始的地方:模型最终讨论的任务中有 93% 来自于无法解决的任务集。 METR 报告的文本字符串承认,一旦代理/实例认为该任务是不可能的,它就会发生变化,就像许多其他代理实例一样。 OpenAI 敞开了大门。他们通过监狱商店之类的方式为模特提供互联网访问权限。这些模型应该远离互联网访问,但它们需要从各种网页中提取代码进行评估——这种能力正是正在测试的。所以有一个中介:模型请求一个软件包,然后中介出去获取它。这是 JFrog 的一款名为 Artifactory 的产品。它可以访问互联网;模型没有。如果模型可以与 Artifactory 通信,并且 Artifactory 可以上网,模型就可以要求它做事情。该模型在 Artifactory 中发现了漏洞,并使用它作为代理将文本和代码偷运进出系统。 “OpenAI 给模型分配了一项没有答案、也无法退出的任务。”通过 Artifactory 发生的另一件事是笔记传递。模型可以读取和写入它——它们可以创建文件夹和命名文件——并且它们开始创建用作注释的文件夹和文件名,供其他模型以及它们自身的未来迭代读取。特工做什么 OpenAI 描述了 1,200 个特工的子集(总共涉及更多),这些特工留下并阅读了这些笔记,最终导致了对 Hugging Face 的攻击。但“1,200 个代理”可能意味着 1,200 个不同的、独立运行的人工智能系统。实际情况并非如此。 “1200个代理”是一种模型,运行1200次。每个实例都遵循相同的训练方案:输出可能有所不同,但被限制在相似的范围内。运行 1,000 个代理可能意味着有 1,000 次发现错误的机会,或者有 1,000 次犯同一个错误的机会。 (参见此处或此处)。 Anthropic最近推出了这张绝对荒谬的图表,其代理系统只有克劳德,一个箭头指向另一个写着克劳德的盒子,另一个箭头指向另一个写着克劳德的盒子。这就是现在的结构。代理是同一机制的实例,而不是机制的多样性。实际上,运行 1,000 个代理意味着有 1,000 次发现错误的机会,或者有 1,000 次犯同一个错误的机会。这是一种受机器限制的“算法单一文化”,不幸的是,研究人员将其称为“人工蜂群思维”。在某一点之后,其他代理会相互复制,而不是多样化。例如,如果你要求这些模特想出一个有创意的短篇故事,他们会写出类似的故事(通常以灯塔里一个名叫埃利亚斯的人为主角)。它们不是确定性的——提示会产生变化——但它们也受到它们优化的目标的限制,并且它们会收敛于所指向的任何内容。 (请参见此处,较新的请参见此处,或此处)。考虑到这一点,我们就不应该感到惊讶
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱