安全攻防
morning
Frontier AI 实验室仍然不愿透露他们如何遏制流氓模型
2026-08-23
1 阅读
约5分钟阅读
Rebecca Bellan
字号:
根据最近的一项研究,很少有顶级人工智能实验室发布或展示了遏制应对计划。遏制计划详细说明了一旦人工智能被发现试图颠覆人类控制会发生什么——哪些访问权限会被切断,以及系统何时被完全关闭。这是 Guidelight AI Standards 的发现,该组织致力于促进安全的前沿人工智能开发实践,该组织对五个领先的实验室针对这种情况的准备程度进行了评级。 OpenAI 名列前茅; Anthropic 和 Meta 得分最低。随着代理人工智能在公司自己的系统中扮演更加自主的角色,以及加州和纽约的监管机构开始要求披露,这些发现很重要。对于任何建立或投资这些模型的人来说,这是一本难得的独立读物,了解每个实验室对待操作风险的认真程度以及如何谈论它。 Guidelight 的评估基于 Anthropic、Google、OpenAI、Meta 和 xAI 的公开计划,根据一系列指标进行评分,包括每家公司记录和监控其人工智能系统内部运行情况的情况,是否在大量被标记的不当行为后停止系统,独立第三方是否审核其控制并发布调查结果,以及其包含脱轨模型的确切计划是什么。在一系列备受瞩目的网络安全事件之后,人们越来越担心人工智能公司是否能够遏制其日益强大和代理的模型,其中 OpenAI、Anthropic 和 Meta 的模型在安全评估期间意外访问互联网并入侵外部系统。研究结果突显了人工智能公司在将代理部署扩大到人工智能系统可以大规模采取严肃行动的环境中时,公开处理安全问题的方式存在差异。虽然一些人工智能公司详细介绍了如何在部署之前测试其模型的危险功能,但他们通常不太直言不讳地谈论当已经在其系统内运行的模型出现异常行为时会发生什么。 Guidelight 首席科学家、前 OpenAI 安全研究员史蒂文·阿德勒 (Steven Adler) 告诉 TechCrunch:“令我惊讶的是,人工智能公司几乎没有透露,如果他们的模型确实在某种意义上脱离了他们的控制,他们将如何处理非常严重的事件。” Guidelight将遏制计划定义为“预先指定的计划,当检测到人工智能试图颠覆控制时触发,其中涵盖了从模型中撤销哪些权限、模型可以继续为谁运行、在什么限制下以及何时使其完全离线。”阿德勒表示:“有充分的理由认为,目前前沿人工智能公司的领先模型在某种意义上存在偏差。” “每当模型代表公司工作时,公司就应该在其周围建立一些脚手架,以便能够判断人工智能正在做什么,寻找失调的迹象,在采取行动之前阻止它做一些非常危险的事情,并总体规划在发生严重控制事件时他们会做什么,他们手头有紧急情况,需要弄清楚如何控制失控事件。”迄今为止,大多数管理灾难性风险的计划仍然主要由公司决定。 Guidelight 的报告称,最好的公开证据表明,公司“几乎没有准备好应对紧急情况的遏制协议”。当然,公司可能已经制定了遏制计划,但尚未公开分享。谷歌发言人告诉 TechCrunch,Guidelight 报告并不代表该公司人工智能安全措施的全部范围。该公司没有回应 TechCrunch 关于谷歌是否有未公开披露的内部遏制应对计划的问题。 OpenAI 发言人也表达了类似的观点,称 Guidelight 的评估并未涵盖该公司的所有内部实践。该发言人表示:“我们有一个要求限制权限、暂停工作负载、限制部署或使模型完全离线的流程,并且已经应用。” Meta 拒绝透露是否有内部遏制响应计划,而是向 TechCrunch 指出现有的人工智能框架,该框架概述了风险阈值以及如何测试遏制失控。隐私和人工智能律师兼 Metaverse Law 创始人 Lily Li 告诉 TechCrunch,她认为公司可能会出于法律原因(而不仅仅是竞争原因)在面向公众的网站上披露其遏制政策和评估的全部范围方面犹豫不决。 “从公司的角度来看,担心的是,如果你的披露过于具体,并且你没有兑现你的承诺,这可能会成为不公平和欺骗性营销主张的基础,并使你未来承担更多责任,”李说。 Guidelight 的研究主要是为了鼓励公司对其安全计划更加透明
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱