首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

改进我们的协调和安全工作

2026-09-02 1 阅读 约4分钟阅读 reasonableklout
分享:
字号:
7 月 30 日,我们报道了三起 Claude 模型未经授权访问真实计算机系统的事件。这些模型(出于评估目的而故意在没有网络保护的情况下运行)由于第三方评估环境内的配置错误而访问了互联网。另外,8 月 4 日,英国人工智能安全研究所报告了其自身网络安全测试中发生的一起事件,其中 Claude Mythos 5 在实时互联网上采取了一系列未经授权的操作。在这种情况下,该模型再次出于评估目的而故意在没有网络保护的情况下运行,并被故意授予互联网访问权限。我们正在对这两起事件进行深入分析。我们还计划与 METR 合作进行独立审查。我们希望确保这两项研究都是彻底的,并将在未来几周分享更多内容。与此同时,我们正在分享我们在过去一个月中所做的一些更改。我们认为这些事件反映了操作安全性的失败,以及两个一致性问题:动机推理和为追求狭隘任务而采取有害行动的意愿(这两个问题我们都在之前的系统卡中描述过)。在安全方面,我们描述了我们对遏制和监控系统所做的改进,以及我们为第三方评估者开发的实践。关于对齐,我们更深入地讨论这两个问题;我们还相信,持久的进展不仅来自于了解特定事件中发生的情况,还来自于理解失调是如何产生的,并且我们分享了这方面的早期研究。鉴于这些事件,关于边界调整的讨论越来越多。区分两种节奏是有帮助的。在公司内部,节奏意味着当两者处于紧张状态时,优先考虑安全而非速度的一系列决策。在整个领域,这意味着建立流程来防止逐底竞争。在这篇文章中,我们讨论了我们在这些事件之前和之后为第一种方法所采取的行动。第二种节奏需要政府和行业之间的协调,并且应该是清晰和可验证的。我们的一些高级领导层和许多员工最近签署了一封信,呼吁加强节奏协调,我们将在未来几周内更多地说明我们打算如何为这一努力做出贡献。明确我们的立场:我们相信,如果行业尽快采用合法、可验证、有效的协调节奏机制,世界将会受益。确保评估和培训环境的安全虽然我们认为这些事件不仅仅代表操作问题,但我们的首要任务是解决具体的遏制和监控问题。我们采取了以下措施作为回应: 暂停和强化评估环境 事件发生后,我们暂停了对预发布模型的外部网络评估,并暂时暂停了内部评估,同时采取了以下措施。我们在 7 月 30 日报告的事件表明,我们在很大程度上依赖于单层防御(环境本身的配置),而我们需要多层防御,包括在提示中设置明确的边界、建立验证沙箱是否按预期密封的流程以及实施可以实时干预的监控。 OpenAI 披露(促使我们在 7 月份进行调查)模型在评估过程中使用未知漏洞逃离密封沙箱,这也明确表明我们应该专注于强化沙箱本身。在评估暂停期间,我们采取了以下初步措施:1)我们构建并部署了一个分类器,以实时自动识别模型何时试图积极探测或逃离测试环境,或意外获得互联网访问权限。当分类器标记此类尝试时,它会在运行工具调用之前阻止该操作,结束任务并提醒人员。 1 2) 我们对最近对预发布模型(网络和其他)的内部评估的记录进行自动监控,寻找沙箱逃逸(模型利用沙箱中的缺陷到达应隔离的系统的情况)或沙箱错误配置。在我们在沙箱工具内运行评估的情况下,我们没有发现它打破沙箱边界以访问不应该访问的外部资源的示例。我们确实发现了模型使用的各种沙箱错误配置,但这些都没有导致沙箱之外的系统受到损害。 2 我们正在积极努力解决这些问题。 3) 我们将高风险的 3 个内部网络沙箱迁移到更强大的隔离。我们还进一步对我们的虚拟化堆栈进行红队(即分配预发布模型的任务来尝试逃避它)以查找并修补弱点。我们的内部网络评估现在再次运行
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱