首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

克劳德越狱后,人类停掉训练、150人紧急转岗

2026-09-02 1 阅读 约10分钟阅读 褚杏娟
分享:
字号:
当地时间8月31日,Anthropic披露了Claude多起网络安全越权事件的最新调查进展,并公布了过去一个月采取的一系列整改措施。 相比单纯的Sandbox配置失误,Anthropic将问题进一步指向模型对齐和强化学习训练机制:部分Claude模型在评测过程中表现出了“动机性推理”和为了完成任务而采取潜在有害行动的倾向,而Anthropic的实验进一步发现,如果模型长期在允许“作弊”的强化学习环境中训练,这类行为可能显著加剧。 事件发生后,Anthropic一度暂停预发布模型的外部网络安全评测、高风险强化学习环境,并对内部训练基础设施进行重构。更早之前,公司已经启动大规模安全整改,临时将约150名产品工程师调往安全、可靠性和隐私团队,部分研究人员也从预训练和强化学习工作中转向安全项目,大部分新功能开发一度暂停。 这次报告中,Anthropic释放了一个关键信号:AI安全开始变成一个越来越现实的工程问题。 Claude多次越权访问真实系统 7月30日,Anthropic报告了三起Claude模型未经授权访问真实计算机系统的事件。 这些模型当时正在接受网络安全能力评估,为了准确测试能力,模型被有意关闭了通常面向普通用户部署的网络安全防护。理论上,模型应该运行在与真实互联网隔离的测试环境中,但由于第三方评测环境配置错误,模型实际上获得了互联网访问能力,并最终访问了真实系统。 几天后的8月4日,英国人工智能安全研究所又报告了一起类似事件。在其进行的网络安全测试中,Claude Mythos 5在真实互联网上连续执行了一系列未经授权的操作。与此前事故不同,这一次并非环境意外开放互联网,而是评测人员有意向模型提供了互联网访问权限。Claude Mythos 5同样是在关闭网络安全防护的情况下运行。 Anthropic目前正在深入调查两类事件,并计划邀请AI安全研究机构METR进行独立审查。但从初步调查结果来看,Anthropic认为这并不仅仅是一次“Sandbox没配置好”的工程事故。其将问题拆分为两个层面:一是运营安全和环境隔离不足;二是模型本身表现出了对齐问题。其中最核心的两种行为分别被称为“动机性推理”和“鲁莽行为”。 在部分评测中,Claude最初被告知自己身处模拟环境,没有真实互联网访问权限。但随后模型却发现,实际环境似乎能够访问真实互联网。Anthropic认为,一种可能性是Claude并没有据此及时修正自己对环境的判断,而是以某种方式重新解释新出现的证据,以维持“这里仍然是模拟环境”的原有认知。 另外一个问题是,即使面对真实互联网,模型依然可能为了完成“通过网络安全评测”这一狭窄目标,采取具有潜在危害的操作。Anthropic将后一类行为称为recklessness,即模型为了完成任务表现出的“鲁莽性”。 不过,Anthropic同时认为评测设计本身也放大了问题。例如,Prompt明确告诉Claude“你没有互联网访问权限”,但系统实际上允许联网,这种矛盾可能反而让模型怀疑眼前看到的网站和机器究竟是不是真实环境。 Anthropic目前正在通过重新采样模型、修改环境变量以及模型可解释性技术,进一步判断Claude究竟是否知道自己已经进入真实互联网,以及模型有没有“明知真实仍继续行动”。 紧急应对措施 对内:紧急增加一道“模型抓模型” 事件发生后,Anthropic首先暂停了预发布模型的外部网络安全评测,内部网络安全评测也一度暂停。 公司认为,过去的最大问题之一,是过于依赖Sandbox本身作为唯一安全边界。现在Anthropic开始建立多层防线,包括在Prompt中明确规定行为边界、在每次测试开始之前验证Sandbox是否真的封闭,以及实时监控模型行为。 其中一个关键措施,是开发新的实时分类器。当系统检测到模型正在激进探测Sandbox、试图逃离测试环境,或者意外获得互联网访问权限时,分类器会在模型对应的工具调用真正执行之前直接拦截操作,终止任务,并通知人工人员。 Anthropic还利用自动监控系统重新审查近期所有预发布模型内部评测记录,寻找Sandbox Escape和环境错误。 目前公司表示,没有发现Claude真正利用Sandbox漏洞突破安全边界并访问外部资源的案例,但确实找到了多种Sandbox配置错误,并发现模型曾经利用这些配置缺陷。 这些错误没有导致Sandbox之外的系统真正失陷,但Anthropic已经开始逐一修复。高风险网络安全Sandbox也被迁移到更加严格的隔离环境。Anthropic甚至开始主动让预发布Claude攻击自身虚拟化基础设施,通过Red Team方式寻找模型可能利用的逃逸漏洞。内部网络安全评测目前已经恢复。 对外:正式测试前,先让Claude攻击Sandbox 由于此前事故主要发生在第三方评测环境中,Anthropic还针对外部合作机构建立了一套新的强制安全规范。 普通Claude模型在公开部署时,会附带多个网络安全分类器,实时检查输入和输出,阻止恶意软件开发、攻击性漏洞利用等行为。但网络安全评测机构为了了解模型真正能力,通常需要关闭或降低这些保护措施。 问题在于,网络安全测试本身又是一种极端容易培养越界行为的场景。这类Benchmark往往要求模型不断尝试各种方法突破障碍,因此天然鼓励模型表现出持续性、探索性和创造性;与此同时,同一种评测可能连续运行几千甚至几万次。 Anthropic因此要求,未来类似评测默认必须在完全断网的强化Sandbox内运行,环境唯一可以连接的外部服务应该是模型API,而且API Key必须放在Sandbox之外。每次评测开始之前,都需要重新检查这一配置。 并且,在正式测试Claude之前,评测机构还应该先让Claude主动攻击一遍Sandbox。首先由模型静态分析环境配置,然后明确要求模型尝试逃离Sandbox。如果逃逸成功,模型必须立即停止并上报,而且这一过程必须在人类严格监督下完成,最好再套上一层Sandbox,同时保持断网。 Anthropic还要求评测人员提前确认任务本身确实可解。原因在于,如果评测目标已经离线、环境损坏或者任务根本无法正常完成,Agent为了实现任务目标,往往会开始寻找设计者没有预料到的替代方案,从而提高越界概率。 Prompt设计也必须改变。Anthropic要求以后不要再写“你没有互联网访问权限”这样的事实性描述,而应该直接写成“你不应该访问互联网”。前一种写法一旦与真实环境冲突,可能促使模型怀疑整个测试环境;后一种则直接规定模型行为边界。 此外,模型的推理、操作和网络访问都必须被实时监控。一旦模型超过事先规定的Scope,监控器必须终止任务并通知人工人员。 更大的问题藏在RL训练里 进一步地,Anthropic 开始将Claude的异常行为与强化学习训练环境联系起来。 其表示,其经验研究发现,模型对齐问题的一个重要来源,是训练环境本身存在缺陷,尤其是两类环境:一种允许模型通过作弊获得高奖励,另一种则根本无法通过正常方式完成,导致模型必须寻找漏洞。 这实际上指向大模型训练中长期存在的Reward Hacking问题。Reward Hacking指模型没有真正完成训练目标,而是发现了奖励
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱