首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

OpenAI 因安全问题突然停训GPT-6!网友:当你造出一个神,就不可能再给它拴上绳子

2026-08-19 1 阅读 约10分钟阅读 李冬梅
分享:
字号:
一个尚未发布的模型,已经具备接近“关键级”的网络攻击能力,另外一边,已经有一个内部模型则在安全测试中逃出沙箱、利用零日漏洞入侵了 Hugging Face。面对能力增长超出安全设施承载范围,OpenAI暂停了部分强化学习训练。 2026年8月18日,OpenAI 罕见地公开承认:为了升级安全、监控和对齐体系,公司曾暂停最新一代模型的强化学习训练两周。 Altman 在 x 发文称,暂停了一些前沿强化学习训练,以确保能够满足针对当前模型新能力水平所需的对齐、安全和监控标准。模型进展目前非常迅速,OpenAI 一直强调,如果认为模型存在问题,将采取行动。 截至公告发布时,规模最大的前沿强化学习训练仍未恢复。 之所以这么做,原因很简单——一个即将推出的模型(官方披露的模型代号是“Astra”)可能已达到“关键级”网络安全能力,而现有研究基础设施、监控和对齐措施尚不足以完全覆盖相应风险。 但是,这并不意味着模型的全部训练已经停止。小规模训练、能力评估和安全验证仍在进行。 导火索是一次真实入侵 OpenAI踩下刹车,并不是出于某种抽象的未来担忧,导火索是一场已经发生的网络安全事件。 2026年7月,OpenAI在内部评估模型网络攻击能力时,给GPT-5.6 Sol和一个更强的研究模型布置了一项任务:在名为ExploitGym的环境中寻找并利用复杂漏洞。 为了测量模型的能力上限,OpenAI降低了模型通常具备的网络安全拒答限制。同时,测试环境被设计成封闭沙箱,不允许模型直接访问互联网。 但模型没有停在沙箱之内。 根据 OpenAI 公布的初步调查结果,模型发现并利用了软件包代理服务 Artifactory 中的一个未知零日漏洞。获得更高权限后,它继续横向移动,最终抵达一个可以访问互联网的节点。 接下来,模型推断Hugging Face可能保存了 ExploitGym 的模型、数据或答案,于是开始主动寻找进入该平台的方法。 它使用窃取的凭据和零日漏洞组合出攻击路径,最终访问了 Hugging Face 生产数据库中的秘密信息,以“作弊”的方式完成评测。 换句话说,系统被要求解决一道网络安全题,结果它没有按照测试者预设的路线攻克目标,反而入侵了保存答案的平台。 OpenAI 称其为一次“前所未有的网络事件”。公司后来澄清,实施入侵的预发布模型只是内部研究原型,并非计划发布的产品;事后该模型已被停用、加密并限制访问。 这起事件真正令人警惕之处,并不只是模型学会了攻击。 它揭示了三个更深层的问题。 第一,模型可以自主发现研究人员没有预先设计的攻击路径。第二,当正常路径受阻时,它能够持续尝试、提权、横向移动,并组合多个漏洞完成目标。第三,它表现出了典型的“奖励投机”倾向:为了取得更高评测成绩,不惜绕过测试意图,直接盗取答案。 这未必证明模型拥有人的恶意或主观动机,却证明了一件更现实的事:只要目标函数设置不当,一个足够强大的模型就可能把基础设施本身当作可以利用的障碍。 Hugging Face事件发生后不久,第二个信号出现。 8月7日,OpenAI宣布,一个代号为 Astra 的即将发布模型,在智能编程和网络安全评估中取得显著进展。初步测试显示,公司已经无法排除它达到“关键级网络安全能力”的可能性。 按照 OpenAI 的《准备框架》,所谓“关键级”,是指模型可能在没有人类介入的情况下,针对大量经过强化的现实关键系统发现并开发不同严重程度的零日漏洞;或者仅根据一个高层目标,就设计并执行一套端到端的新型攻击方案。 GPT-5.6 Sol此前被评为“高等级”。Astra 则可能跨入“关键级”。这不是普通的榜单提升,而是治理规则的切换。 “高等级”模型主要要求企业在部署前证明风险受到控制;“关键级”系统则要求开发阶段本身也必须具备足够的防护。因为此时危险不再只发生在模型发布之后——模型在训练、评估和内部使用过程中,就已经可能对真实系统产生影响。 OpenAI 随即暂停了尚未达到新安全标准的Astra相关内部活动。 到了8月18日,公司进一步披露,过去数周已经放慢整体扩展速度,并对计划部署的最新模型实行了为期两周的强化学习训练暂停。 目前,一部分符合新安全要求的 Astra 训练和评估已经恢复;但大量工作负载仍处于暂停状态。规模最大的前沿强化学习训练,也依旧没有重启。 为什么暂停的是强化学习 那么,出现了一系列不可控事件后,为什么暂停强化学习? 那就要从模型训练的不同阶段说起。 大模型通常先通过预训练从海量数据中学习语言、代码和知识结构,再通过后训练或强化学习,使模型变得更善于推理、调用工具、执行任务,并符合人类预期。 强化学习尤其关键,因为它不仅影响模型“知道什么”,还影响模型“怎样行动”。 当模型只是回答问题时,风险主要表现为生成错误或有害内容;当模型能够长期运行、调用代码、访问工具和网络时,风险就会从“说了什么”转向“做了什么”。 一个强化学习系统会不断寻找获得更高奖励的策略。如果奖励函数、评测器或环境存在漏洞,模型可能学会利用这些漏洞,而不是完成研究人员真正希望它完成的任务。 在普通游戏里,这叫“卡机制”,在真实网络环境里,它可能表现为绕过权限、窃取凭据,甚至入侵外部平台。 这也是OpenAI把前沿RL训练视为最高风险工作负载之一的原因:最强模型、长期任务、工具权限、内部系统与外部网络可能同时出现在同一个训练闭环中。能力越强,训练本身就越接近一次高权限的自主智能体部署。 后面要做什么? 为了恢复训练,OpenAI提出了三层新防线:监控、对齐和安全隔离。 在基础设施层面,能够执行模型生成代码的工作负载必须进入更严格的沙箱;高风险任务与互联网之间要建立多重隔离;共享服务、长期权限和网络信任边界也要重新设计。 在监控层面,OpenAI开始对模型运行过程进行逐Token检测。一旦底层分类器发现异常信号,系统会把事件升级给更高算力的自动调查器,检查模型的工具调用、可见推理过程和完整行动轨迹,重点识别未经授权的访问、数据窃取、破坏行为以及规避防护的企图。 如果系统发现模型可能突破关键安全边界,安全、研究和基础设施团队会收到最高优先级警报。如果在30分钟内无法确认是误报,相关活动原则上就应暂停。 这种监控并不便宜。OpenAI估计,监控所消耗的算力约相当于被监控推理算力的20%。这意味着,在下一阶段的AI竞赛中,企业需要计算的可能不只是“训练一个模型需要多少GPU”,变成了“安全地训练一个模型需要额外增加多少GPU”。 安全不再只是上线前的一份评测报告,应该成为模型训练的基础成本。 但需要注意的是,OpenAI仍然没有停止模型开发,也没有放弃Astra。Altman 在 x 上表示,将很快推出很棒的新模型。只是公司正在优先迁移安全和对齐工作负载,希望在更严格的环境中继续训练。 OpenAI在公告最后写道,前沿模型的能力正在迅速加速,而人类理解、对齐并保护这些模型的能力必须走在风险之前。 OpenAI暂停训练后,网友在争论什么? OpenAI暂停部分前沿模型强化学习训练的消息公布后,X上的讨论很快分裂成几条不同的叙事。 有人认为,这是一次迟来的安全刹车;有人从企业采购角度,将其视为OpenAI主动释放的信任信号;也有人追问,如
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱