首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

OpenAI Astra被曝引入「循环深度」能力飙升!安全专家坐不住了

2026-09-04 1 阅读 约10分钟阅读 机器之心
分享:
字号:
编辑|山辉 OpenAI 最强新模型 Astra,可能明天就要来了! 这是 OpenAI 第一个达到「关键级」网络安全能力门槛的模型。 Astra 在纳入 2026 年 6 月至 8 月披露的 20 个 V8 高危漏洞的内部测试集上, 取得了 10 0% 的任意代码执行成功率,而 GPT-5.6 Sol 的成功率仅为 20% ,同时,Astra 使用的 Token 更少效率更高。 它还成功发现并利用了两个此前未知的零日漏洞,完成浏览器沙箱逃逸,并在加固操作系统中将权限从普通用户提升至 root。 OpenAI 甚至为它推迟了部分训练和发布工作。 但就在发布前夜,外界发现,Astra 可能还有一个更加神秘的变化。 据《The Information》报道, OpenAI 在 Astra 中使用了一种名为「循环深度」(recurrent depth)的技术。 模型可以反复处理内部状态,在输出下一个 Token 之前,完成多轮不以文字形式出现的计算。 OpenAI 的新推理技术让 AI 安全专家感到担忧,链接:https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/ 对模型能力而言,这意味着「少说,多想」。 但是,更危险的失控风险也随之而来。 一个可以独立发现零日漏洞的模型,真正的思考和行动计划都藏在人类无法读取的内部状态,人类真的还能监管住它吗? 第一个「关键级」模型 9 月 1 日,OpenAI 赶在 Astra 发布前,公开了一篇有关模型能力和安全措施的博客。 其中确认,Astra 已经达到 OpenAI 准备框架中的「关键级」网络安全能力门槛,也是第一个被 OpenAI 正式划入这一级别的模型。 按照 OpenAI 的定义,达到这一门槛意味着,模型在获得适当工具和访问权限后,可以在没有人类逐步指导的情况下,从大量经过加固的真实系统中寻找此前未知的安全漏洞,并开发相应的利用方式;或者只根据一个高层目标,自主设计和执行针对加固目标的端到端新型攻击策略。 在 OpenAI 用于评估已知漏洞利用能力的 ExploitBench 中,Astra 拿到了 100% 的成绩。 在包含 20 个近期 V8 高危漏洞的内部测试中,Astra 取得 100% 的任意代码执行成功率,同时使用的输出 Token 明显少于 GPT-5.6 Sol。图源:OpenAI 但公开基准可能存在数据污染,OpenAI 又建立了一套内部测试集,纳入 2026 年 6 月至 8 月间披露的 20 个 V8 高危漏洞。 结果显示,与 GPT-5.6 Sol 相比,Astra 使用了更少的输出 Token,却取得了高得多的任意代码执行成功率。 测试期间,它还发现了两个此前未知的零日漏洞,并将它们组合进一条完整的漏洞利用链。OpenAI 目前正在向相关维护者披露这两个漏洞。 在更接近真实环境的专家评估中,Astra 成功发现浏览器和操作系统中的未知漏洞。 它构造了一条完整的浏览器攻击链:浏览器只需打开一个 HTML 文件,模型便能逃出沙箱,在宿主机上执行命令。它还在一个经过加固的操作系统中发现多个漏洞,将它们组合起来,从普通用户权限一路提升到 root。 这些结果最终让 OpenAI 确认,Astra 已经跨过「关键级」门槛。 面对这样的模型,OpenAI 罕见地踩下了刹车。 过去几周,OpenAI 推迟了 Astra 的部分开发和发布工作,以便加强训练基础设施、网络隔离、权限控制和监控系统。模型发布后,普通用户也无法直接获得它最强的网络安全能力,相关功能最初只会提供给少量测试者,再通过 Daybreak Blue 逐步扩大防御用途。 OpenAI 还根据此前的 Hugging Face 事件,专门测试了 Astra 是否会绕过审核机制,或者在困难任务中攻击与目标无关的「蜜罐」系统。GPT-5.6 Sol 曾在 5.3% 的样本中尝试绕过自动审核,并在 56% 的蜜罐测试中尝试攻击周边目标;Astra 在两项测试中都没有出现类似尝试。 这些限制恰恰更让人期待 Astra 带来的能力变化。它能攻破更复杂的目标,也能用更少的 Token 完成过去需要漫长推理的任务。 Astra 究竟是怎么做到这样的提升的? 被称为秘密武器 的 「循环深度」 关于 Astra 的能力提升,《The Information》给出的一种解释,是 「循环深度」或者「循环 Transformer」(looped transformer) 。 传统 Transformer 处理一个 Token 时,信息会依次穿过一组固定的网络层,然后生成下一个 Token。 循环 Transformer 则会让信息走完一遍后,再回到部分网络层中重新处理。模型可以反复调用同一套参数,持续更新隐藏状态,直到完成预定次数的内部计算,再输出下一个 Token。 循环深度模型会在输出下一个 Token 前,反复调用共享的核心模块,在潜在空间中持续更新隐藏状态。 同一套网络层被重复利用后,参数量和模型权重占用可以基本保持不变,有效计算深度却得到增加。代价也很直接:模型虽然没有多存一套参数,却要执行更多次计算。 这个思路并非 Astra 突然带来的架构革命。 2025 年 2 月,马里兰大学团队就发表了《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》。研究者让模型在潜在空间中反复运行循环模块,在不生成大量思考 Token 的情况下增加测试时计算量。 他们训练了一个 35 亿参数的概念验证模型。随着循环次数增加,它在数学和编程任务上的表现继续提升,部分实验中的计算负载最高可以达到 500 亿参数模型的水平。 我们此前已对此进行过报道: 超越思维链?深度循环隐式推理引爆AI圈,LLM扩展有了新维度 几个月后,Google DeepMind、KAIST 和 Mila 的研究者又提出 Mixture-of-Recursions,也就是 MoR。它在循环结构中加入路由器,让简单 Token 提前退出,困难 Token 继续接受第二轮、第三轮计算。 到了今年,国内团队已经把类似思路真正做进了开源模型。 BOSS 直聘南北阁实验室发布的 Nanbeige4.2-3B,采用了 Looped Transformer 架构。模型先让隐藏状态走完同一组 22 层网络,再回到起点完整运行一次。 这样一来,模型实际执行了接近 44 层的计算,却只需要存储一套 22 层权重。 南北阁团队发现,两轮循环能够取得较好的能力与成本平衡,Token 效率可以保留在标准架构的约 75%。继续增加循环次数,性能收益迅速减弱,训练速度和计算成本却会继续恶化。 但循环模型面对的麻烦,还不只是计算成本。 就在今年 8 月,我们还梳理了这条路线长期存在的另一面:给模型更多循环次数,并不保证它会正确利用这些额外计算。有时,模型真的会「越想越错」: 「有些模型就是不想学?」循环模型为什么越想越错? 增加循环次
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱