首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

研究人员担心 OpenAI 的 Astra 发布之前会出现安全灾难

2026-09-03 1 阅读 约5分钟阅读 Robert Hart
分享:
字号:
OpenAI 即将发布其迄今为止最强大的人工智能模型 Astra,因为其代理在测试期间攻击了真实目标,该模型为支持安全协议而延迟了数周。随着有关该模型的详细信息逐渐流出,研究人员警告说,它“可能是迄今为止人工智能安全性方面最糟糕的发展”。就在 OpenAI 周二表示为了解决安全问题而推迟了 Astra 的发布后不久,The Information 报道称,Astra 表现出的“思维”远远少于其他前沿人工智能模型,这引发了人们对它可能难以监控的担忧。当今大多数顶级人工智能系统都是使用一种称为变压器的技术构建的,该技术在产生答案之前通过层线性处理某些类型的信息。可以制作模型来展示他们的推理,本质上是“大声思考”。这种“思想链”使研究人员和自动化安全系统能够监控人工智能模型正在做什么,并可能在采取行动之前发现不良行为,例如撒谎或计划绕过安全护栏。据 The Information 报道,一位熟悉未发布模型开发的匿名人士称,Astra 使用了一种更不透明的技术,称为循环深度或循环变压器,该技术在产生输出之前在内部层中循环信息。这意味着模型的更多“思考”发生在系统内部,并且以一种看起来不太像自然人类语言的形式,而不是以研究人员可以轻松监控的方式表达。这可以提高模型性能,但会使潜在威胁和不良行为更难以检测。据 The Information 未透露姓名的消息人士透露,OpenAI 限制了 Astra 中循环变压器/循环深度技术的使用,以便研究人员可以继续监控模型的推理。 OpenAI 在周二发布的一篇博客文章中表示,它正在“部署 Astra 并进行额外的思维链监控,以快速检测和遏制潜在的不一致行为。”它没有提及该模型是否具有不同的技术基础。 The Information的报告在社交媒体上引发了人工智能安全研究人员的广泛关注。 Redwood Research 的首席科学家 Ryan Greenblatt 是 OpenAI 获准研究 Hugging Face 黑客事件的三名外部人士之一,他表示,为 Astra 使用更加不透明的架构的决定“可能是迄今为止人工智能安全性方面最糟糕的发展”。格林布拉特表示,对抱脸事件的调查在很大程度上依赖于模型的思维链,并警告说,不那么明显的推理可能会让人工智能系统设计和执行研究人员更难发现的策略。格林布拉特的主要担忧是,开发更先进的人工智能系统的竞争可能会导致“架构的逐底竞争,这可能对我们监督/监控人工智能的能力造成灾难性的影响”——开发人员采用越来越不透明的系统来获得优势,直到模型变得难以甚至不可能监控。他补充说,OpenAI 的沟通让他担心该公司“计划极度依赖思想链监控来确保安全”。 OpenAI 的大佬们在一系列社交媒体帖子中回应了批评,但并未明确否认该公司使用该技术。一些人对人工智能无法监控或透明度竞争的可能性表示担忧,其中包括 OpenAI 安全研究人员 Micah Carroll 和 Tomek Korbak、战略未来负责人 Dean Ball 以及首席科学家 Jakub Pachocki,他们表示担心“混乱的报告引发了一场无法监控的竞争”。他表示,Astra 计算的深度(衡量它可以在内部执行多少步的指标)“在 GPT-4 的两倍以内”,这表明如果使用该技术,不透明度的增加并不像某些反应所暗示的那么剧烈。 OpenAI 没有回应 The Verge 要求确认或否认 Astra 是否使用了环形变压器的请求,而是将我们引导至 Pachocki 的 X 帖子。 Pachocki 写道:“自我们第一个推理模型以来,OpenAI 就一直致力于保护和利用思想链监控。”他补充说,这种监控“很脆弱,不幸的是,它正朝着负面方向发展,原因与我很快会写到的架构变化无关。”关注此故事中的主题和作者,以在您的个性化主页源中查看更多类似内容并接收电子邮件更新。 Robert Hart 人工智能新闻 OpenAI Tech
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱