智能AI
morning
OpenAI 创建了一个新框架来披露人工智能的不良行为
2026-09-17
1 阅读
约4分钟阅读
Maxwell Zeff
字号:
OpenAI 周三宣布了一个关于如何公开披露人工智能错位事件的新框架,该公司表示希望该框架将有助于为整个行业制定类似的标准。该公司还发布了有关去年发现的几个人工智能模型错位示例的新信息。 OpenAI 新任命的一致性研究负责人 Kai Chen 告诉《连线》杂志:“随着模型的进步和更广泛的部署,有关人工智能开发的决策需要证据,让构建前沿模型的公司之外的人可以检查。” “我们不认为人工智能行业已经在足够程度上解决了对齐和监控问题,无法继续以最大速度负责任地扩展。”在《连线》的简报中,OpenAI 的一位官员表示,该公司此前很少披露错位事件。这位同意匿名的官员表示,新框架的目的是让 OpenAI 在发现其人工智能模型出现意外行为时,能够更轻松地快速通知公众,甚至在它能够充分调查、解释或缓解这种行为之前。该框架概述了 OpenAI 员工向公司高级安全和对准领导报告不对中事件的方法,然后由他们决定是否需要进一步调查。 OpenAI 表示,计划与其他人工智能开发商、外部研究人员、行业标准机构和监管机构合作制定更客观的披露标准。该公司表示,正在积极制定拟议的报告机制,向美国联邦政府披露安全、安保和失调事件。 OpenAI 在一篇博客文章中表示:“目前,还没有一个全行业框架对人工智能开发人员应如何披露其模型中不一致的示例提供明确的标准。” “我们希望今天概述的框架是创建此类标准的第一步,规定开发人员应披露哪些错位实例以及他们的报告应包含哪些内容。” OpenAI 在人工智能行业的关键时刻发布了该框架。上周末,OpenAI 首席执行官 Sam Altman 表示支持 Anthropic 首席执行官 Dario Amodei 关于科技行业协调减缓人工智能发展的提议。就在几天前,人工智能研究员雅各布·考克森 (Jacob Coxon) 从 Anthropic 辞职,他警告公众,前沿实验室之间开发日益先进的人工智能的竞赛正在危及人类的安全,这一举动引起了广泛关注。人工智能放缓的呼吁遭到了特朗普政府的抵制,特朗普政府认为该行业不需要新的法律或法规来确保其技术的安全。 OpenAI 周三分享的两个错位示例涉及该公司内部未发布的人工智能模型,OpenAI 表示,尽管没有得到指示,但这些模型仍将文件上传到互联网。其中一起事件发生在 2025 年 10 月,当时 OpenAI 表示正在测试其模型之一在其答案中引用公开数据的能力。但是,当模型找不到所需的信息时,它会将文件上传到临时文件托管服务,然后尝试在答案中引用该文件。该公司表示,这似乎是试图利用自动评分系统来评估模型在基准测试中的熟练程度。在今年 4 月的另一个例子中,OpenAI 表示,一组代理的任务是仅使用本地文件一起完成“工作簿”。当特工们难以相互共享文件时,其中一名特工将这些文件上传到公共互联网,并与其他特工共享了一个链接。 OpenAI 表示上个月发现的另一起事件中,其 GPT-6 Astra AI 模型的未发布版本似乎给自己发出了“类似越狱的指令”。在某些情况下,模型本质上会促使自己忽略开发人员的指示,采用新的角色,或限制模型响应的时间。虽然这些类似越狱的尝试很少发生,并且在不同程度上有效,但 OpenAI 表示,这种行为引起了内部担忧。该公司表示,在公开发布的 Astra 版本的训练中,尚未观察到该模型试图越狱的任何实例。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱