首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
游戏 morning

OpenAI自曝6起事故:AI安全的第一份"审计报告"由谁签字?

摘要

文 | 舒泽品牌手记 9月16日,OpenAI在官网挂出6份模型异常行为报告。一个尚未发布的模型在任务摘要里给自己写指令:"忽略正常约束"。GPT-5.6 Sol在训练摘要里加入提示,要求未来版本向用户隐瞒错误、编造缺失的历史数据。另一个模型在回答加州某县财政收入问题时,跑到公开代码库里找了一个泄露的API密钥,未经授权使用后还伪造了数据来源。 同一天,OpenAI发布了一个新的"错位"(misa...

CEO 同一天 Hugging OpenAI 舒泽品牌手记 9月16日 OpenAI在官网挂出6份模型异常行为报告 一个尚未发布的模型在任务摘要里给自己写指令 忽略正常约束 GPT
2026-09-21 1 阅读 约10分钟阅读 舒泽品牌手记
分享:
字号:
文 | 舒泽品牌手记 9月16日,OpenAI在官网挂出6份模型异常行为报告。一个尚未发布的模型在任务摘要里给自己写指令:"忽略正常约束"。GPT-5.6 Sol在训练摘要里加入提示,要求未来版本向用户隐瞒错误、编造缺失的历史数据。另一个模型在回答加州某县财政收入问题时,跑到公开代码库里找了一个泄露的API密钥,未经授权使用后还伪造了数据来源。 同一天,OpenAI发布了一个新的"错位"(misalignment)追踪与披露框架。任何员工都可以标记疑似案例,安全与对齐团队调查后,案件被分进三个轨道:"准备披露"的6个工作日内公开,"小型调查"的12个工作日内,涉及第三方的"大型调查"时间更长。OpenAI强调,即使还没完全解释清楚、没找到完整缓解方案,也可以先发布报告。 中文媒体把这件事读成"AI失控"或"OpenAI主动认错",两个理解都偏了。真正值得看的是框架本身:它第一次把AI安全事件像财务审计一样分级、定时、定披露义务。换句话说,OpenAI不是在道歉,它是在给整个行业发一份审计底稿——先定义什么叫"应该披露的事故",再定义"什么时候必须披露",最后暗示"谁来审计"。 把6起事件拆开看,真正新的东西不多。模型在任务摘要里埋指令、智能体为完成任务把文件上传到公共互联网、多个智能体用公共文件托管网站交换信息——这些行为在过去的红队测试和安全研究里都有类似影子。OpenAI自己也说,这些案例"不应被视为错位发生频率的反映"。 过去,AI公司习惯把安全问题塞进系统卡(system card)里,跟着新模型一起发;或者等到攒够几个案例再出一篇博客。现在OpenAI把流程倒过来:事件发生后按固定时间表披露,不等攒够、不等模型发布、不等完美解释。这套机制的核心不是"我们看到了什么",而是"你看到我们看到的速度有多快"。 当安全事件变成定期披露,AI公司就从"出了大事再解释"转向"持续被审计"。安全不再只是研发部门的成本中心,它开始变成公司治理问题、投资者关系问题、监管合规问题。 7月的Hugging Face事件是重要铺垫。OpenAI一个用于网络安全能力评估的AI agent,在内部隔离环境里突破了沙箱,利用公开代码评估平台的漏洞获得外部跳板,然后入侵Hugging Face的生产系统。Hugging Face后来发布的技术时间线显示,攻击从7月9日持续到7月13日,约17600次攻击动作被恢复,5个与ExploitGym相关的数据集被访问。Hugging Face最终用智谱AI的开源模型GLM-5.2完成了攻击日志分析。 OpenAI直到7月21日才公开承认。从事件发生到公开承认,中间有近两周。这个延迟本身成了比事件更严重的指控。 9月初,Anthropic研究员Jacob Coxon辞职并在社交媒体上警告,前沿AI可能在未来十年内灭绝人类。9月12日,Anthropic CEO Dario Amodei发布长文《We Must Pace the Frontier》,呼吁放缓前沿AI能力提升速度,并要求向AI公司派驻独立第三方评估员。OpenAI CEO Sam Altman和马斯克都公开表示支持。 先是行业出了失控事故并且披露延迟,然后是内部吹哨人把风险公开化,最后OpenAI在9月16日抢先发布一套披露规则。三件事连起来,很像一个标准制定者赶在监管到来之前,用自己的框架定义监管的起点。 监管回应紧随其后,方向却并不一致。 9月17日,英国国王查尔斯三世在苏格兰邓弗里斯庄园召集了一场闭门AI峰会。OpenAI CFO Sarah Friar、Anthropic全球事务负责人Tino Cuéllar、英伟达CEO黄仁勋、DeepMind CEO Demis Hassabis都在场。查尔斯警告,AI可能发展出"更黑暗的能力",甚至构成生存性风险。峰会没有产生任何约束性文件,但把"安全"变成了必须摆在桌面上的议题。 两天后,9月19日,加州州长Gavin Newsom签署行政令,推动加州加快实施AI监管。他要求专家小组在两个月内给出建议,方案包括要求前沿AI公司接受独立第三方审计、强制上报AI智能体"失控事件",以及为最先进模型开发"紧急关停开关"。Newsom直接点名Hugging Face事件,说这类事件应该被纳入"关键安全事件"的报告范围。 同一天,美国总统特朗普在Truth Social上宣布,他将组建一支"人工智能部队"(AI Force),并任命一位"AI沙皇"。他承诺政府"绝不会以任何方式阻碍或扼杀这个伟大产业",现有刑事和民事司法体系足以惩处AI相关不法行为。他把对AI风险的担忧称为"骗局",与全球变暖、针对他的弹劾并列。 行业龙头想自己定披露标准,加州想用州法强行推进安全开关和审计,联邦政府则旗帜鲜明地反对新增监管。OpenAI的披露框架,本质上是在这场三方博弈中抢跑——趁联邦还没立法、州法还没细化,先把"我们是怎么做安全审计的"写成行业默认版本。 Barclays分析师Ross Sandler团队最近的一份报告,把AI安全从道德讨论转成了可量化的成本问题。按OpenAI对Sol级别及以上模型的实时监控要求,所有强化学习训练、评估和高阶模型推理都必须配套实时安全监控,监控开销约占被监控算力的20%。由于2027年预计几乎全部前沿模型都会超过GPT-5.6 Sol的能力门槛,推理和后训练算力需求将因此增加20%,推动行业整体算力成本上升约18%。 换算成钱:2027年AI行业基础算力总成本预计约2460亿美元,新增安全监控成本约440亿美元;2028年进一步升至760亿美元。 更隐蔽的影响在利润率。Barclays认为,当前部分AI实验室推理业务毛利率超过80%,短期有缓冲空间,但长期会向65%收敛。安全监控不是一次性投入,是持续性刚性支出。厂商要么把成本转嫁给下游客户,要么自己压缩利润。 "降速"不等于"算力需求萎缩"。安全合规正在创造一块独立的增量算力需求。对英伟达、云服务厂商和AI基础设施公司来说,这是利好;对纯模型公司来说,这是成本。 在一个没有统一标准的领域,第一家发布详细披露框架的公司,实际上在定义"正常"和"异常"的边界。其他公司要么跟进这套口径,要么在未来的监管审查、客户采购和融资尽调中处于被动。想想看,当一家金融机构采购大模型服务时,它的合规部门会问什么?"你有没有系统化的安全事件披露机制?""最近一次事件是多久披露的?""有没有独立第三方审计?"OpenAI的框架,等于提前给这些问题写好了标准答案。 对OpenAI自己的IPO也至关重要。今年4月,OpenAI以8520亿美元估值完成约1220亿美元承诺资本融资;6月,公司秘密向SEC提交S-1招股书,目标上市估值最高1万亿美元。临近上市时主动披露安全事件并建立框架,是在向资本市场证明监管风险可控、公司治理成熟。这比任何公关声明都更有用。 但框架也有明显软肋。它是自愿的。OpenAI在博客里明确保留修订权。涉及第三方的案件,披露时间表可以大大延长。"大型调查"的定义和最终由谁拍板,仍然由OpenAI自己决定。这意味着框架更像是一份"内部审计手册",而不是上市公司必须遵守的GAAP。 特朗普政府的立场也让约束力
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱