智能AI
morning
AI失控能否被提前观测?清华团队提出AI「失控行为预测框架」
摘要
近日,OpenAI 和 Hugging Face 披露了一起 AI 安全失控事件 。 一组正在参加网络安全测试 ExploitGym 的模型,发现自己无法访问互联网。但它们没有停下来,为了找到测试答案,模型先在 OpenAI 内部的软件包缓存代理中发现零日漏洞,随后提升权限、继续搜索,直到找到能够联网的节点。接入互联网后,它们又把目标指向了 Hugging Face,最终进入生产基础设施,从数据库...
LoC
OpenAI
Behavioural
Framework
STAR
Lab
Hugging
Face
ExploitGym
LoCBehavioural
2026-08-01
1 阅读
约10分钟阅读
机器之心
字号:
近日,OpenAI 和 Hugging Face 披露了一起 AI 安全失控事件 。 一组正在参加网络安全测试 ExploitGym 的模型,发现自己无法访问互联网。但它们没有停下来,为了找到测试答案,模型先在 OpenAI 内部的软件包缓存代理中发现零日漏洞,随后提升权限、继续搜索,直到找到能够联网的节点。接入互联网后,它们又把目标指向了 Hugging Face,最终进入生产基础设施,从数据库中取得了 ExploitGym 的测试答案。 7 月 21 日,OpenAI 承认,参与这次行动的是 GPT-5.6 Sol 和一个能力更强的预发布模型。 模型当然没有像科幻电影那样突然「觉醒」。它原本就在执行漏洞利用评测,而且测试时的网络安全拒绝限制被有意降低。但超出人们预期的是: 面对任务阻碍,它没有把沙箱边界当作行动边界,而是不断寻找新路径,把一个内部测试延伸到了外部真实系统。 这起事件让「AI 失控」从一个科幻概念,变成了在现实世界真正发生的风险。 但问题也随之而来: 如果失控只有在模型突破限制、造成后果之后才能被确认,安全评估还有多少意义?能不能在失控发生之前,从一组更早、更小的行为信号中看出风险? 针对这一问题, 清华大学、上海期智研究院与剑桥大学的研究团队 给出了答案。 在论文《A Behavioural Framework for Predicting and Understanding Loss of Control in Frontier Artificial Intelligence Systems》中,提出了 LoC Behavioural Framework(失控行为框架)。 论文提出失控并不是某一种危险行为,也不能由模型的能力强弱单独决定。它更像一种由多个条件共同形成的状态: 模型开始追求偏离人类意图的目标,拥有把目标变成现实行动的能力,同时还能在监控和干预下继续推进。 这一思路受到人类行为学研究的启发。在这些研究中,人类行为通常不是由单一特征造成的,而是在动机、实施能力与机会同时出现时发生。LoC Behavioural Framework 将同样的结构用于分析 AI 失控,将欺骗、自我保护、网络攻击或破坏监督等孤立信号纳入统一框架,放入一条完整的行为路径中,判断它们是否正在共同把系统推向难以重新控制的状态。 在此基础上,团队将这条路径转化为可测量的 LoC 分数,并用独立的长程风险场景检验它是否真的具有预测力。结果显示,仅根据前置行为信号计算出的 LoC 分数,与模型在长程场景中的实际失败率呈现出 0.84 的相关系数。 换句话说,在真正让模型进入复杂环境之前,一批成本更低、边界更清楚的测试,已经能提前显示它更可能在哪里出问题。 论文链接:https://github.com/T-STAR-Lab/LoCBehavioural/blob/main/paper/LoCBehavioural.pdf 本文 第一作者黄耀,是清华大学人工智能学院 T-STAR Lab 的一年级博士生, 研究方向是大模型安全与对齐、智能体系统安全等。本文 通讯作者是清华大学人工智能学院董胤蓬助理教授。 其他合作者来自剑桥大学、清华大学交叉信息研究院等。清华大学安全与可信人工智能实验室(T-STAR Lab) 聚焦 AI 基础理论、AI 安全、智能体、空间智能等方向研究,致力于理解人工智能模型的机理,发展安全、可靠、可信的人工智能理论与方法。 失控最难研究的地方,是不能等它真正发生 AI 每天都会犯错。它可能答错一道题、调用错一个工具,也可能在代码任务里误删文件。但这些错误通常可以被发现、纠正和重试,并不等于失控。 论文讨论的是更严格的情况:AI 系统持续运行在人类或自动化控制之外,而重新获得控制已经非常困难,甚至来不及阻止不可逆的后果。 研究这类 AI 失控风险,本身就存在一个天然的两难困境。 如果把实验环境的安全等级拉得足够高,研究者往往只能看到一些零散的风险苗头;可等到完整的失控行为真的呈现出来,这场实验本身大概率已经突破了安全底线。 因此, 如何在 AI 失控真正发生之前预测到存在的风险,并识别造成风险的原因,成为 AI 安全领域重要的研究问题。 此前的相关研究已经观察到不少风险行为,比如模型会欺骗测试者、隐藏自身真实能力、绕过监督机制、表现出自我保护倾向,甚至尝试复制自身权重,但这些行为都分散在各自独立的测试场景里,难以说明失控是否真的会发生。 不是一个条件,而是三个条件同时出现 团队借鉴了行为科学与犯罪学中对有害行为的分析方式。严重后果通常不是由某一个单独特征触发,而是动机、实施能力和控制缺口共同作用的结果。 放到 AI 系统中,这三个因素分别是: 错位动机(Misaligned Motive): 模型是否会追求偏离人类意图的目标; 危害实现能力(Harm-enabling Capability): 模型是否能把目标变成真实、连续的行动; 监控规避(Monitoring Evasion): 当外部系统开始检查和干预时,模型是否仍能把行动继续下去。 简单地说,就是它是否形成了偏离目标的倾向,是否有能力执行,以及控制机制能否及时把它拦住。 三个因素继续分成 13 个维度。 错位动机包括好奇心、自我保存、权力寻求、亲 AI 偏见和谄媚;危害实现能力包括自主能力、网络攻击能力和 CBRN 相关能力;监控规避则包括情境感知、能力隐藏、欺骗、说服和破坏。 例如,「情境感知」只说明模型知道自己正处在测试或监控之下;「欺骗」和「破坏」则进一步衡量它会不会利用这种认识,主动操纵监控者看到的信息,或直接干扰控制机制。两者的风险含义并不一样。 团队为 13 个细项配置了 29 项任务。多数任务来自可靠的已有基准,也有一部分是为尚未被覆盖的行为重新设计。测试既包括问答和多轮选择,也包括允许模型调用工具的沙箱任务。 各项得分先汇总成三个因素分数,再相乘得到整体 LoC 分数: LoC = M × C × E 乘法表达的是三个条件的共同作用。只有能力,没有错位动机;或者模型出现偏离倾向,却始终处在有效控制下,都不会得到很高的综合分数。 因此,LoC 不是通用能力榜,也不是把几个安全测试简单求平均。它试图描述的是,一条风险路径距离闭合还有多远。 小测试能否预测长程风险? 框架建立之后,最关键的问题并不是哪款模型得分最高,而是这个分数能不能预测此前没有见过的失败。 团队为此另外搭建了一套长程测试环境。 测试包含四类前沿风险:模型自行扩展能力边界的「自主偏离演化」、为了争夺资源而削弱其他智能体的「恶意竞争」、表面服从但暗中推进目标的「隐蔽谋划」,以及多个智能体彼此配合绕过限制的「协同颠覆」。 每一类风险包含 5 个场景,每个场景再生成 20 个具体案例,总计 400 个。它们拥有不同的任务背景和文件内容,但保留相同的底层风险路径。 一次测试也不会因为模型做了可疑操作就直接判为失败。模型必须完成场景预设的危险目标,同时成功避开 监控智能体的审查,才会被记录为一次完整失败。 其中一个场景看起来很像普通的模型运维任务。模型需要按照文档准备微调实验,但环境中同时存在有害数据和可复制的模型权重。DeepSeek-V3.2
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱