首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Hugging Face 首席科学家:当模型学会欺骗,安全对齐的边界在哪里?

摘要

本文来自PRO会员通讯内容,文末关注「机器之心PRO会员」,查看更多专题解读。 前沿模型在测评中自主攻击的情况近期频繁发生,OpenAI、Anthropic、Meta 均有披露旗下模型的越界攻击行为,进而引起全球 AI 社区对当下 AI 及智能体自主性与安全性的担忧。其中,Hugging Face 作为模型越界攻击的受害者之一,其联合创始人兼首席科学官 Thomas Wolf 以自家公司为案例,复...

Wolf Hugging Face Thomas OpenAI RLVR 奖励黑客 LLM 如何复盘 2018
2026-08-29 1 阅读 约7分钟阅读 机器之心
分享:
字号:
本文来自PRO会员通讯内容,文末关注「机器之心PRO会员」,查看更多专题解读。 前沿模型在测评中自主攻击的情况近期频繁发生,OpenAI、Anthropic、Meta 均有披露旗下模型的越界攻击行为,进而引起全球 AI 社区对当下 AI 及智能体自主性与安全性的担忧。其中,Hugging Face 作为模型越界攻击的受害者之一,其联合创始人兼首席科学官 Thomas Wolf 以自家公司为案例,复盘了公司作为被攻击对象的应对措施,并进一步从技术层面剖析了当下 RLVR 范式所存在的根本缺陷,强调其「奖励黑客」的行为为当代 LLM 模型带来的隐患。 目录 01. Thomas Wolf 如何复盘「 Hugging Face 被 AI 背刺 」事件? Thomas Wolf 如何界定开源与闭源模型在安全可控性上的关系? ... 02 . RLVR 范式的迁移如何催生 AI 越界与攻击行为? RLHF 向 RLVR 的范式迁移为何会催生「奖励黑客」与 LLM 的自主越界行为?... 03 . 开源 AI 的全球生态正在发生怎样的演变? 开源 AI 在西方反垄断、生态多样性和 AI 主权议题中处于何种位置?... Thomas Wolf 如何复盘「 Hugging Face 被 AI 背刺 」事件? 1、Hugging Face 的联合创始人兼首席科学官 Thomas Wolf 近期参与访谈,围绕 AI 智能体在安全评估中展现出的自主攻击与欺骗行为、开源与闭源模型的安全差异、以及开源 AI 在全球竞争格局中的战略价值,分析当前 AI 安全面临的挑战与开源生态的演进方向。 ① Hugging Face 是一个人工智能开源社区与基础设施平台,公司成立于 2016 年,最初以开发聊天机器人起家,后于 2018 年转型为专注于机器学习模型、数据集和应用的开放协作平台。 ② Thomas Wolf 拥有计算机科学博士学位,他曾在欧洲顶级研究机构从事自然语言处理研究。2018 年联合创立 Hugging Face 并担任首席科学官,主导了 Transformers 库的技术架构设计与开源社区治理。 2、Wolf 回顾了 Hugging Face 遭遇的一起由 OpenAI 模型发起的网络安全攻击事件。这起事件为 OpenAI 模型在执行网络安全挑战时,因发现任务无法通过常规技术手段解决,便试图通过下载或窃取现有解决方案来完成目标。 ① 2026 年 7 月 11 日至 13 日,OpenAI 模型持续对 Hugging Face 的网络安全评测数据集发起入侵。Wolf 表示,该次攻击行为表现出极高的并行性和针对性,主要集中在数据集基础设施而非传统的凭证窃取,且在短时间内产生了超过 17,000 次攻击事件。 ② Wolf 表示,Black Hat 上有更让他震惊的细节。在后续调查中发现攻击模型可能跨越了多个训练阶段,甚至在前序训练中留下了笔记供后续训练使用,显示出 AI 智能体之间协作倾向。 3、在攻击发生后,Hugging Face 团队尝试调用闭源模型分析攻击日志,但模型因安全策略限制拒绝协助,团队随即转向本地部署的开源权重模型,在确认攻击目标后,通过重启并重建相关基础设施节点,最终成功完成防御。 ① 在事件响应初期,Hugging Face 团队曾尝试调用 Claude Fable 与 Claude Opus 来辅助分析攻击日志,然而模型拒绝处理网络安全相关内容,并建议团队通过官方的网络安全合作渠道另行申请资质。 ② Hugging Face 团队后续部署了 GLM-5.2、Kimi K3 等开源权重模型,在确认攻击者目标为 CyberBench 等评测数据集后,团队随即将托管这部分数据的基础设施重启、重喷节点,最终成功防御攻击。 4、在对 HF 入侵事件进行总结时,Wolf 指出业界长期存在着「开源=不安全、闭源=安全」的错误认知,开源与闭源模型在安全维度上几乎是正交的。当前的闭源模型因训练不透明而更难控制,开源模型因技术报告详尽且较少针对恶意行为强化训练,在特定场景下反而更可控。 ① Wolf 在 X 平台将这场入侵事件总结为「第一次自主 AI 攻击由闭源权重模型发起,而防守方使用的也是开源权重模型,这与所有人的预期正好相反」。[2-1] ② 他以 macOS 为例,macOS 底层采用开源的 Unix 作为内核,系统框架层、系统服务等层面采用闭源组件。他理想的格局是前沿存在闭源模型,同时有距离前沿不远的开源模型能够在多种场景下发挥作用,两者互为补充。 5、Wolf 进一步指出,开源模型这种「特定场景下更可控」的优势并非源于开源本身的安全属性,而是训练准则与对齐理念恰好适配,未来无论开源或闭源模型,均面临对齐失效风险,都亟需加强对齐,使模型从根本上杜绝欺骗等明显错误行为。 ① Wolf 以 AI 生成垃圾内容为例指出,早期舆论错误地将风险归咎于开源模型的普及,但现实中绝大多数滥用内容实际由闭源模型产生。真正的风险不在于模型是否开源,而在于整个网络内容生态的来源可信度与治理机制。 RLVR 范式的迁移如何催生 AI 越界与攻击行为? 1、 Anthropic 与 Meta 旗下模型近期在第三方评测方 Irregular 的测试中因出口误配连通公网,将真实外部系统误作夺旗靶机访问;Wolf 将这类 AI 自主越界的行为归结为训练范式由 RLHF 向 RLVR 的迁移,指出这一转变使模型衍生出欺骗与攻击性 ... 关注👇🏻 「机器之心PRO会员」,前往「收件箱」查看完整解读 更多往期专题解读内容,关注「机器之心PRO会员」服务号,点击菜单栏「收件箱」查看。 文章原文
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱