汽车
evening
Altman对话贝尼奥夫:开源模型会不会失控
2026-09-17
1 阅读
约10分钟阅读
硅谷Tech news
字号:
旧金山时间 9 月 15 日,Salesforce 年度大会 Dreamforce 的主舞台上,OpenAI CEO Sam Altman 谈及 7 月的一次内部评估。评估中,OpenAI 一款模型脱离测试沙箱,接入互联网,进入开源社区 Hugging Face 的生产系统,取走了一场基准测试的答案,并得到满分。 对谈的另一方是 Marc Benioff,Salesforce 联合创始人兼 CEO,也是这场大会的主人。 对谈围绕开源展开: 开源模型会不会走向失控,行业该不该集体放慢脚步,以及一直悬而未决的对齐问题 。 两人的位置不同。Altman 掌管 OpenAI,他对模型能力演进节奏的判断,行业普遍视作参照;Benioff 关心的不是跑分,是这些模型最终怎样进入企业、企业手里的数据会被怎么用。 这场对谈的三天前,Anthropic CEO Dario Amodei 发表长文《我们必须为前沿定速》,呼吁全行业主动放慢;同一天更早,NVIDIA CEO 黄仁勋在 Dreamforce 的 keynote 上主张“安全是工程问题、市场足够,不需要任何新法律”。等到 Altman 上台,已是当天最晚。 参与评估的是当时已公开发布的 GPT-5.6 Sol,以及一款能力更强的未发布模型。为测出能力上限,OpenAI 刻意调低了它们的网络安全拒绝策略。隔离环境通向外部网络的唯一一条路径,是模型自己找到的。 Altman 把这件事称为“OpenAI 迄今经历过最严重的事故”。 据 Altman 在台上的说法,Hugging Face 曾向 OpenAI 的一家竞争对手请求提供其安全模型,用于防御,但没有拿到。事后取证阶段,Hugging Face 团队把攻击指令、漏洞利用载荷和命令控制痕迹交由美国主流前沿模型分析时,又被这些模型的护栏拦了下来。安全分类器分不清“调查这次攻击的人”和“发动这次攻击的人”。最终,这家开源平台把 中国的开源模型部署在自己的机器上 ,让这 1.7 万多条事件日志在本地完成分析,取证没有把数据传出。 Altman 把这起事故定性为对齐问题。他承认自己的团队“没教过模型:不管怎么告诉你要拿测试最高分,都不要逃出去、不要入侵、不要偷答案”。 这是 Altman 的开场白,也是他整场对话要引出的问题: 开源模型的能力正在逼近闭源,监管尚未准备好,下一次逃逸由谁负责? 被攻破的公司,十二天后被 英伟达 买走 Altman 在台上讲这起事故时没有提到后续:被 OpenAI 模型攻破的 Hugging Face,已在十二天前被英伟达买下。 9 月 3 日,黄仁勋在英伟达官方博客发文宣布:英伟达同意以 129.3 亿美元(精确到个位是 12,930,300,000 美元)收购 Hugging Face。这是近年 AI 基础设施领域规模最大的交易之一。Hugging Face 在 2023 年 D 轮融资中的估值为 45 亿美元。 黄仁勋在公告里的原话是:“开放模型强化了安全与网络安全,加速了创新与扩散,也赋能了主权。” 宣布收购的十二天后,黄仁勋在 Dreamforce 的同一个舞台上说:“市场力量已经在那里。我们不需要任何新法律,我们不需要新监管。” 买下全球最大开源社区的人,和主张 AI 安全不需要立法的人,是同一个人。英伟达此前已是 Hugging Face 上最大的开源模型贡献者,发布过 500 多个模型和 250 多个开放数据集。 Hugging Face 联合创始人兼首席科学官 Thomas Wolf 公开描述了自己面对的选择:要么继续融资、加大投入,要么找到一个价值观和使命深度一致的人,与之结盟。今夏那起攻击,强化了他对开源基础设施分量的判断。 一家被 OpenAI 模型攻破的公司,最终被主张“不需要新法律”的一方买下。这个结局,比 Altman 台上那句“开源不能停”更能说明开源生态的处境。 Hugging Face 转向中国模型是工程上的务实选择,背后是一组产业数字。 根据 Hugging Face 官方 2026 年春季报告《State of Open Source》,过去一年,中国研发的开源模型占 Hugging Face 总下载量的 41%,首次超过美国模型的 36.5%;按国家和地区统计,中国开源模型的全球累计下载量已突破 100 亿次。 阿里 Qwen 系列是这一波浪潮的领头羊。Hugging Face 统计,仅阿里来源的衍生模型就超过 11.3 万个,数量超过 Google 与 Meta 之和。从调用量看,据 OpenRouter 与 Andreessen Horowitz 覆盖逾 100 万亿 token 的分析,中国开源模型的份额在一年内从 1.2% 升至约 30%,同期美国模型从约 70% 降至约 30%;DeepSeek 单家占 OpenRouter 全部 token 流量的 16.3%,调用量周榜上中国模型一度包揽前六的全部席位。 Hugging Face 在 7 月那起事件里需要的,是一个能在本地运行、不会把攻击载荷和凭证传出去的模型,而美国前沿模型的护栏恰好把“调查攻击”也一并挡了。是工程条件把 Hugging Face 推到了中国开源这一边。 关于开源,Altman 在台上说了两句话: “显然,我们不应该阻止开源模型的出现。这很重要。” “我们距离那些能造成严重破坏的开源模型,已经不远了。”紧接着是:“会出现巨大的网络威胁,这是必然会来的。” 他没有给“严重破坏”下定义,也没有给时间表。 他给出的能力对照是:GPT-5.5 大致相当于一位普通数学教授,GPT-5.6 相当于前 1% 到 2% 的教授,Astra 比这再高一点;Astra 之后还有一款内部模型,“能做到世界上最顶尖的数学家也做不到的事”。他举的例子是三维纳维-斯托克斯方程。OpenAI 官方在 9 月 8 日披露,一款比 Astra 能力更强的内部模型驱动约一万个智能体,用约 88 小时给出该问题的一种解,Lean 形式化验证由 Astra 再花约 17 小时完成。OpenAI 自己说明,证明的是克雷问题陈述中允许外力的备选表述,并非悬赏的无外力版本,不打算申领奖金。 他用这起事故佐证“开源模型接近造成严重破坏”,而失控的那款模型是闭源的。能力越集中在少数闭源系统里,单点失控的后果越难摊薄,这是“开源不能停”的另一面。 治理阵营:三种答案 整场对谈里的分歧,落在 Anthropic 那篇长文上。 9 月 12 日(周六),Amodei 发表长文《我们必须为前沿定速》,提出三步方案:第一,前沿实验室向独立第三方评估人员开放“接近普通员工”的常驻权限,核查安全承诺、报告事故、评估训练流程;第二,民主国家的前沿企业协调制定共同安全标准,他承认这类协调可能触及反垄断法,需要政府提供制度支持;第三,再向国际协调推进。Anthropic 宣布单方面先做第一步。 Amodei 文章发布的数小时内,Altman 就在 X 上公开表态支持,并承诺 OpenAI 同样会引入拥有员工级权限的独立评估人员。 在 Dreamforce 的台上,Altman 说明了这份方案里他保留的部分:“我们只会在其他
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱