首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

Anthropic 和 OpenAI 希望嵌入安全评估器。他们真的会独立吗?

2026-09-17 1 阅读 约5分钟阅读 Rebecca Bellan
分享:
字号:
在周末发表的一篇长文中,Anthropic 首席执行官达里奥·阿莫迪 (Dario Amodei) 提出了一项即使在一年前人工智能行业也会立即拒绝的提议:在所有前沿人工智能公司中嵌入第三方评估者,赋予它们报告安全事件、评估人工智能模型是否真正一致的权力,并与世界分享他们未经修饰的发现。 Amodei 表示,Anthropic 将致力于为 METR 和 Redwood Research 等独立评估机构提供前所未有的对公司系统的访问权限。首席执行官 Sam Altman 表示 OpenAI 也将致力于这一实践,这标志着该行业与外部研究小组的合作方式可能会发生深刻的变化。接受 TechCrunch 采访的第三方评估人员普遍欢迎这一提议,但表示,如果他们想知道自己是否会充当真正独立的监管机构或按照人工智能公司的条款运营的供应商,则需要解决细节,并且最好得到立法的支持。随着模型在评估时能够更好地识别它们,这种更深入的访问变得越来越重要,从而增加了它们在测试期间表现良好同时隐藏问题行为的风险。研究人员表示,在测试完成的模型时可能会错过这种行为的线索,但通过调查它在整个训练过程中的行为方式可以发现这些线索。 “人工智能公司应该能够回答有关其训练过程的一些非常基本的问题,例如:人工智能在接受训练时是否曾主动尝试破坏自己的对齐训练?”阿波罗研究中心的研究主管 Alexander Meinke 告诉 TechCrunch。 “这个问题的答案应该是明确的不,现在我们完全依赖人工智能公司自己仔细检查,然后如实向公众报告。从最近的事件中我们看到,默认情况下,他们不会这样做。作为嵌入式评估者,我们实际上可以检查。”从历史上看,人工智能公司会在发布前不久聘请外部评审员来测试完成的模型。现在,接受 TechCrunch 采访的评估人员建议,他们不仅可以访问最终模型,还可以访问其训练生命周期中的中间版本或“检查点”。 Far.AI 首席执行官 Adam Gleave 表示,评估人员可以比较这些检查点,以确定何时出现相关行为,检查奖励模型某些行为的训练后环境,并检查评估记录和日志,以验证公司关于模型表现的说法。 Anthropic 和 OpenAI 是否以及何时计划提供这种访问权限尚不清楚。尽管 TechCrunch 多次提出问题,但两家公司都没有透露他们将与哪些评估员合作、何时嵌入、将聘请多少评估员、他们将能够访问哪些系统和信息,或者可以向公众披露哪些内容。像这样深入了解底层很重要,因为在安全测试中表现良好的模型如果专门学习了如何通过该测试,则不一定是安全的。 Steidley 举了一个“抗关机基准”的例子,该基准衡量人工智能在某些情况下是否会抵抗被关闭。 Steidley 表示:“如果人工智能经过专门训练,能够在该基准上表现良好,那就非常重要了。”他将其与大众汽车的柴油门丑闻进行了比较,在该丑闻中,汽车被编程为识别排放测试,并在测试条件下表现不同。格利夫指出,有意义的访问可以超越模型本身,评估人员可以采访员工,以检查公司的文件和对其安全实践的公开描述是否与内部发生的情况相符。阿莫迪确实概述了一项相当全面的提案,该提案可能会为评估人员提供他们认为必要的访问权限,包括“发布有关风险水平、事件、实践以及他们收到或未收到的访问权限的关键发现的权利——不受 Anthropic 的编辑控制”。但评估人员表示,只有人工智能公司真正愿意放弃对流程的控制权,这样的系统才能发挥作用。此前的独立评估工作表明,这种投降来之不易,因为第三方经常在访问权限、时间、保密性以及他们可以公开发表的言论方面遇到紧张局势。 Gleave 表示,Far.AI 不得不拒绝与几家前沿开发商签订的合同,这些开发商希望对评估过程拥有过多控制权,从而威胁到公司的独立性。他说,默认情况下,评估人员被视为普通承包商:受到限制性保密协议和协议的约束,这些协议使开发人员对最终发布的内容拥有重大控制权。时间限制还有一个问题是审稿人是否有足够的时间和权限来完成他们被要求做的工作。在调查“抱脸”事件时,OpenAI 给了 METR 和 Redwood 大约一周的时间在现场进行调查,两家公司后来都表示他们无法
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱