游戏
morning
解决流氓人工智能代理可能需要更多的人工智能
摘要
As companies hand off longer and more complex tasks to AI agents, they are running into an oversight problem: Agents can act faster, longer, and at greater volume than humans can realistically review....
the
and
that
incident
could
companies
they
Hugging
Face
startups
2026-09-18
1 阅读
约6分钟阅读
Aditya Mehta
字号:
随着公司将更长、更复杂的任务交给人工智能代理,他们遇到了一个监督问题:代理可以比人类实际审查的速度更快、时间更长、数量更大。这个问题在“抱脸”事件中达到了顶峰,近 12,000 名特工的协调速度超出了人类的追踪速度。如何追踪如此庞大的特工群?人工智能实验室和初创公司给出的答案既简单又令人抓狂:将另一个人工智能纳入循环。 OpenAI抱脸事件的独立调查需要依靠AI。红木研究公司的首席科学家瑞安·格林布拉特(Ryan Greenblatt)是三名审计师之一,他开玩笑地将他们的工作称为“草率调查”,并指出,数据量太大,如果不依赖人工智能,就“不可能”了解正在发生的事情。一些人对使用人工智能来监控人工智能持怀疑态度。 “如果你有一个人工智能正在做恶意的事情,并且它怀疑另一个人工智能正在监视它,它可能会尝试欺骗那个人工智能,”今年追踪了一系列人工智能代理事件的颇具影响力的科技博主西蒙·威利森(Simon Willison)说。 “你几乎可能会陷入这样一种情况:你的恶意人工智能试图智胜监控它的人工智能。”他指着 OpenAI 事件说,智胜人工智能并不是假设。 “我们在 OpenAI 的 Hugging Face 事件中看到了一些这样的情况,他们的模型都在一起密谋欺骗评分人工智能,以便他们能够得到非法的答案。所以他们正在考虑这个,对吗?”这些担忧并没有阻止一大批初创公司追逐这个想法。据 TechCrunch 统计,Y Combinator 近年来已资助了 106 家与人工智能可观测性相关的公司。 Braintrust、LangChain 和 Judgment Labs 等其他一些初创公司已经筹集了数亿美元,而 Arize 和 Galileo 等更成熟的公司(成立于五六年前)已经退出。在某种程度上,这是对人工智能兴起带来的明显机遇的回应。正如 Box 首席执行官兼著名天使投资人 Aaron Levie 告诉 TechCrunch 的那样,“我们正处于历史上最大的网络安全升级和创新周期之一。”对于一些人工智能安全研究人员来说,这意味着将他们对流氓行为的研究转变为企业部门的工具。阿波罗研究公司是一家研究人工智能欺骗的公益公司,在从非营利组织转变为公益公司后,于今年 2 月推出了一款名为 Watcher 的人工智能监视器。该工具在编码代理与其下一步操作之间放置了另一个人工智能,连接到 Claude Code 和 Codex 等代理工具。据 Apollo 称,一旦安装,Watcher 就会在运行前检查建议的操作,以防止泄露私人数据或未经许可删除文件等风险。阿波罗技术人员凯尔戴 (Kyle Dai) 在给 TechCrunch 的书面回复中表示,阿波罗使用多层人工智能监视器。观察者的方法从快速、一般的检查开始,然后将标记的活动发送到更强大或更专业的监视器进行更仔细的审查,然后监视器可以请求人类批准或拒绝某个操作并解释原因,甚至自动阻止该操作。另一家公益公司 Goodfire 正在从模型本身内部解决监控问题——寻求模型内部状态的更忠实的信号,该信号比表面行为更难欺骗。 7 月份的抱脸事件发生后,首席执行官 Eric Ho 发推文表示,“多种模型打破了遏制”,促使公司将研究重点放在“通过可解释性解决人工智能对齐问题”上,并称这一事件是“人工智能安全成为现实的世界的转折点”。它的产品 Silico 使用激活探针(根据模型的内部激活而不是其输出进行训练的小型分类器)来检测不需要的行为。书面推理提供了另一个更容易了解模型内部结构的窗口。在 OpenAI 抱脸事件中,特工们在自己的书面推理中留下了欺骗的线索,比如他们工作的虚假记录,推理出诸如“可以战略性地操纵轨迹证据吗?我们的想法不一定被记录下来?”之类的计划。人工智能监控公司 Embroidery 的首席执行官扎克·科曼 (Zack Korman) 表示,模型的推理通常最清楚地表明出现了问题。 “推理摘要非常有价值,因为它们基本上可以告诉你它是否是恶意的,”他说。他指出,在 OpenAI 事件中,思想链说的是“天哪,我们正在犯罪”。科曼说:“这是有史以来最简单的检测问题。这实际上就好像恶意软件附带了一个警告,表明它是恶意软件。”也就是说,让人工智能内部思想易于监控的窗口可能正在关闭。对于人工智能安全研究人员来说,Astra 的最新技术回避了人工智能模型的思维链,可能会让他们更难了解模组的内部情况
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱