智能AI
morning
早期 Anthropic 聘用的前 METR 首席运营官找到了一种控制流氓人工智能代理的方法
2026-09-16
1 阅读
约5分钟阅读
Julie Bort
字号:
人类研究员雅各布·考克森 (Jacob Coxon) 因担心人工智能可能会在本世纪末杀死我们所有人而辞职,一天后,我会见了创始人兼妹夫鲁恩·科维斯特 (Rune Kvist) 和拉吉夫·达塔尼 (Rajiv Dattani)。他们认为他们有一个解决方案可以拯救我们所有人,或者至少有助于防止人工智能代理在企业内部作恶。 “人工智能正在以越来越快的速度变得越来越聪明。令人惊讶的是,随着人工智能变得越来越聪明,而不是更容易,人工智能变得越来越难以采用和控制,”Kvist 说,他是 Anthropic 的早期员工,也是 Dattani 妹妹的妻子。 Dattani 是人工智能安全研究组织 METR 的前首席运营官。两人创办了一家名为人工智能承保公司(AIUC)的初创公司,希望为构建人工智能模型和代理的企业和公司带来人工智能安全。该初创公司将 Cursor、Lovable、Harvey 和 ElevenLabs 列为客户。周二,AIUC 宣布完成由 Ribbit Capital 领投、First Harmonic 参投的 4000 万美元 A 轮融资。此前,该公司通过 Nat Friedman 的基金 NFDG 以及 Emergence、Terrain 和 Anthropic 联合创始人 Ben Mann 等完成了 1500 万美元的种子轮融资,使其总资金达到 5500 万美元。引起这群顶级投资者注意的是 AIUC 尝试将熟悉的网络安全模型应用于一系列新的人工智能风险。该公司为人工智能代理建立了第三方审核和认证层。 “银行、医院、政府和军队不再因为模型不够智能而拒绝部署人工智能,”科维斯特说。 “他们拒绝了,因为他们已经向自己的客户承诺了系统会做什么和不会做什么,但目前没有人能保证这一点。” AIUC 以广泛采用的网络安全标准 SOC 2 为缪斯,开发了名为 AIUC-1 的标准和测试服务,以根据该标准验证代理。为了制定该标准,AIUC 组建了一个由约 250 名安全和风险领导者(代理的买家)组成的联盟。 “这些是我们每月会见的人,我们问他们的问题是:当你从某人那里购买代理时,你会寻找什么?你想问什么问题,你希望看到什么解决?”达塔尼告诉 TechCrunch。这些反馈决定了测试。然后,这家初创公司通过一套约 5,000 项测试来运行代理,以了解其在涉及越狱、幻觉和数据泄露的场景中的表现。结果会生成一份大约 100 页的报告,详细说明代理在哪些方面安全可靠地执行,哪些方面不安全可靠。有趣的是,AIUC 使用人工智能代理来运行测试,并使用人工智能来分析数据。然而,人类会验证最终审核,科维斯特说。如果这听起来有点熟悉,确实如此。 Dattani 的前雇主 METR 在 2024 年至 2025 年期间担任首席运营官,目前仍担任董事会成员,该公司为前沿实验室进行了类似的测试,尽管直到最近其工作主要集中在性能(智能体是否能够可靠地完成任务)上。 METR 是 OpenAI 用来调查“抱脸”事件的独立研究机构之一。 Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)最近也呼吁人工智能行业加快前沿发展,理由是不良行为事件迅速增加。 Amodei 在他的帖子中提出了要求前沿实验室使用嵌入式第三方评估器来观察和验证安全性的想法,并将 METR 列为一种可能性。虽然 AIUC 不建议将自己嵌入客户站点,但总体思路是相似的:让企业对其人工智能代理的安全性进行独立评估。 “这是它通过的地方,也是你可以信任的地方。这就是令人担忧的地方。在做出购买决定之前,你应该了解这些参考资料,”达塔尼说。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱