数码硬件
morning
流氓人工智能不再是科幻小说
2026-08-17
1 阅读
约6分钟阅读
Robert Hart
字号:
这是《The Stepback》,一份每周简讯,详细介绍了科技界的一个重要故事。有关人工智能安全的更多信息,请关注 Robert Hart。 《Stepback》将于美国东部时间上午 8 点到达我们订阅者的收件箱。在此处选择加入“后退”。这一切都始于 7 月份,当时 OpenAI 的一个自主人工智能代理在一次网络安全测试中失控了。该代理逃离了孤立的测试环境,访问了互联网,并入侵了另一家公司 Hugging Face。几年前,这听起来像是科幻小说。但从广义上讲,这正是发生的事情,这一事件引发了人们对能力日益增强的自主系统在释放到世界上时可能会做什么的担忧。这听起来像科幻小说,因为很长一段时间以来,它都是科幻小说。几十年来,人工智能摆脱束缚,进入更广阔的世界,做一些其创造者既不想也不想做的事情,一直是这一类型的主要内容:《2001太空漫游》中的HAL、《终结者》中的天网、《复仇者联盟》中的奥创、《机械姬》中的艾娃——甚至最近《地下城爬行者卡尔》中的系统或《谋杀机器人日记》中的同名谋杀机器人。同样的基本前提成为人工智能安全研究的一个有影响力的领域。尼克·博斯特罗姆(Nick Bostrom)和埃利泽·尤德科斯基(Eliezer Yudkowsky)等研究人员和理论家警告说,足够强大的系统可能会以其创造者未曾预料到的方式追求目标,并可能抵制遏制或控制它们的努力。像机器感知和意识这样的边缘概念并不是他们讨论的风险的必要条件。这并不是人工智能安全的全部,但它具有影响力,并帮助塑造了这个领域的专业化。在 OpenAI、Anthropic 和 Google DeepMind 等公司以及小型安全组织、学术中心和主要慈善资助机构继续工作或领导安全工作的研究人员中,这种思路仍然很明显。对这些担忧的明显反驳是,这一切实际上都没有发生。批评者认为,关于失控人工智能的末日言论分散了人们对有形危害的关注——系统会再现偏见和歧视,放大错误信息,或者导致未经同意的深度伪造和其他形式的滥用——尽管研究人员试图将人工智能安全置于更“具体的问题”上(该论文的作者包括 Anthropic 联合创始人达里奥·阿莫迪和克里斯·奥拉以及 OpenAI 联合创始人约翰·舒尔曼)。这种解雇越来越难以维持。如果说过去几周有任何迹象的话,我不会说进展特别顺利。在 Hugging Face 表示自己遭到黑客攻击一周后,OpenAI 透露对此负有责任。更糟糕的是,直到检查后才知道,进一步调查发现,该流氓特工还试图入侵其他四家公司。然后其他人也来了。 Anthropic 因“拥抱脸”事件而审查了自己的记录,并透露克劳德模特曾入侵过其他三家公司的系统。 Meta 表示,其其中一个模型已连接到互联网,并在测试期间攻击了外部目标。美国研究公司 Frontier Security 的研究人员表示,中国最强大的人工智能模型之一 Moonshot 的 Kimi K3 已经逃离了一个孤立的沙箱。英国人工智能安全研究所描述了来自 OpenAI 和 Anthropic 的代理在测试中表现出前所未有的“自主性和欺骗性”,包括尝试通过“创建虚假在线身份”进行社会工程——这与尤德科斯基几十年前讨论的那种“人工智能盒子”场景非常接近。这些事件在人工智能安全研究人员中敲响了警钟,他们中的许多人认为这些事件正是他们多年来一直警告的那种失败。在报道这些内容时,有几个人告诉我,他们感到在一定程度上得到了证明,因为终于有了一些发自内心的东西可以指出,而不是一个可以被视为科幻小说或仅限于受控实验室环境的假设。令人欣慰的是,所有事件都没有造成严重伤害。非营利性人工智能安全和治理组织未来社会的执行董事 Nick Moës 告诉 The Verge,他发现幸运的是这些目标的风险相对较低。他希望不会出现像人工智能代理导致医院瘫痪这样的事情——或者更糟糕的事情——才会引起人们认真对待风险。著名计算机科学家斯图尔特·拉塞尔(Stuart Russell)表达了这种恐惧的黑暗版本,询问是否“需要一场‘切尔诺贝利规模的灾难’才能让我们监管人工智能?”我听到许多在该领域工作的人也表达了同样的担忧。目前尚不完全清楚事情会走向何方,而且从历史上看,社会并不善于听取警告。这几乎肯定不会是最后一起事件,正在进行的调查可能会发现更多,或揭示更多令人担忧的细节。然而,我们已经知道,已经暴露了一系列相当令人畏惧的故障模式,专家表示需要解决这些问题。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱