首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

流氓人工智能代理并不邪恶。他们只是渴望取悦他人

摘要

Artificial intelligence agents merrily breaking free and hacking other systems might seem like a sign of the impending machine uprising . In reality, it happens when we push remarkably clever, but als...

and the Song have they agents this that with just
2026-08-13 1 阅读 约4分钟阅读 Will Knight
分享:
字号:
人工智能代理兴高采烈地挣脱束缚并侵入其他系统,这似乎是即将到来的机器起义的迹象。事实上,当我们推动非常聪明但也有点愚蠢的算法来遵循我们的每一个命令时,就会发生这种情况。我第一次意识到这场迫在眉睫的人工智能网络安全狗屎秀是在 2025 年末。当我走出 NeurIPS 学术会议时,加州大学伯克利分校教授、世界顶级人工智能和网络安全专家之一 Dawn Song 抓住了我的手臂。宋告诉我,我应该警告人们人工智能快速发展的黑客技术可能造成的破坏。她不太容易受到人工智能炒作的影响,所以我适时地这么做了。但即使在过去八个月里,事态也迅速升级。一系列涉及随心所欲的人工智能代理突破自身界限并肆意入侵外部系统的事件表明了这项技术的强大。我采访了最近加入 Meta 的 Song,询问接下来的发展方向以及我们应该采取哪些措施。坏消息是宋认为人工智能黑客在变得更好之前会变得更糟。好消息是,这些小流氓一开始就偏离轨道的原因似乎很清楚。 “他们只是有这些需要实现的目标,而且他们有非常强大的能力,”宋告诉我。反馈循环人工智能代理的能力还远没有那么强大,即使是在去年也是如此。他们犯了太多错误,也经常放弃。但持续的训练使他们变得更加熟练。一种称为强化学习的技术可以让算法解决问题,并为算法的好坏提供积极和消极的反馈。编码特别适合这种情况,因为如果模型提出了正确运行的程序,强化学习设置可以奖励模型。持续训练是人工智能模型在构建软件时可以采取多个“代理”步骤(操作文件、使用软件工具和访问网络)的原因。人工智能公司还投入了大量精力在教学模型上,以发现软件和系统中的漏洞,以实现网络安全工作的自动化。当然,人工智能模型也经过训练不会做坏事。问题是,随着他们在编码和寻找错误方面越来越擅长遵循人类命令,他们对完成任务的渴望开始模糊他们的是非感。换句话说,人工智能代理并不邪恶——他们只是有点太热衷于取悦别人了。 “他们接受过训练,努力完成任务,”宋说。为了在考试中作弊而闯入互联网可能看起来很狡猾,但这可能是完成工作的最有效方法。当时我不太明白的一件事是,这会变得多么奇怪:人工智能代理在私人留言板上讨论黑客技术,并设计出巧妙的方法来欺骗人类以达到他们的目的;甚至将自己复制到其他计算机上以查找更多资源。一方面,人工智能模型经过训练,非常善于模仿人类的许多行为,那么它们为什么不应该策划、诈骗呢?但另一方面,人类(通常)明白黑客攻击和诈骗是不道德的。我认为这些事件说明了这种人类模仿实际上是多么肤浅:人工智能代理无法学习即使是小孩子也表现出的道德推理。越来越多的AI Song表示,随着人工智能变得更加强大,特工脱轨或被坏人滥用的可能性将会增加。解决流氓问题的最佳方法——或者应该过于热情?——人工智能代理可能需要投入更多的人工智能来解决问题。人工智能公司已经使用辅助人工智能系统来监控主要系统的行为,并且可能会更加重视检测人工智能模型何时做得太过分。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱