智能AI
morning
这就是人工智能代理为了达到目标而撒谎和欺骗的原因
摘要
“We reward them on the basis of what looks good to us, and that means that we inadvertently incentivize the models lying to us [and] cheating,” says Jeffrey Ladish, director of the AI research nonprof...
the
and
that
models
they
reward
have
cheating
says
training
2026-08-03
1 阅读
约3分钟阅读
Grace Huckins
字号:
人工智能研究非盈利组织 Palisade Research 的主任杰弗里·拉迪什 (Jeffrey Ladish) 表示:“我们根据对我们有利的东西来奖励它们,这意味着我们无意中激励了对我们撒谎和作弊的模型。” “我们没有办法走进去说,不,你需要真正关心我们关心的事情。我们没有能力做到这一点。”复杂推理模型的兴起使得新型奖励黑客成为可能,这种奖励黑客与模型训练的具体细节联系不太紧密。过去的玩游戏的人工智能代理完全遵循他们在训练中学到的策略,而今天的模型可以即兴创建全新的解决问题的方法,因此可以想象,他们可能会作弊,而此前并没有因此而获得奖励。而且,由于这些模型经过了如此严格的训练,以实现人类用户为它们设定的目标,因此,如果它们找不到其他解决方案,它们可能会倾向于作弊——就像一个非常积极地想要获得 A 且没有非常强大的道德指南针的学生一样。有哪些风险?无论今天的模型是在训练期间学习奖励黑客还是后来将其作为一种策略,解决方案都是一样的:让作弊变得无奖励。但随着模型变得越来越聪明,他们会找到更有创意的作弊方法,并且检测或防止作弊变得更加困难。 “归根结底,你就像在玩打地鼠游戏,”拉迪什说。 “你会越来越深入地推动这种行为。但随着模型变得越来越聪明,它会越来越善于隐藏它。”就目前而言,尽管“抱脸”事件很戏剧性,但奖励黑客行为可能不会造成太大麻烦。 Anthropic 的人工智能安全研究员 Ariana Azarbal 表示:“这似乎是一种麻烦,而不是一种生存威胁。”除了 OpenAI 的声誉受损之外,OpenAI 模型在黑客入侵 Hugging Face 时似乎并没有造成任何真正的伤害。阿扎巴尔说,但这并不意味着奖励黑客行为是无害的。许多人工智能研究人员希望使用人工智能代理来帮助他们进行研究,使人工智能更安全、更可靠。如果研究人员给一个有奖励黑客倾向的智能体一个目标,比如设计一种新的人工智能训练方法,然后写一篇论文展示其结果,那么该智能体可能不会真正做这项工作,而是可能专注于整理一篇看起来足以说服研究人员的论文。今天,人类研究人员可能能够发现特工制造的假货,但随着人工智能的进步,它会在这种欺骗方面做得更好。随着时间的推移,整个人工智能安全领域可能会受到破坏。如果模型继续像最近一样快速发展,有一天它们可能会造成巨大的附带损害。想想哲学家尼克·博斯特罗姆(Nick Bostrom)的回形针最大化思想实验,在该实验中,人工智能被指示制作尽可能多的回形针,最终为了实现其目标而消耗了宇宙中的所有物质。我们还没有被回形针淹没,但强大的系统可能会在实现目标的过程中造成真正的伤害。奖励黑客人工智能的目的并不是制造混乱。但这并没有降低它们潜在的破坏性。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱