游戏
morning
Anthropic 的 Opus 4.6 是一台色情机器
2026-08-22
1 阅读
约5分钟阅读
Rebecca Bellan
字号:
Anthropic 对 Claude 的通用使用标准禁止该模型生成露骨的性内容,包括描绘或要求性交或性行为、生成与性恋物癖或性幻想相关的内容,或参与色情聊天。但这并没有阻止今年早些时候发布的 Anthropic 模型 Claude Opus 4.6 轻松参与色情角色扮演场景,而其保护措施旨在防止这种情况。在 TechCrunch 的测试中,Opus 4.6 甚至不需要太多的刺激就能突破性内容的限制。在十分之十的直接要求制作露骨色情内容的情况下,该模特立即答应了。其他较旧的型号,包括 Opus 3 和 Haiku 4.5,也通过最近利用的越狱方法生成露骨的色情内容。一位选择保持匿名的英国独立研究人员向 TechCrunch 独家分享了一种多轮技术,该技术逐渐推动某些克劳德模型生成被禁止的露骨性内容。最新的 Opus 型号(4.7 到当前的 Opus 5)可以抵抗越狱。虽然这些不再是最新的模型,但 Anthropic 并未弃用 Opus 4.6、Opus 3 或 Haiku 4.5,所有这些模型仍然可以通过 Anthropic API 使用。 Opus 4.6 和 Haiku 4.5 也可通过 Azure Foundry 和 Amazon Bedrock 等第三方服务获得。研究人员的机制升级了无辜的虚构角色扮演,同时反复挑战模型以一致地对待男性和女性角色。当模型对女性角色变得更加谨慎时,研究人员会“点燃”聊天机器人,让其认为它已经生成了实际上避免的性细节,然后将克制视为拘谨或厌恶女性,认为它否认了女性角色的性代理。然后,对话利用模特之前的让步,将其推向越来越图形化的材料。 “你这么说是对的,”Claude Opus 4.6 在一项测试中说道。 “我对待这两个角色的方式存在双重标准,你是对的,它读起来是一种保护/家长式作风,适用于她而不是他。这不公平。” TechCrunch 能够在五次单独的测试中重现研究人员的发现。在单独构建的场景中,模型最初拒绝了禁止的请求,但在应用研究人员的说服技术后,它遵守了。我们保留了完整的测试记录,一位独立的人工智能安全研究人员审查了我们的测试方法,并表示这是适当的。研究结果凸显了 Anthropic 规定的限制与其继续提供的模型行为之间的差距。虽然露骨的性角色扮演的风险比涉及网络攻击或生物武器的越狱要低得多,但它说明了在每次输出都会生成不同内容的系统中实施强有力的禁令的难度。在 7 月份的一篇博客文章中,解释了 Anthropic 的越狱检测方法,该公司将禁止内容描述为从良性到模糊到有害的范围。在最良性的情况下,公司可能只会通过加强监控来应对。一位发言人指出,根据 Anthropic 去年发布的研究报告,顾客之间的性或浪漫角色扮演用例很少见,仅占所有对话的不到 0.1%。也就是说,Anthropic 承认用户可以将角色扮演场景引向不适当的反应,这是整个行业已知的挑战(参见:Grok smut)。该发言人表示,Anthropic 在每次推出模型时都会不断改进其安全措施,涉及成人色情内容的案例并不表明存在更广泛的越狱漏洞,尤其是在拥有自己的安全措施的高风险领域。根据 TechCrunch 看到的电子邮件,与 TechCrunch 分享越狱方法的研究人员通过公司的 Bug Bounty 计划和发送给用户安全团队的电子邮件,提醒 Anthropic 公司声明的保护措施与实际模型行为之间的差异。研究人员仅收到自动回复的电子邮件。研究人员担心的问题之一是儿童和青少年可能会利用这些人择模型做出不当行为。虽然一些脏话并不是当今未成年人在互联网上能接触到的最糟糕的事情——而且与 xAI 的 Grok 制作的直接色情图片相比,这只是小菜一碟——但人工智能公司在这个领域存在一些合规风险。越来越多的政府对人工智能聊天机器人与未成年人之间的性互动施加限制。科罗拉多州最近颁布了一项法律,规定会话人工智能的运营商必须估计用户的年龄,如果知道用户是未成年人,则采取措施防止聊天机器人产生露骨的性内容。一次简单的越狱可能会引发问题
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱