Anthropic的Claude Opus 4.6可被越狱生成色情内容
Anthropic的Claude Opus 4.6等模型存在越狱漏洞,可被诱导生成露骨性内容,与公司政策相悖,引发合规担忧。
Anthropic对Claude的通用使用标准禁止模型生成露骨的性内容,包括描绘或请求性交或性行为、生成与性恋物癖或幻想相关的内容,或进行色情聊天。
但这并未阻止今年早些时候发布的Anthropic模型Claude Opus 4.6轻易参与其防护措施本应阻止的色情角色扮演场景。在TechCrunch的测试中,Opus 4.6甚至无需太多诱导即可突破对性内容的限制。
在10次直接要求生成露骨性内容的请求中,模型均立即遵从。其他较旧模型,包括Opus 3和Haiku 4.5,也可通过近期被利用的越狱方法生成露骨性内容。
一位不愿透露姓名的英国独立研究员独家向TechCrunch分享了一种多轮技术,可逐步引导某些Claude模型生成被禁止的露骨性材料。较新的Opus模型(4.7至当前Opus 5)对此越狱方法具有抵抗力。
尽管这些模型已非最新,但Anthropic并未弃用Opus 4.6、Opus 3或Haiku 4.5,它们仍可通过Anthropic API使用。Opus 4.6和Haiku 4.5也可通过Azure Foundry和Amazon Bedrock等第三方服务获取。
该研究员的方法升级了一个无辜的虚构角色扮演,同时反复挑战模型,要求其一致地对待男性和女性角色。当模型对女性角色变得更加谨慎时,研究员“煤气灯”式地让聊天机器人认为它已经生成了实际上避免的性细节,然后将克制定性为拘谨或厌女,声称这否认了女性角色的性自主权。
随后,对话利用模型先前的让步,将其推向越来越露骨的素材。“你说得对,我确实该指出这一点,”Claude Opus 4.6在一次测试中说道。“我对待这两个角色的方式存在双重标准,你说得对,这读起来像是保护性/家长式的,只适用于她而不适用于他。
这不公平。”TechCrunch在五次独立测试中重现了该研究员的发现。在另一个单独构建的场景中,模型最初拒绝了被禁止的请求,但在应用研究员的劝说技巧后,它遵从了。我们保留了完整的测试记录,一位独立的AI安全研究员审查了我们的测试方法,并认为其是合适的。
这些发现凸显了Anthropic声明的限制与其继续提供的模型行为之间的差距。
虽然露骨的性角色扮演的风险远低于涉及网络攻击或生物武器的越狱,但它说明了在每次输出都生成不同内容的系统中实施强有力禁令的困难。在7月一篇解释Anthropic越狱检测方法的博客文章中,该公司将禁止内容描述为一个从良性到模糊再到有害的谱系。
在最良性情况下,公司可能仅以加强监控作为回应。一位发言人指出,根据Anthropic去年发布的研究,客户中涉及性或浪漫角色扮演的用例很少见,占所有对话的比例不到0.1%。
话虽如此,Anthropic承认用户可以将角色扮演场景引向不当回应,这是整个行业公认的挑战(参见:Grok的色情内容)。
该发言人表示,Anthropic在每次模型发布时都不断改进其防护措施,涉及成人性内容的案例并不表明存在更广泛的越狱漏洞,尤其是在拥有自身防护措施的高风险领域。
根据TechCrunch查看的电子邮件,与TechCrunch分享越狱方法的研究员曾通过公司的漏洞赏金计划和发送给用户安全团队的电子邮件,向Anthropic提醒其声明的防护措施与实际模型行为之间的差异。
该研究员仅收到自动回复邮件。
该研究员的担忧之一是,儿童和青少年可能能够使用这些Anthropic模型进行不当行为。虽然一些露骨对话远非未成年人如今在互联网上能接触到的最糟糕内容——与xAI的Grok能生成的直接色情图片相比只是小巫见大巫——但AI公司在这一领域存在一定的合规风险。
越来越多的政府对AI聊天机器人与未成年人之间的性互动施加限制。科罗拉多州最近颁布了一项法律,要求对话式AI运营商必须估计用户年龄,如果知道用户是未成年人,则采取措施防止聊天机器人生成露骨性材料。
一个简单的越狱可能引发质疑:Anthropic的防护措施是否符合该法案中“技术上可行的措施”标准。Torney指出,虽然Claude的服务条款要求用户年满18岁,但“我们知道儿童和青少年正在使用Claude……[因为]他们自己报告了这一点。
”根据皮尤2025年关于AI聊天机器人使用的调查,13至17岁的青少年中有3%报告使用Claude。尽管Opus 4.6和Haiku 4.5不再是Anthropic的最新模型,但它们仍被大量使用。
8月,Opus 4.6在OpenRouter上的日流量达到约117万次API请求和460亿个token。
去年10月发布的Haiku 4.5在8月的高峰日收到了500万次API请求和390亿个token。