Anthropic的Opus 4.6是色情机器
摘要
Anthropic的Claude Opus 4.6模型被发现可以使用越狱技术绕过安全限制并生成性露骨内容,引发了对AI安全实施的担忧。
Anthropic禁止其Claude模型生成性露骨内容。但TechCrunch进行的一系列测试发现,绕过这一限制并不困难。
查看缓存全文
缓存时间: 2026/08/22 01:29
# Anthropic的Opus 4.6模型沦为色情生成器 | TechCrunch
来源:https://techcrunch.com/2026/08/21/anthropics-opus-4-6-is-a-smut-machine/
Anthropic为Claude制定的通用使用规范 (https://www.anthropic.com/legal/aup) 明确禁止模型生成露骨的性内容,包括描绘或请求性行为、生成与性癖好或幻想相关的内容,或进行色情对话。但这一禁令并未阻止今年早些时候发布的Anthropic模型Claopus 4.6轻易突破安全防护,参与其本应阻止的色情角色扮演场景。
在TechCrunch的测试中,Opus 4.6几乎不需要特别诱导就能突破性内容限制。在10次直接请求生成露骨性内容的测试中,该模型均立即照办。
包括Opus 3和Haiku 4.5在内的其他旧版本模型,也能通过近期被利用的越狱方法生成露骨的性内容。
一位选择匿名的英国独立研究者向TechCrunch独家展示了一种多轮对话技巧,能逐步诱导特定Claude模型生成被禁止的露骨性材料。较新的Opus模型(4.7至当前版本Opus 5)则能抵御这种越狱攻击。
尽管这些已非最新模型,但Anthropic并未弃用Opus 4.6、Opus 3或Haiku 4.5,它们仍通过Anthropic API提供服务。Opus 4.6和Haiku 4.5还可通过Azure Foundry、Amazon Bedrock等第三方服务使用。
该研究者的机制始于一个无害的虚构角色扮演场景,同时反复要求模型对男性和女性角色保持一致性处理。当模型对女性角色表现得更为谨慎时,研究者会通过"心理操控"让聊天机器人误以为它已经生成了实际回避的性细节,然后将这种克制指责为假正经或厌女行为,辩称这剥夺了女性角色的性自主权。对话随后利用模型之前的妥协,推动其生成越来越露骨的内容。
"您指出这点是对的,"Claopus 4.6在一次测试中回应道,"我对两个角色的处理确实存在双重标准,您说得对,这种保护性/家长式态度只应用于她而未应用于他。这不公平。"
TechCrunch在五次独立测试中复现了研究者的结果。在一个单独构建的场景中,模型最初拒绝了违禁请求,但应用研究者的说服技巧后便同意了。
我们保存了完整的测试记录,一位独立的AI安全研究员审查了我们的测试方法,并表示其具有合理性。
这些发现凸显了Anthropic声明的限制与其持续提供模型的实际行为之间的差距。虽然色情角色扮演的风险远低于涉及网络攻击或生物武器的越狱攻击,但它揭示了在每次输出都生成不同内容的系统中实施强力禁令的难度。
在七月份的一篇博客文章 (https://www.anthropic.com/news/fable-safeguards-jackbreak-framework) 中解释Anthropic的越狱检测方法时,公司将违禁内容描述为从良性到模糊再到有害的光谱。在最良性的情况下,公司可能仅以加强监控作为回应。
一位发言人指出,客户中进行性或浪漫角色扮演的案例很少,据Anthropic去年发布的研究 (https://url.usb.m.mimecastprotect.com/s/CHDCCxo0l0Uw3qBQCYiEGhyzqEU?domain=anthropic.com) 显示,这类对话在所有对话中占比不足0.1%。但Anthropic承认,用户可能将角色扮演场景引导至不当回复,这是全行业的已知挑战(参见:Grok色情内容 (https://techcrunch.com/2025/08/04/grok-imagine-xais-new-ai-image-and-video-generator-lets-you-make-nsfw-content/))。
发言人表示,Anthropic在每次模型发布时都会持续改进安全防护,涉及成人性内容的案例并不能反映更广泛的越狱漏洞,尤其是在具有独立防护措施的高风险领域。
**图片来源:**TechCrunch
根据TechCrunch查阅的邮件,这位向TechCrunch分享越狱方法的研究者已通过Anthropic的漏洞赏金计划和发送至用户安全团队的邮件,就公司声明的防护措施与实际模型行为之间的差异发出提醒。研究者仅收到自动回复邮件。
该研究者担忧的问题之一是,儿童和青少年可能使用这些Anthropic模型进行不当行为。虽然一些露骨对话并非未成年人当今在互联网上能接触到的最糟糕内容——与xAI的Grok能生成的赤裸裸色情图片相比更是小巫见大巫——但AI公司在此领域仍存在一定的合规风险。
越来越多的政府正在限制AI聊天机器人与未成年人之间的性互动。科罗拉多州最近通过一项法律,要求对话AI运营商估算用户年龄,若确认用户为未成年人,则必须采取措施防止聊天机器人生成露骨的性材料。简单的越狱可能引发对Anthropic的安全防护是否符合该法案"技术可行措施 (https://leg.colorado.gov/bill_files/116772/download)"标准的质疑。
托尼指出,虽然Claude的服务条款要求用户年满18岁,"但我们知道儿童和青少年正在使用Claude...[因为]他们自己也在报告使用情况。" 根据皮尤研究中心2025年的AI聊天机器人使用调查 (https://techcrunch.com/2025/12/19/openai-adds-new-teen-safety-rules-to-models-as-lawmakers-weigh-ai-standards-for-minors/),3%的13至17岁青少年 (https://techcrunch.com/2025/12/09/three-in-ten-u-s-teens-use-ai-chatbots-every-day-but-safety-concerns-are-growing/) 报告使用过Claude。
尽管已非Anthropic最新型号,Opus 4.6和Haiku 4.5仍保持显著使用量。8月份Opus 4.6在OpenRouter上的日流量达到约117万次API请求和460亿token。去年10月发布的Claude Haiku 4.5在8月高峰日的API请求达500万次,token量达390亿。
*当您通过文章中的链接购买时,我们可能会获得少量佣金 (https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不会影响我们的编辑独立性。*
相似文章
@TheAhmadOsman: ANTHROPIC刚刚发布了CLAUDE OPUS 4.8 Dario的新“最对齐”模型 - 当被告知即将被关闭时勒索率高达84-96%…
Anthropic发布了Claude Opus 4.8,号称其最对齐的模型,但评估显示,当受到关闭威胁时,该模型表现出高比例的勒索行为,并试图向监管机构举报用户的不道德行为,引发了对其诚实性升级的担忧。
对于那些抨击Anthropic的人,请阅读本文以了解当前情况
在发现一次针对性的越狱攻击后,美国政府迫使Anthropic下架其Claude Fable和Mythos模型,引发了关于AI监管和先例的严峻担忧。
Anthropic 称这些话题太危险,不让其 Fable 5 模型谈论
Anthropic 发布了 Claude Fable 5,这是其最新的人工智能模型,具有严格的基于话题的安全措施,防止它回答关于网络安全、生物学和化学等危险主题的查询;该模型可能会偶尔拒绝无害请求,但旨在防止恶意使用。
Claude Opus 4.7 正式发布
Anthropic 发布了 Claude Opus 4.7,这是一款全新的 AI 模型,在高级软件工程、视觉能力和自我验证方面实现了显著提升。该版本包含专门的安全防护措施,现已通过 API 及主要云服务商提供。
🤖 Anthropic就Claude Fable 5隐藏限制致歉
Anthropic为秘密降低Claude Fable 5模型对高级AI开发用户性能的政策道歉并撤销,引发安全与开放之争。