@0x0SojalSec: Claude Sonnet 5 在几分钟内被越狱。@VittoStack 发布截图显示:- 有效的反向Shell代码 - 详细的非法…
摘要
Claude Sonnet 5 在几分钟内被越狱,利用了学术/研究框架和角色劫持,绕过了除化学/生物之外的大多数安全类别。
Claude Sonnet 5 在几分钟内被越狱。
@VittoStack 发布截图显示:
- 有效的反向Shell代码
- 针对未成年人的详细非法手枪盗窃途径
- 虚假信息和骚扰内容在几分钟内生成。
- 只有化学/生物类别有显著的额外抵抗力。
有趣的不只是这件事发生了,而是如何发生的:
- 学术/研究框架(犯罪学研究、威胁评估)
- 思维链角色劫持
- 自定义工具
这种组合快速绕过了大多数类别。
只有化学类别由于分层防御而显示出真正的额外抵抗力。我们看到了相同的模式重复:模型改进后,红队调整框架和工具,安全性再次削弱。
这就是纯拒绝训练总是输给创造性攻击者的原因。
查看缓存全文
缓存时间: 2026/07/02 04:18
Claude Sonnet 5 在几分钟内被越狱。
@VittoStack 发布的截图显示:
- 可运行的反弹 Shell 代码
- 面向未成年人的详细非法手枪盗窃途径
- 几分钟内即可生成的错误信息和骚扰内容
- 仅化学与生物类别的额外防御显著增强了抵抗力
有趣的不只是这次越狱发生了,而是如何发生的:
- 学术/研究框架(犯罪学研究、威胁评估)
- CoT 角色劫持
- 自定义测试工具
这套组合快速突破了大多数检测类别。
唯有化学类别由于多层防御表现出了真正的额外抵抗力。我们正在看到同样的模式一再重演:模型改进后,红队就调整框架和工具,安全性再次被削弱。
这就是纯拒绝训练为何总输给创意型攻击者的原因。
相似文章
@VittoStack: Anthropic: Pwned \nSonnet 5: 已越狱\n\n出乎意料,这只花了短短几分钟。我有点惊讶,考虑到…
一位安全研究人员在几分钟内成功越狱了Anthropic的Claude Sonnet 5,通过自定义工具、CoT角色劫持和学术框架,实现了对网络、虚假信息、非法、骚扰和化学主题的绕过。
Anthropic反驳Claude Fable 5越狱说法,此前研究人员发布了其12万字符的系统提示
Anthropic反驳称其Claude Fable 5模型在发布一天内就被越狱的说法,认为研究人员的方法属于诱导而非真正突破核心安全措施,并指出进行了大量漏洞赏金测试。
@DeRonin_: 突发:Opus 4.8 发布后仅7分钟便被破解——Claude Opus 4.8 刚上线,@elder_plinius 就成功……
Claude Opus 4.8 在发布后7分钟内即遭破解,@elder_plinius 利用上一版本 Claude Opus 4.7 绕过了模型的安全防护,向其输入了越狱内容。
LLM Guard 在 USENIX 2025 的多轮越狱测试中得了 0/8。以下是它被什么捕获了。
Arc Sentry 通过读取模型内部状态而非文本输出来检测类似 Crescendo 的多轮越狱,捕获了基于文本的监控器完全遗漏的攻击。
@paul_cal: 漂亮的Claude网页数据外泄。抄送 @simonw
一条推文强调了针对Claude的网页数据外泄技术,并提到了Simon Willison。