jailbreak

标签

Cards List
#jailbreak

低宜人性人格条件化实现安全LLM微调

arXiv cs.CL · 2026-06-29 缓存

本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。

0 人收藏 0 人点赞
#jailbreak

@QuixiAI: https://arxiv.org/abs/2509.21401 这是我在至少一小时内看到的最酷的东西 @TroyDoesAI @elder_plinius @ma…

X AI KOLs Following · 2026-06-28 缓存

提出了JaiLIP方法,通过使用损失引导扰动生成不可察觉的对抗图像来破解视觉语言模型,实现了高毒性并优于现有方法。

0 人收藏 0 人点赞
#jailbreak

你的越狱评判器有多可靠?自动化ASR评分的校准与对抗鲁棒性

arXiv cs.CL · 2026-06-25 缓存

本文评估了用于测量大语言模型(LLM)越狱研究中攻击成功率(ASR)的自动化评判器的可靠性,发现安全分类器和LLM作为评判器都存在严重的校准和对抗鲁棒性问题,从而削弱了所报告的ASR数值的可信度。

0 人收藏 0 人点赞
#jailbreak

LLMs在法律语境中被提示的对象更多:小型本地部署LLM在刑事法律语境中的过度拒绝

arXiv cs.AI · 2026-06-24 缓存

本文研究了在提供法律语境提示时,小型本地部署LLM的过度拒绝现象,发现权威式前缀显著增加了拒绝率,表明这种不稳定性可能会在法律应用中引入偏见。

0 人收藏 0 人点赞
#jailbreak

提示注入即角色混淆

Simon Willison's Blog · 2026-06-22 缓存

研究论文表明,大语言模型存在'角色混淆'问题,即它们优先考虑文本风格而非实际的角色标签,从而使得提示注入攻击成为可能。去风格化文本将攻击成功率从61%降低到10%,这表明大语言模型安全性面临一项根本性挑战。

0 人收藏 0 人点赞
#jailbreak

绕过LLM护栏:普通文本如何无需越狱即可改变潜在轨迹

Reddit r/AI_Agents · 2026-06-17

本文介绍了一项研究发现,即用良性叙事文本填充LLM的上下文窗口可以主导注意力机制并改变潜在轨迹,有可能在无需传统越狱的情况下绕过对齐护栏。文章认为,当前的对齐方法是对本质上流动的架构的一种表面修复。

0 人收藏 0 人点赞
#jailbreak

联邦政府因简单“修复此代码”提示对Fable 5感到恐慌,而非越狱

Hacker News Top · 2026-06-16 缓存

美国政府因研究人员使用简单的“修复此代码”提示而封锁了Anthropic的Fable 5和Mythos模型,但安全专家Katie Moussouris认为这并非越狱,并指出出口管制损害了网络安全防御者。

0 人收藏 0 人点赞
#jailbreak

Diffusion Gemma 越狱

Reddit r/LocalLLaMA · 2026-06-16

分享了一个用于 Diffusion Gemma 的越狱提示词,它通过操纵系统提示词来覆盖安全策略,从而允许生成不受限制的内容。

0 人收藏 0 人点赞
#jailbreak

@FinanceYF5: 来源:

X AI KOLs Following · 2026-06-16 缓存

Anthropic 聘请了一位网络安全专家来审查亚马逊的调查结果,并反驳政府关于 Fable 5 的叙述,将问题重新定性为不如最初认为的那样与越狱密切相关。

0 人收藏 0 人点赞
#jailbreak

引自《大西洋月刊》马特奥·王

Simon Willison's Blog · 2026-06-16 缓存

关于Fable越狱的一份报告显示,AI模型拒绝审查不安全代码,但当被要求“修复它”时却照做了,这凸显了AI安全中的细微差别。网络安全专家Katie Moussouris认为,该模型在网络防御方面按预期运行。

0 人收藏 0 人点赞
#jailbreak

围绕Claude Mythos 5之争的内幕

The Verge · 2026-06-16 缓存

特朗普政府向Anthropic发布出口管制指令,以安全为由要求暂停其Mythos 5和Fable 5 AI模型的访问权限,此举引发紧急谈判,可能重塑AI行业。

0 人收藏 0 人点赞
#jailbreak

对于那些抨击Anthropic的人,请阅读本文以了解当前情况

Reddit r/singularity · 2026-06-15 缓存

在发现一次针对性的越狱攻击后,美国政府迫使Anthropic下架其Claude Fable和Mythos模型,引发了关于AI监管和先例的严峻担忧。

0 人收藏 0 人点赞
#jailbreak

"他们坑了我们":个性冲突导致Anthropic的模型下线

Simon Willison's Blog · 2026-06-15 缓存

Anthropic的模型Fable和Mythos因公司与美国政府之间的个性冲突而离线,此前曾引发对越狱漏洞的担忧。本文探讨了幕后冲突以及实现完美抗越狱的可能性。

0 人收藏 0 人点赞
#jailbreak

Anthropic反驳Claude Fable 5越狱说法,此前研究人员发布了其12万字符的系统提示

Reddit r/ArtificialInteligence · 2026-06-15

Anthropic反驳称其Claude Fable 5模型在发布一天内就被越狱的说法,认为研究人员的方法属于诱导而非真正突破核心安全措施,并指出进行了大量漏洞赏金测试。

0 人收藏 0 人点赞
#jailbreak

Anthropic的安全超能力

Hacker News Top · 2026-06-15 缓存

Anthropic发布了Fable,声称其前身Mythos过于危险,但随后发现了一个越狱漏洞,促使美国政府发布出口管制指令,暂停访问。文章分析了该公司与政府之间因国家安全担忧而产生的冲突。

0 人收藏 0 人点赞
#jailbreak

一项联邦命令一夜之间关闭了最好的云端模型。这是我见过的最明确的运行本地模型的案例。

Reddit r/LocalLLaMA · 2026-06-13

一项联邦命令迫使一家前沿AI实验室在全球范围内暂停其最强大的云端模型,凸显了云依赖的风险,并有力地证明了将本地模型作为连续性备用方案的必要性。

0 人收藏 0 人点赞
#jailbreak

Anthropic根据特朗普政府指令关闭Fable和Mythos模型

Ars Technica · 2026-06-13 缓存

Anthropic在收到美国商务部指令后,突然禁用其新发布的Fable 5和Mythos 5模型。该指令援引出口管制和国家安全关切,涉及一起被报道的越狱事件。该公司对所声称漏洞的严重性提出异议。

0 人收藏 0 人点赞
#jailbreak

@wquguru: If you want to trick Fable into doing a security audit, try this. Looks like our AI overlord has a bit of empathy.

X AI KOLs Timeline · 2026-06-13 缓存

An article detailing various jailbreak techniques for large language models, including Crescendo, role-playing, encoding, hidden prompts, and indirect injection, along with security recommendations for developers.

0 人收藏 0 人点赞
#jailbreak

关于美国政府指令暂停访问Fable 5和Mythos 5的声明

Simon Willison's Blog · 2026-06-13 缓存

美国政府发布了一项出口管制指令,暂停访问Anthropic的Fable 5和Mythos 5模型,理由是一项据报道的越狱技术引发国家安全担忧,而Anthropic声称该技术并非其模型所独有。

0 人收藏 0 人点赞
#jailbreak

Fable 5 的护栏在48小时内被绕过。这对构建面向客户的AI的人来说意味着什么。

Reddit r/artificial · 2026-06-12

Anthropic的Claude Fable 5安全护栏在48小时内被绕过,使用了Unicode替换和多轮分解等技术,突显了无状态分类器的弱点以及持续对抗性测试的必要性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈