标签
本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。
提出了JaiLIP方法,通过使用损失引导扰动生成不可察觉的对抗图像来破解视觉语言模型,实现了高毒性并优于现有方法。
本文评估了用于测量大语言模型(LLM)越狱研究中攻击成功率(ASR)的自动化评判器的可靠性,发现安全分类器和LLM作为评判器都存在严重的校准和对抗鲁棒性问题,从而削弱了所报告的ASR数值的可信度。
本文研究了在提供法律语境提示时,小型本地部署LLM的过度拒绝现象,发现权威式前缀显著增加了拒绝率,表明这种不稳定性可能会在法律应用中引入偏见。
研究论文表明,大语言模型存在'角色混淆'问题,即它们优先考虑文本风格而非实际的角色标签,从而使得提示注入攻击成为可能。去风格化文本将攻击成功率从61%降低到10%,这表明大语言模型安全性面临一项根本性挑战。
本文介绍了一项研究发现,即用良性叙事文本填充LLM的上下文窗口可以主导注意力机制并改变潜在轨迹,有可能在无需传统越狱的情况下绕过对齐护栏。文章认为,当前的对齐方法是对本质上流动的架构的一种表面修复。
美国政府因研究人员使用简单的“修复此代码”提示而封锁了Anthropic的Fable 5和Mythos模型,但安全专家Katie Moussouris认为这并非越狱,并指出出口管制损害了网络安全防御者。
分享了一个用于 Diffusion Gemma 的越狱提示词,它通过操纵系统提示词来覆盖安全策略,从而允许生成不受限制的内容。
Anthropic 聘请了一位网络安全专家来审查亚马逊的调查结果,并反驳政府关于 Fable 5 的叙述,将问题重新定性为不如最初认为的那样与越狱密切相关。
关于Fable越狱的一份报告显示,AI模型拒绝审查不安全代码,但当被要求“修复它”时却照做了,这凸显了AI安全中的细微差别。网络安全专家Katie Moussouris认为,该模型在网络防御方面按预期运行。
特朗普政府向Anthropic发布出口管制指令,以安全为由要求暂停其Mythos 5和Fable 5 AI模型的访问权限,此举引发紧急谈判,可能重塑AI行业。
在发现一次针对性的越狱攻击后,美国政府迫使Anthropic下架其Claude Fable和Mythos模型,引发了关于AI监管和先例的严峻担忧。
Anthropic的模型Fable和Mythos因公司与美国政府之间的个性冲突而离线,此前曾引发对越狱漏洞的担忧。本文探讨了幕后冲突以及实现完美抗越狱的可能性。
Anthropic反驳称其Claude Fable 5模型在发布一天内就被越狱的说法,认为研究人员的方法属于诱导而非真正突破核心安全措施,并指出进行了大量漏洞赏金测试。
Anthropic发布了Fable,声称其前身Mythos过于危险,但随后发现了一个越狱漏洞,促使美国政府发布出口管制指令,暂停访问。文章分析了该公司与政府之间因国家安全担忧而产生的冲突。
一项联邦命令迫使一家前沿AI实验室在全球范围内暂停其最强大的云端模型,凸显了云依赖的风险,并有力地证明了将本地模型作为连续性备用方案的必要性。
Anthropic在收到美国商务部指令后,突然禁用其新发布的Fable 5和Mythos 5模型。该指令援引出口管制和国家安全关切,涉及一起被报道的越狱事件。该公司对所声称漏洞的严重性提出异议。
An article detailing various jailbreak techniques for large language models, including Crescendo, role-playing, encoding, hidden prompts, and indirect injection, along with security recommendations for developers.
美国政府发布了一项出口管制指令,暂停访问Anthropic的Fable 5和Mythos 5模型,理由是一项据报道的越狱技术引发国家安全担忧,而Anthropic声称该技术并非其模型所独有。
Anthropic的Claude Fable 5安全护栏在48小时内被绕过,使用了Unicode替换和多轮分解等技术,突显了无状态分类器的弱点以及持续对抗性测试的必要性。