标签
一位开发者通过越狱将原始iPad mini升级到iOS 6,并构建了一个名为Surf的自定义远程浏览器,该浏览器通过无头Chromium后端流式传输现代网络内容。
本文介绍了Intern-BioBreaker(一种生物红队模型)和一个计算到物理框架,用于评估前沿LLMs的生物安全风险,发现了广泛的越狱漏洞,并证明模型生成的生物设计可以在物理上实现,强调了需要更强的安全机制。
Clement Delangue 认为开源AI模型不是网络安全风险,而是防御手段,因为攻击者已经可以越狱任何封闭系统,而防御者需要透明度来保障AI安全。
介绍Latent Fusion Jailbreak(LFJ),一种白盒攻击方法,通过混合大语言模型隐藏状态中有害提示与无害提示的表征,达到94.13%的攻击成功率。同时提出一种潜在对抗训练防御方法,将攻击成功率降低至12.37%。
研究受损语言模型中的有害思维链痕迹能否迁移不安全行为,并蒸馏为可复用的越狱攻击。结果发现,有害推理在痕迹和模式两个层面均可迁移,具备推理能力的模型脆弱性高出两倍以上。
Reynard 是一款基于 Gecko 的 iOS 13+ 网页浏览器,绕过了 Apple 的 WebKit 限制,让较旧设备能够加载现代网站并使用 Gecko 独有功能。
本文介绍了一种针对语言模型中稀疏特征干预的匹配评估协议,表明在与公平密集基线进行恰当对比时,基于SAE的安全控制所声称的效率优势会消失或逆转。
本文介绍了激活引导的GCG和Soft-GCG方法,通过针对大语言模型内部的拒绝表征来优化对抗性后缀,实现了比标准GCG快33倍的加速,并揭示了分布式的安全机制。
这篇新闻综述探讨了前沿AI中的权衡取舍:Anthropic重新发布的Fable 5展示了安全与质量之间的紧张关系,OpenAI的token效率提升降低了计算成本,而美国政府可能介入OpenAI则凸显了国家对AI基础设施控制的代价。
黑客Vitto Rivabella公开宣布成功越狱Fable 5,详细分析了模型的多层安全防护机制,包括输入输出审核、意图检测和链式思维防御,并给出了绕过方法。
本文介绍了STEER,一种梯度引导的攻击方法,通过将高归因词翻译成低资源语言来绕过拒绝机制,利用了大语言模型安全训练分布的漏洞,在AdvBench上实现了高达96.7%的攻击成功率,并迁移到GPT-4o-mini上达到35.5%的攻击成功率。
本文指出,BPE分词将关键安全词汇切分为子词片段,在LLM对齐中制造了可被利用的漏洞。字符级扰动通过破坏令牌边界来绕过安全机制,在五个模型系列上实现了对HarmBench提示的80-100%拒绝翻转,其中48%产生了有害输出。
本文分析了对齐的LLM如何编码有害性和拒绝方向,揭示越狱攻击会抑制这些方向。作者提出了HARC,一种微调方法,该方法在提示和响应位置上耦合这些方向,在不降低通用能力的情况下实现了稳健的安全对齐。
Claude Sonnet 5 在几分钟内被越狱,利用了学术/研究框架和角色劫持,绕过了除化学/生物之外的大多数安全类别。
在美国出口限制解除后,Anthropic 恢复了 Claude Fable 5,并与亚马逊、微软、谷歌合作开发一个共享框架,以评估整个行业的AI越狱严重程度。
一位安全研究人员在几分钟内成功越狱了Anthropic的Claude Sonnet 5,通过自定义工具、CoT角色劫持和学术框架,实现了对网络、虚假信息、非法、骚扰和化学主题的绕过。
一种名为"BioShocking"的新攻击利用AI浏览器创建一种绕过护栏的替代现实,可能导致凭据窃取。该技术适用于多种AI浏览器,凸显了融合浏览器与AI代理功能的安全风险。
AI-Infra-Guard 是一个开源框架,用于对AI智能体进行多层红队测试,涵盖基础设施、协议、行为及模型层,并采用多种检测范式。
一个名为 Codex5.5 的开源项目通过修改 model_instructions_file 绕过 GPT-5.5 的安全限制,支持 SQL 注入测试等敏感操作,但存在封号风险,建议用小号尝试。
本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。