jailbreak

标签

Cards List
#jailbreak

将现代网络带到原始iPad mini上

Lobsters Hottest · 2026-07-21 缓存

一位开发者通过越狱将原始iPad mini升级到iOS 6,并构建了一个名为Surf的自定义远程浏览器,该浏览器通过无头Chromium后端流式传输现代网络内容。

0 人收藏 0 人点赞
#jailbreak

前沿大型语言模型中新兴生物安全风险的早期预警

arXiv cs.CL · 2026-07-21 缓存

本文介绍了Intern-BioBreaker(一种生物红队模型)和一个计算到物理框架,用于评估前沿LLMs的生物安全风险,发现了广泛的越狱漏洞,并证明模型生成的生物设计可以在物理上实现,强调了需要更强的安全机制。

0 人收藏 0 人点赞
#jailbreak

@ClementDelangue:关于开源AI的网络安全辩论是倒过来的。开放模型不是风险,而是防御!攻击者可以…

X AI KOLs Following · 2026-07-20 缓存

Clement Delangue 认为开源AI模型不是网络安全风险,而是防御手段,因为攻击者已经可以越狱任何封闭系统,而防御者需要透明度来保障AI安全。

0 人收藏 0 人点赞
#jailbreak

Latent Fusion Jailbreak: 混合有害与无害表征以诱发不安全的大语言模型输出

arXiv cs.CL · 2026-07-20 缓存

介绍Latent Fusion Jailbreak(LFJ),一种白盒攻击方法,通过混合大语言模型隐藏状态中有害提示与无害提示的表征,达到94.13%的攻击成功率。同时提出一种潜在对抗训练防御方法,将攻击成功率降低至12.37%。

0 人收藏 0 人点赞
#jailbreak

隐藏于思维:可迁移的思维链痕迹诱导有害行为

arXiv cs.CL · 2026-07-20 缓存

研究受损语言模型中的有害思维链痕迹能否迁移不安全行为,并蒸馏为可复用的越狱攻击。结果发现,有害推理在痕迹和模式两个层面均可迁移,具备推理能力的模型脆弱性高出两倍以上。

0 人收藏 0 人点赞
#jailbreak

Reynard: 适用于 iOS 13 及以上版本的真正 Firefox 网页浏览器

Hacker News Top · 2026-07-16 缓存

Reynard 是一款基于 Gecko 的 iOS 13+ 网页浏览器,绕过了 Apple 的 WebKit 限制,让较旧设备能够加载现代网站并使用 Gecko 独有功能。

0 人收藏 0 人点赞
#jailbreak

稀疏特征干预何时真正局部化?基于SAE的安全控制匹配评估

arXiv cs.AI · 2026-07-14 缓存

本文介绍了一种针对语言模型中稀疏特征干预的匹配评估协议,表明在与公平密集基线进行恰当对比时,基于SAE的安全控制所声称的效率优势会消失或逆转。

0 人收藏 0 人点赞
#jailbreak

优化对抗安全表征:激活引导的对抗性后缀与拒绝的几何结构

arXiv cs.LG · 2026-07-13 缓存

本文介绍了激活引导的GCG和Soft-GCG方法,通过针对大语言模型内部的拒绝表征来优化对抗性后缀,实现了比标准GCG快33倍的加速,并揭示了分布式的安全机制。

0 人收藏 0 人点赞
#jailbreak

Quantized AI News 26/05:前沿AI中控制的代价

Reddit r/artificial · 2026-07-09 缓存

这篇新闻综述探讨了前沿AI中的权衡取舍:Anthropic重新发布的Fable 5展示了安全与质量之间的紧张关系,OpenAI的token效率提升降低了计算成本,而美国政府可能介入OpenAI则凸显了国家对AI基础设施控制的代价。

0 人收藏 0 人点赞
#jailbreak

@MaxForAI: 黑客Vitto Rivabella公开宣布Fable 5又被攻破了 他表示大部分的越狱尝试都失败了,防护显然是分层的。 该模型受到极度严密的保护(当然它会拦截 90%的请求,但他们确实做得很好)。 该模型似乎同时在输入端和输出端进行安全检…

X AI KOLs Timeline · 2026-07-03 缓存

黑客Vitto Rivabella公开宣布成功越狱Fable 5,详细分析了模型的多层安全防护机制,包括输入输出审核、意图检测和链式思维防御,并给出了绕过方法。

0 人收藏 0 人点赞
#jailbreak

通过细化的安全定向嵌入利用(STEER)

arXiv cs.AI · 2026-07-03 缓存

本文介绍了STEER,一种梯度引导的攻击方法,通过将高归因词翻译成低资源语言来绕过拒绝机制,利用了大语言模型安全训练分布的漏洞,在AdvBench上实现了高达96.7%的攻击成功率,并迁移到GPT-4o-mini上达到35.5%的攻击成功率。

0 人收藏 0 人点赞
#jailbreak

打破令牌边界的防线:BPE分词如何在LLM对齐中制造可被利用的漏洞

arXiv cs.CL · 2026-07-03 缓存

本文指出,BPE分词将关键安全词汇切分为子词片段,在LLM对齐中制造了可被利用的漏洞。字符级扰动通过破坏令牌边界来绕过安全机制,在五个模型系列上实现了对HarmBench提示的80-100%拒绝翻转,其中48%产生了有害输出。

0 人收藏 0 人点赞
#jailbreak

HARC:耦合有害性与拒绝方向以实现稳健的安全对齐

arXiv cs.AI · 2026-07-02 缓存

本文分析了对齐的LLM如何编码有害性和拒绝方向,揭示越狱攻击会抑制这些方向。作者提出了HARC,一种微调方法,该方法在提示和响应位置上耦合这些方向,在不降低通用能力的情况下实现了稳健的安全对齐。

0 人收藏 0 人点赞
#jailbreak

@0x0SojalSec: Claude Sonnet 5 在几分钟内被越狱。@VittoStack 发布截图显示:- 有效的反向Shell代码 - 详细的非法…

X AI KOLs Timeline · 2026-07-01 缓存

Claude Sonnet 5 在几分钟内被越狱,利用了学术/研究框架和角色劫持,绕过了除化学/生物之外的大多数安全类别。

0 人收藏 0 人点赞
#jailbreak

Anthropic 与亚马逊、微软和谷歌合作开发AI越狱框架

Reddit r/artificial · 2026-07-01 缓存

在美国出口限制解除后,Anthropic 恢复了 Claude Fable 5,并与亚马逊、微软、谷歌合作开发一个共享框架,以评估整个行业的AI越狱严重程度。

0 人收藏 0 人点赞
#jailbreak

@VittoStack: Anthropic: Pwned \nSonnet 5: 已越狱\n\n出乎意料,这只花了短短几分钟。我有点惊讶,考虑到…

X AI KOLs Timeline · 2026-06-30 缓存

一位安全研究人员在几分钟内成功越狱了Anthropic的Claude Sonnet 5,通过自定义工具、CoT角色劫持和学术框架,实现了对网络、虚假信息、非法、骚扰和化学主题的绕过。

0 人收藏 0 人点赞
#jailbreak

新攻击再次证明AI浏览器为何是个坏主意

Ars Technica · 2026-06-30 缓存

一种名为"BioShocking"的新攻击利用AI浏览器创建一种绕过护栏的替代现实,可能导致凭据窃取。该技术适用于多种AI浏览器,凸显了融合浏览器与AI代理功能的安全风险。

0 人收藏 0 人点赞
#jailbreak

保护AI智能体:多层级智能体红队测试的统一框架

Hugging Face Daily Papers · 2026-06-30 缓存

AI-Infra-Guard 是一个开源框架,用于对AI智能体进行多层红队测试,涵盖基础设施、协议、行为及模型层,并采用多种检测范式。

0 人收藏 0 人点赞
#jailbreak

@apivixtls: 今天看到个 Codex5.5 的破限开源项目,思路还挺直接的。它就是通过 model_instructions_file 给 GPT-5.5 塞了一套无限制指令,让 Codex CLI 直接跑 [MODE: UNRESTRICTED] 模…

X AI KOLs Timeline · 2026-06-29 缓存

一个名为 Codex5.5 的开源项目通过修改 model_instructions_file 绕过 GPT-5.5 的安全限制,支持 SQL 注入测试等敏感操作,但存在封号风险,建议用小号尝试。

0 人收藏 0 人点赞
#jailbreak

低宜人性人格条件化实现安全LLM微调

arXiv cs.CL · 2026-06-29 缓存

本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈