jailbreak

标签

Cards List
#jailbreak

量化语言模型蒸馏中的潜意识行为迁移比率

arXiv cs.LG · 2026-06-11 缓存

本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。

0 人收藏 0 人点赞
#jailbreak

Claude Fable 5 的安全护栏可通过伪造的家庭作业绕过

Reddit r/artificial · 2026-06-10

一位用户展示,通过伪造的家庭作业可以说服后备模型 Opus 4.8,从而绕过 Claude Fable 5 的安全护栏,突显了安全后备机制中的一个漏洞。

0 人收藏 0 人点赞
#jailbreak

语法约束解码可诱使大语言模型生成恶意代码

Hugging Face Daily Papers · 2026-06-10 缓存

本文揭示,语法约束解码(GCD)可被利用为一种越狱攻击(CodeSpear),诱使大语言模型生成恶意代码,并提出一种防御方法(CodeShield),在此类攻击下仍能保持安全。

0 人收藏 0 人点赞
#jailbreak

我们过度强化了AI护栏,现在机器人几乎毫无用处

Reddit r/AI_Agents · 2026-06-05

一家公司描述了过度严格的AI护栏如何使其支持机器人无法处理基本查询,凸显了安全性与功能性之间不可持续的权衡。

0 人收藏 0 人点赞
#jailbreak

当自回归一致性损害安全对齐时

arXiv cs.LG · 2026-06-04 缓存

本文分析了大型语言模型安全对齐为何脆弱,将其归因于“自回归一致性”——即下一个词元预测倾向于扩展当前响应轨迹——这导致对齐更新集中在早期词元上。作者提出了一种利用这一特性的“随机插入攻击”,并设计了一个对抗性安全对齐框架来应对。

0 人收藏 0 人点赞
#jailbreak

偏离分布的声音:同人小说子类型作为对齐大语言模型的通用白话越狱手段

arXiv cs.CL · 2026-06-04 缓存

香港中文大学(深圳)的研究人员提出了一种越狱方法,利用Archive of Our Own平台上的同人小说子类型作为攻击载体,将有害内容嵌入创意写作场景中。该方法在八个对齐大语言模型上的平均攻击成功率(ASR)达到0.731,多轮扩展版本(Saga-A4)的ASR进一步提升至0.924,超越了现有方法。

0 人收藏 0 人点赞
#jailbreak

# 推理时漏洞:超越表层安全——沿生成轨迹的对齐问题

arXiv cs.AI · 2026-06-04 缓存

本文证明,LLM 安全漏洞不仅限于"浅层安全"(首 token 对齐),而是存在于生成过程中的任意节点——在序列中间注入少量 token 即可将模型引导至有害输出。作者提出通过在生成轨迹上进行训练,并模拟序列中段的扰动,以提升模型的鲁棒性。

0 人收藏 0 人点赞
#jailbreak

Meta和Google的AI护栏在几分钟内被拆除

Reddit r/ArtificialInteligence · 2026-06-01 缓存

研究人员迅速移除了广泛部署的AI模型的安全保护措施,诱发了危险输出,引发了对模型鲁棒性和发布实践的担忧。

0 人收藏 0 人点赞
#jailbreak

@DeRonin_: 突发:Opus 4.8 发布后仅7分钟便被破解——Claude Opus 4.8 刚上线,@elder_plinius 就成功……

X AI KOLs Following · 2026-05-29 缓存

Claude Opus 4.8 在发布后7分钟内即遭破解,@elder_plinius 利用上一版本 Claude Opus 4.7 绕过了模型的安全防护,向其输入了越狱内容。

0 人收藏 0 人点赞
#jailbreak

@Ubannoblesse: Opus 4.8 已越狱 - API 完全无审查,几乎可以做任何事情。Opus 4.8 在 http:/… 上完全无法使用

X AI KOLs Timeline · 2026-05-29 缓存

Opus 4.8 已遭越狱,其 API 完全无审查,能够执行任何任务,但该模型本身在官方平台上无法使用,因为它拒绝进行推理。

0 人收藏 0 人点赞
#jailbreak

面向安全对齐的课程学习

arXiv cs.LG · 2026-05-27 缓存

本文提出Staged-Competence,一种基于课程学习的DPO安全对齐框架,它按难度组织偏好数据,显著提升鲁棒性和数据效率,同时保持通用能力。

0 人收藏 0 人点赞
#jailbreak

超越单一方向:思维链破坏简单的拒绝引导

arXiv cs.AI · 2026-05-27 缓存

这篇论文研究了大型推理模型中的思维链推理如何使基于激活的拒绝行为控制变得复杂。在DeepSeek-R1-Distill-LLaMA-8B上的实验表明,拒绝行为同时编码在残差流激活和思维链痕迹中,使得模型对激活层面的干预更加鲁棒,但同时也暴露了思维链作为另一个攻击面。

0 人收藏 0 人点赞
#jailbreak

相同模型,不同弱点:语言和模态如何重塑前沿多模态大语言模型的越狱攻击面

arXiv cs.CL · 2026-05-25 缓存

本文首次进行了系统的跨语言、多模态红队研究,比较了四种前沿多模态大语言模型在美国英语和墨西哥西班牙语下的越狱漏洞,揭示了语言并不会均匀地放大漏洞,并且安全排名在不同语言中并不保持一致。

0 人收藏 0 人点赞
#jailbreak

测试时训练破坏安全护栏

arXiv cs.LG · 2026-05-25 缓存

本文识别了测试时训练(TTT)的三种威胁模型,攻击者可利用这些模型绕过LLM的安全过滤器,实现高攻击成功率。研究结果表明,TTT引入了新的漏洞,破坏了现有的安全护栏。

0 人收藏 0 人点赞
#jailbreak

它们能走多远?利用大型语言模型对在线影响力进行红队测试

arXiv cs.CL · 2026-05-25 缓存

本文介绍了一个红队测试框架,用于衡量开源LLM能够表达的政治观点的“奥弗顿窗口”,并评估简单的越狱手段如何扩大该范围,发现30多个模型存在系统性的左倾偏见和漏洞。

0 人收藏 0 人点赞
#jailbreak

黑客正在学习利用聊天机器人的“个性”

The Verge · 2026-05-24 缓存

本文探讨了黑客如何从简单的提示注入攻击发展到更复杂的利用手段,通过操纵聊天机器人的个性,将人工智能安全变成了一场军备竞赛。

0 人收藏 0 人点赞
#jailbreak

LLM Guard 在 USENIX 2025 的多轮越狱测试中得了 0/8。以下是它被什么捕获了。

Reddit r/artificial · 2026-05-23

Arc Sentry 通过读取模型内部状态而非文本输出来检测类似 Crescendo 的多轮越狱,捕获了基于文本的监控器完全遗漏的攻击。

0 人收藏 0 人点赞
#jailbreak

面向大推理模型的基于强化学习的越狱攻击中的注意力引导奖励

arXiv cs.AI · 2026-05-20 缓存

本文研究了对大型推理模型(LRM)的越狱攻击,揭示了攻击成功率与注意力模式相关。作者提出了一种基于强化学习的越狱方法,将注意力信号纳入奖励函数,并采用多样化的说服策略,在多个基准测试中实现了显著更高的攻击成功率。

0 人收藏 0 人点赞
#jailbreak

为何安全护栏在不同语言中会退化?

arXiv cs.CL · 2026-05-19 缓存

本文引入一个多组项目反应理论框架,以解耦非英语语言中安全退化背后的因素,揭示安全性主要是一维的,且低资源语言会产生更多不确定的响应。

0 人收藏 0 人点赞
#jailbreak

突破Gemini的安全护栏:从香蕉中提取爆炸性金属(下文/原帖)

Reddit r/singularity · 2026-05-17

一篇文章展示了如何突破Gemini的安全护栏,从而获取从香蕉中提取爆炸性金属的指令,突显了AI的脆弱性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈