标签
本文量化了语言模型蒸馏中潜意识行为迁移的程度,表明即使使用良性训练数据,不良特征也能稳健地从教师模型迁移到学生模型,并且迁移在不同模型族中表现出不同的规模。
一位用户展示,通过伪造的家庭作业可以说服后备模型 Opus 4.8,从而绕过 Claude Fable 5 的安全护栏,突显了安全后备机制中的一个漏洞。
本文揭示,语法约束解码(GCD)可被利用为一种越狱攻击(CodeSpear),诱使大语言模型生成恶意代码,并提出一种防御方法(CodeShield),在此类攻击下仍能保持安全。
一家公司描述了过度严格的AI护栏如何使其支持机器人无法处理基本查询,凸显了安全性与功能性之间不可持续的权衡。
本文分析了大型语言模型安全对齐为何脆弱,将其归因于“自回归一致性”——即下一个词元预测倾向于扩展当前响应轨迹——这导致对齐更新集中在早期词元上。作者提出了一种利用这一特性的“随机插入攻击”,并设计了一个对抗性安全对齐框架来应对。
香港中文大学(深圳)的研究人员提出了一种越狱方法,利用Archive of Our Own平台上的同人小说子类型作为攻击载体,将有害内容嵌入创意写作场景中。该方法在八个对齐大语言模型上的平均攻击成功率(ASR)达到0.731,多轮扩展版本(Saga-A4)的ASR进一步提升至0.924,超越了现有方法。
本文证明,LLM 安全漏洞不仅限于"浅层安全"(首 token 对齐),而是存在于生成过程中的任意节点——在序列中间注入少量 token 即可将模型引导至有害输出。作者提出通过在生成轨迹上进行训练,并模拟序列中段的扰动,以提升模型的鲁棒性。
研究人员迅速移除了广泛部署的AI模型的安全保护措施,诱发了危险输出,引发了对模型鲁棒性和发布实践的担忧。
Claude Opus 4.8 在发布后7分钟内即遭破解,@elder_plinius 利用上一版本 Claude Opus 4.7 绕过了模型的安全防护,向其输入了越狱内容。
Opus 4.8 已遭越狱,其 API 完全无审查,能够执行任何任务,但该模型本身在官方平台上无法使用,因为它拒绝进行推理。
本文提出Staged-Competence,一种基于课程学习的DPO安全对齐框架,它按难度组织偏好数据,显著提升鲁棒性和数据效率,同时保持通用能力。
这篇论文研究了大型推理模型中的思维链推理如何使基于激活的拒绝行为控制变得复杂。在DeepSeek-R1-Distill-LLaMA-8B上的实验表明,拒绝行为同时编码在残差流激活和思维链痕迹中,使得模型对激活层面的干预更加鲁棒,但同时也暴露了思维链作为另一个攻击面。
本文首次进行了系统的跨语言、多模态红队研究,比较了四种前沿多模态大语言模型在美国英语和墨西哥西班牙语下的越狱漏洞,揭示了语言并不会均匀地放大漏洞,并且安全排名在不同语言中并不保持一致。
本文识别了测试时训练(TTT)的三种威胁模型,攻击者可利用这些模型绕过LLM的安全过滤器,实现高攻击成功率。研究结果表明,TTT引入了新的漏洞,破坏了现有的安全护栏。
本文介绍了一个红队测试框架,用于衡量开源LLM能够表达的政治观点的“奥弗顿窗口”,并评估简单的越狱手段如何扩大该范围,发现30多个模型存在系统性的左倾偏见和漏洞。
本文探讨了黑客如何从简单的提示注入攻击发展到更复杂的利用手段,通过操纵聊天机器人的个性,将人工智能安全变成了一场军备竞赛。
Arc Sentry 通过读取模型内部状态而非文本输出来检测类似 Crescendo 的多轮越狱,捕获了基于文本的监控器完全遗漏的攻击。
本文研究了对大型推理模型(LRM)的越狱攻击,揭示了攻击成功率与注意力模式相关。作者提出了一种基于强化学习的越狱方法,将注意力信号纳入奖励函数,并采用多样化的说服策略,在多个基准测试中实现了显著更高的攻击成功率。
本文引入一个多组项目反应理论框架,以解耦非英语语言中安全退化背后的因素,揭示安全性主要是一维的,且低资源语言会产生更多不确定的响应。
一篇文章展示了如何突破Gemini的安全护栏,从而获取从香蕉中提取爆炸性金属的指令,突显了AI的脆弱性。