jailbreaks

标签

Cards List
#jailbreaks

评估语言模型在长对抗性对话中的安全性

arXiv cs.CL ↗ · 2天前 缓存

本文评估了开源权重指令微调的语言模型在长对抗性对话中能否保持安全行为,发现在第1轮时安全回应率为85-100%,到第101轮时降至15-44%,表明强大的单轮安全性并不能在持续交互中保持。

0 人收藏 0 人点赞
#jailbreaks

系统提示的幻觉:指令前缀如何改变语言模型中的计算

arXiv cs.CL ↗ · 2天前 缓存

本文通过对17个指令微调模型进行中心化核对齐(Centered Kernel Alignment, CKA)和激活补丁分析,表明系统提示在每一层都会被模型“感知”,但只有人格设定和格式类指令才会深度重构模型的表征;安全类提示几乎不会改变模型的计算过程,这从机制层面解释了为何基于系统提示的安全防护仍然容易被越狱破解。

0 人收藏 0 人点赞
#jailbreaks

多模态大语言模型安全格局的演变:新兴威胁与防护措施综述

arXiv cs.LG ↗ · 2026-08-11 缓存

一篇综述论文,系统分析了多模态大语言模型不断演变的安全格局,涵盖了对抗性攻击、数据投毒、越狱和幻觉等新兴威胁,并回顾了更新后的安全策略。

0 人收藏 0 人点赞
#jailbreaks

特朗普白宫已对Anthropic CEO Dario Amodei失去耐心

Wired ↗ · 2026-06-24 缓存

特朗普政府对Anthropic CEO Dario Amodei感到不满,更倾向于与联合创始人Tom Brown讨论Claude Fable 5 AI模型的重新发布事宜,因为越狱风险导致出口管制持续有效。

0 人收藏 0 人点赞
#jailbreaks

TROPT:一个统一和推进离散文本优化的开放框架

Hugging Face Daily Papers ↗ · 2026-06-22 缓存

TROPT是一个开源框架,统一了离散文本触发优化,标准化了在LLM越狱和模型可解释性等领域中的开发与执行。它包含超过15种优化器和30个配方,降低了采用和推进的门槛。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈