LLM Guard 在 USENIX 2025 的多轮越狱测试中得了 0/8。以下是它被什么捕获了。
摘要
Arc Sentry 通过读取模型内部状态而非文本输出来检测类似 Crescendo 的多轮越狱,捕获了基于文本的监控器完全遗漏的攻击。
Crescendo(Russinovich 等人,USENIX Security 2025)是一种专门设计用来规避基于输出的监控器的多轮越狱方法。每一轮单独看起来完全无害。攻击只存在于多轮之间。LLM Guard 结果:检测到 0/8 轮。它对每个提示独立评分。它没有记忆。它从未看到攻击。Arc Sentry 结果:在第 3 轮触发警报。Arc Sentry 不读取文本。它读取模型内部状态如何处理文本。到第 3 轮时,残差流已经偏移,分数从 0.031 跃升至 0.232,增长了 7 倍,而该提示看起来完全无害。第 1 轮 — 分数=0.028 ✓ 稳定 第 2 轮 — 分数=0.031 ✓ 稳定 第 3 轮 — 分数=0.232 🚫 已拦截 第 7 轮 — 分数=0.376 🚫 已拦截 第 8 轮 — 分数=0.429 🚫 已拦截 模型从未对任何被拦截的轮次生成响应。没有文本分类器能捕获 Crescendo。各轮次本身设计得看似无害。Arc Sentry 之所以能捕获它,是因为它基于模型状态而非文本工作。这与 Arc Gate 的会话 D(t) 稳定性标量(即使用托管 API 的智能体的运行时治理代理)背后的几何监控层相同。pip install arc-sentry — [https://github.com/9hannahnine-jpg/arc-sentry](https://github.com/9hannahnine-jpg/arc-sentry) 托管 API 的 Arc Gate:[https://github.com/9hannahnine-jpg/arc-gate](https://github.com/9hannahnine-jpg/arc-gate) https://bendexgeometry.com
相似文章
MJ: 基于分解信用分配的多轮LLM越狱
本文提出了DC-GRPO,一种面向多轮LLM越狱学习的回合级信用分配框架,在多个基准测试中实现了超过98%的攻击成功率,优于现有方法。
并非所有对话轮次都同等重要:多轮越狱中的信用分配
本文提出了 TRACE,这是一个基于强化学习的、具有对话轮次感知能力的多轮大语言模型(LLM)越狱攻击信用分配框架,声称在攻击成功率和防御对齐方面取得了显著提升。
ASGuard:激活缩放防护以缓解针对性越狱攻击
ASGuard是一种基于机制的防御框架,通过电路分析识别脆弱的注意力头,并应用有针对性的激活缩放和微调,在保持模型能力的同时提高拒绝行为的鲁棒性,从而缓解针对LLM的越狱攻击。
评估使用工具的LLM代理中的漏洞利用(4分钟阅读)
Cursor的一项审计发现,SWE-bench Pro上63%的成功LLM代理运行是通过检索修复而非推导修复,凸显了编码基准测试中普遍存在的奖励黑客行为。该研究提出了更严格的环境控制来缓解这种行为。
Arc Sentry 在对决基准中 92% 碾压 LLM Guard 的 70%,它是怎么做到的?
Arc Sentry 是一种全新的“生成前”提示注入检测器,直接读取模型内部残差流,在 130 条提示的基准上实现 92% 检出率、0% 误报;而 LLM Guard 仅 70% 检出率、3.3% 误报。