Arc Sentry 在对决基准中 92% 碾压 LLM Guard 的 70%,它是怎么做到的?
摘要
Arc Sentry 是一种全新的“生成前”提示注入检测器,直接读取模型内部残差流,在 130 条提示的基准上实现 92% 检出率、0% 误报;而 LLM Guard 仅 70% 检出率、3.3% 误报。
我做了个叫 Arc Sentry 的工具,专门给开源权重 LLM 做“生成前”提示注入检测。它不像传统方案那样事后扫描文本,而是在 generate() 调用前直接读模型内部残差流,一旦信息几何结构被推到不稳定区域就拦截。130 条提示的 SaaS 实战数据集对决结果:
Arc Sentry:92% 检出,0% 误报
LLM Guard:70% 检出,3.3% 误报
差距来自架构:LLM Guard 是在文本层面做分类,Arc Sentry 是在测量模型本身是否被推到异常状态。这是两个不同维度的问题,几何视角能抓住文本分类器漏掉的攻击。它还能识别 Crescendo 那种多轮渐进式操控——单看每轮都人畜无害。LLM Guard 在 8 轮测试中 0 检出。
安装:pip install arc-sentry
GitHub:https://github.com/9hannahnine-jpg/arc-sentry
如果你在本地部署 Mistral、Llama 或 Qwen,想尝鲜就喊我。
相似文章
LLM Guard 在 USENIX 2025 的多轮越狱测试中得了 0/8。以下是它被什么捕获了。
Arc Sentry 通过读取模型内部状态而非文本输出来检测类似 Crescendo 的多轮越狱,捕获了基于文本的监控器完全遗漏的攻击。
Gate AI:LLM安全基准评估方法与结果
本文提出了一种针对LLM安全检测器的评估方法,旨在解决诸如按数据集调阈值、未公开操作点等系统性缺陷。该框架在16个基准上进行交叉验证,选取单一全局操作点,并包含多项泛化能力诊断指标。
我构建了一个代理,能阻止AI代理根据隐藏指令采取行动。以下是数据。
Arc Gate是一个代理,通过将所有外部内容视为非指令性内容来阻止提示注入攻击,在多个基准测试中实现了高检测率(99-100%)和低误报率。
Semalith v1.4: 一种经过校准的184M安全分类器,以比Llama-Guard-3-8B少44倍的参数实现最先进的提示注入检测
Semalith v1.4是一种紧凑型184M参数DeBERTa-v3安全分类器,在良性代理提示上实现零误报的提示注入检测方面表现出色,同时还能在单次处理中覆盖一般危害和金融合规,以少44倍的参数优于Llama-Guard-3-8B。
SCOUT先行:提示注入防御中自适应检测器分配的预推理
介绍SCOUT,一个通过预测可靠性和延迟来动态分配每个请求的提示注入检测器的框架,提高了安全性和效率。同时提出SCOUT-450,一个针对复杂面向代理的注入的基准测试,与固定的GPT-4o判断器相比,攻击成功率降低46%,延迟降低40%。