Arc Sentry 在对决基准中 92% 碾压 LLM Guard 的 70%,它是怎么做到的?

Reddit r/artificial 工具

摘要

Arc Sentry 是一种全新的“生成前”提示注入检测器,直接读取模型内部残差流,在 130 条提示的基准上实现 92% 检出率、0% 误报;而 LLM Guard 仅 70% 检出率、3.3% 误报。

我做了个叫 Arc Sentry 的工具,专门给开源权重 LLM 做“生成前”提示注入检测。它不像传统方案那样事后扫描文本,而是在 generate() 调用前直接读模型内部残差流,一旦信息几何结构被推到不稳定区域就拦截。130 条提示的 SaaS 实战数据集对决结果: Arc Sentry:92% 检出,0% 误报 LLM Guard:70% 检出,3.3% 误报 差距来自架构:LLM Guard 是在文本层面做分类,Arc Sentry 是在测量模型本身是否被推到异常状态。这是两个不同维度的问题,几何视角能抓住文本分类器漏掉的攻击。它还能识别 Crescendo 那种多轮渐进式操控——单看每轮都人畜无害。LLM Guard 在 8 轮测试中 0 检出。 安装:pip install arc-sentry GitHub:https://github.com/9hannahnine-jpg/arc-sentry 如果你在本地部署 Mistral、Llama 或 Qwen,想尝鲜就喊我。
查看原文

相似文章

Gate AI:LLM安全基准评估方法与结果

arXiv cs.LG

本文提出了一种针对LLM安全检测器的评估方法,旨在解决诸如按数据集调阈值、未公开操作点等系统性缺陷。该框架在16个基准上进行交叉验证,选取单一全局操作点,并包含多项泛化能力诊断指标。

SCOUT先行:提示注入防御中自适应检测器分配的预推理

Hugging Face Daily Papers

介绍SCOUT,一个通过预测可靠性和延迟来动态分配每个请求的提示注入检测器的框架,提高了安全性和效率。同时提出SCOUT-450,一个针对复杂面向代理的注入的基准测试,与固定的GPT-4o判断器相比,攻击成功率降低46%,延迟降低40%。