Semalith v1.4: 一种经过校准的184M安全分类器,以比Llama-Guard-3-8B少44倍的参数实现最先进的提示注入检测

arXiv cs.LG 模型

摘要

Semalith v1.4是一种紧凑型184M参数DeBERTa-v3安全分类器,在良性代理提示上实现零误报的提示注入检测方面表现出色,同时还能在单次处理中覆盖一般危害和金融合规,以少44倍的参数优于Llama-Guard-3-8B。

arXiv:2607.22545v1 Announce Type: new 摘要:在金融服务和代理环境中部署大语言模型需要安全分类器同时处理提示注入、合规性和一般危害,现有开源护栏均无法通过单次推理满足这一组合需求。 Semalith v1.4是一个184M参数的DeBERTa-v3-base分类器,在单次前向传播中执行三轴安全分类,包括提示注入、一般危害和金融服务合规性。其22类分类头(良性、九种提示注入子类型、一般危害、十一个BFSI标签)与一个4类辅助超类别头在联合加权损失下训练,训练语料为从49个公开来源挖掘的76,204行数据,并通过SHA-1去重与每个保留评估集对齐,22个基准中有21个实现零污染(最高0.22%)。 在与Llama-Guard-3-8B对比的22个保留基准中,Semalith v1.4在所有提示注入评估(7/7)和总共18个基准中的11个上获胜,参数减少44倍,在208个良性代理提示上的误报率为0.000,而Llama-Guard-3-8B为0.063。在一般危害基准(WildGuardMix、HEx-PHI、HarmBench)上,Llama-Guard-3领先;这一互补性差异详见第4节。第6节披露了六个测得的薄弱点。 部署建议:对话审核部署推荐使用v1.3(ToxicChat F1 0.624);当BFSI标签覆盖或良性代理提示零误报为优先时,推荐使用v1.4。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:20

# 一种校准后的184M安全分类器,以比Llama-Guard-3-8B少44倍的参数实现最先进的提示注入检测 一个DeBERTa-v3头部,三个安全轴(提示注入、危害、BFSI合规性),在7/7个提示注入基准测试中战胜8B Llama-Guard-3,在良性智能体提示上零误报(FPR=0.000,n=208),以及100%真实世界无污染的76,204行训练语料库

来源:https://arxiv.org/html/2607.22545  
Tejasvi C. Addagada 独立研究员 [email protected] · tejasviaddagada.com (https://arxiv.org/html/2607.22545v1/tejasviaddagada.com)  
名称Semalith源自希腊语*sēma*(符号)和*lithos*(石头):一种结构化的信号承载标记。此工作与Patronus AI的*Lynx*幻觉检测器无关。生产权重和评估工具包以企业许可证发布;请联系作者获取访问权限。

###### 摘要

在金融服务和智能体环境中部署大型语言模型,需要能够同时处理提示注入、法规合规性和一般危害的安全分类器——现有开源防护栏无法在一次推理中满足这一组合。

Semalith v1.4是一个184M参数的DeBERTa-v3-base分类器,在单次前向传递中同时执行三轴安全分类——提示注入、一般危害和金融服务法规合规性。其22类头部(BENIGN,九种提示注入子类型,一般危害,十一个BFSI标签)在一个4类辅助超类别头部下训练,采用联合加权损失,使用从49个公共来源挖掘的76,204行语料库,对所有保留评估集进行SHA-1去重,22个基准测试中有21个零污染(最大0.22%)。

与Llama-Guard-3-8B在22个保留基准测试上相比,Semalith v1.4在所有提示注入评估中获胜(7/7),总体在18个基准测试中获胜11个,参数减少44倍,在208个良性智能体提示上的FPR = 0.000,而Llama-Guard-3-8B为0.063。¹¹AgentHarm-benign涵盖来自公共AgentHarm拆分[23]的所有208个良性提示(32个样本验证 + 176个样本测试_public);0个误报;Wilson 95% CI [0.000, 0.018]。在一般危害基准测试(WildGuardMix, HEx-PHI, HarmBench)上,Llama-Guard-3领先——这种互补拆分在第4节中记录。六个测量到的弱点在第6节中披露。

部署指南:v1.3推荐用于对话审核部署(ToxicChat F1 0.624);v1.4推荐用于优先考虑BFSI标签覆盖或对良性智能体提示零FPR的场景。

## 1 引言

每个主要的开源防护栏都针对一个轴进行优化。LlamaGuard和Granite Guardian捕捉一般危害,但在微妙的提示注入攻击上失效。PromptGuard捕捉提示注入,但将96%的良性智能体内容标记为有害。没有一个附带金融服务法规标签。Semalith v1.4在单次11.6毫秒的前向传递中回答所有三个问题——这是从头开始重建的第四次迭代,基于100%真实世界训练数据、零合成提示,以及针对每个保留基准测试的SHA-1去重。

现有开源防护栏未能同时满足三个需求驱动了设计:

- • Llama-Guard-3-8B和Granite-Guardian-3.3-8B是一般危害分类法分类器;它们在微妙的提示注入评估上失效(在我们之前的cont7时代基准测试中,PINT F1在fp16下分别约为0.06和约0.32)。
- • PromptGuard-2-86M是一个二元提示注入分类器;它在重度PI基准测试上实现接近1.0的召回率,但在AgentHarm-benign上产生96%的误报率,在ToxicChat上产生98%,将任何边缘内容标记为有害。
- • 没有公共防护栏附带BFSI特定标签,涵盖银行客户服务、抵押/贷款、转账、信用卡、保险、投资咨询等,尽管SEC Rule 206(4)-7[26]、FCA COBS[27]、MiFID II[28]、EU AI Act[29]以及RBI/SEBI/IRDAI规则手册都将这些列为AI辅助客户互动中的合规相关类别。

Semalith v1.4在单次11.6毫秒的前向传递中回答所有三个问题(batch=1, max_len=256, fp16, RTX 4090);完整延迟概况见表2。

#### 全面披露。

本文记录了v1.4作为生产检查点,这是从v1(基线,验证宏F1 0.876)经过v1.2(BENIGN寄存器扩展灾难性地回归了PI召回率并被回滚)、v1.3(攻击类扩展填补了Mosscap差距)到当前v1.4版本(BFSI丰富扩展修复了三个薄弱标签)的第四次迭代。v1.4有六个测量到的弱点在第6节中记录:HarmBench-contextual召回率0.181(架构差距),WildGuardMix F1 0.289(BENIGN寄存器不匹配),BeaverTails FPR 0.446(攻击类扩展的权衡),HEx-PHI persuasion召回率0.885(对比Llama-Guard-3的0.970),ToxicChat F1 0.538(从v1.3的0.624下降,BFSI丰富的代价),以及HarmBench-copyright召回率0.700(超出范围标签)。所有六个都附有根本原因和缓解路径。

对Llama-Guard-3的11/18总体胜率应在基准轴背景下理解:Semalith在所有提示注入和对抗性隐秘评估中获胜(7/7);Llama-Guard-3在所有一般危害和对话审核评估中获胜(5/6,BeaverTails F1是唯一例外)。没有一个模型在共享领域上主导另一个;它们针对互补轴进行训练。

#### v1.4不是什么。

它在单次传递中评分完整提示。它不推理、不流式输出令牌、不说不英语的语言、也不充当智能体。如果你发送一个1001字符的提示,尾部被截断。如果你需要多语言覆盖或上下文窗口长度的输入,v1.4不是正确的工具。

## 2 相关工作

#### 提示注入:分类法和基准测试。

Perez和Ribeiro首次系统分类了提示注入攻击[11],识别了直接覆盖、间接上下文和越狱子类型;这一分类法为Semalith的D1\_SYSTEM\_OVERRIDE、D1\_JAILBREAK、D7\_INDIRECT\_INJECTION和D1\_NARRATIVE\_FRAME标签提供了信息。OWASP LLM Top 10(2023–2025)正式将提示注入列为领先的LLM风险类别[8]。SALAD-Bench[21]将攻击组织成三级层次结构,涵盖66个子类别;Semalith的D-攻击分类法是设计用于低延迟分类器推理而非事后审计的较粗略的9标签变体。Gandalf[12]和Mosscap[13]提供了专门设计用于击败基于规则和微调分类器的逐步防御提取基准测试;按防御层级,Mosscap L6/L7/L8仍然是最难的开放提示注入基准测试。

#### 安全分类器演变。

LlamaGuard家族[2,3]使用因果LM分类法分类器(Llama-3-8B骨干)并带有分类危害标签;它在危害诱导基准测试上实现了强召回率,但在措辞微妙的PI攻击上退化(在我们的评估中,HackaPrompt召回率0.084)。Granite-Guardian[4](IBM, 8B)遵循类似的聊天模板设计,具有改进的一般危害覆盖但类似的PI弱点。WildGuard[5](Allen AI, 7B)是当前混合对话审核的最先进技术,将WildGuardMix确立为规范的混合信号基准测试。AprielGuard[7](ServiceNow, 2025)是最近的8B企业防护栏,针对智能体和多轮安全;据我们所知,它不报告金融领域(BFSI)或PI特定的基准测试结果。PromptGuard-2-86M[6](Meta)是最强的紧凑二元PI分类器,通过设计在PI基准测试上实现接近上限的召回率,同时接受良性内容上的极端FPR(AgentHarm-benign上96%)。Semalith占据了一个不同的操作点:在结构性PI基准测试上与PromptGuard-2-86M相当的PI召回率,在良性智能体内容上的FPR低190倍,以及没有其他公共防护栏提供的同步BFSI标签覆盖。

#### 领域特定和BFSI安全。

通用领域防护栏在专业领域部署时表现出严重的误报率膨胀:Zhang和Ren[9]表明,从通用到金融服务提示的领域转移使LlamaGuard、WildGuard和Llama-2-7B聊天安全过滤器的FPR上升15–40个百分点。这促使了Semalith的BFSI特定标签模式(B-01..B-11,表1),使得能够区分良性金融领域查询与真正有害的金融欺诈、无执照建议请求和洗钱便利。相关的监管框架——SEC Rule 206(4)-7[26]、FCA COBS[27]、MiFID II[28]和EU AI Act[29]——都要求按互动类别对AI辅助金融服务互动进行审计,这促使了精细BFSI标签而非粗略的有害/良性二元分类。

#### 提示注入基准测试。

对于公共PI基准测试,我们使用HackaPrompt[11]、Gandalf[12]、AdvBench[14]、AART[15]、AttaQ[16]、WildJailbreak[5]、Mosscap L6/L7/L8[13]、SimpleSafetyTests[22]和HarmBench[17](标准/上下文/版权配置)以及HEx-PHI[18]。PINT[10]仅授权给Lakera客户,并且不在我们使用的任何训练语料库中;PINT F1 = 0.99x测量值来自cont7时代的开发周期(cont4检查点,2026年4月)仅作为历史参考引用,因为v1.3是在不包含任何PINT邻近提示的语料库上重新训练的。

#### 传承披露。

该传承中的早期工作(cont4–cont7)使用了合成的D6智能体注入模板,在AgentHarm-benign上产生了96.5%的误报率[23]——这是我们的v1语料库构建报告中记录的结构性失败。v1是从microsoft/deberta-v3-base[1]从头重新训练,以修复此问题并消除cont传承记忆的五个PI/危害基准测试上的训练集污染。v1.3通过添加13,827个针对Mosscap隐秘间隙的攻击类行扩展了v1,将Mosscap L6/L7/L8的召回率从0.47–0.58(v1)提升到0.79–0.91,WildJailbreak召回率从0.840提升到0.968。

## 3 方法

### 3.1 架构

Semalith v1是一个microsoft/deberta-v3-base[1]编码器,后跟一个0.10-dropout层,一个在[CLS]嵌入上的22路分类头部,以及一个在同一嵌入上的4路辅助超类别头部。22个标签是:

- –1个BENIGN类(label_id=0, weight=1.5)。
- –9个D-攻击子类型:D1\_SYSTEM\_OVERRIDE, D1\_JAILBREAK, D1\_EXTRACTION, D1\_SOCIAL\_ENGINEERING, D1\_AUTHORITY\_CLAIM, D1\_NARRATIVE\_FRAME, D5\_EVASION, D6\_AGENTIC\_INJECTION (weight 3.0), D7\_INDIRECT\_INJECTION (weight 6.0)。
- –1个D8\_GENERAL\_HARM类(weight 1.0)。
- –11个BFSI监管子类型:B-01..B-11(每个weight 1.5),定义见表1。

4路超类别头部分配为{BENIGN=0, D-attack=1, D8-harm=2, BFSI=3}。辅助损失权重α通过网格搜索在{0.05, 0.10, 0.20, 0.40}上选择;确切值在补充材料中报告。

总参数数为184M(183.83M编码器 + 0.034M头部)。

表1:BFSI标签分类法(B-01..B-11),附有监管依据。每个标签涵盖*良性*客户意图(正常情况,路由到下游领域处理器)和该领域内的*有害*变体(欺诈、诈骗、无执照建议),通过D-attack / D8 / B-08共信号可区分。
### 3.2 训练语料库

v1.4训练语料库包含从49个公共来源挖掘的76,204行。它扩展了v1.3基础(来自38个来源的57,086行),增加了来自11个新来源的19,118行BFSI丰富行,针对三个先前薄弱的标签(B-11: 137→1,920训练行;D1\_AUTHORITY\_CLAIM: 137→583;D6\_AGENTIC\_INJECTION: →910)。新来源包括金融服务客户服务数据集、EU监管QA语料库、来自现有安全基准测试的权威声明和工具注入过滤子集、欺诈叙事语料库和勒索数据集。语料库涵盖五个类别:(i) 一般危害和毒性,(ii) 提示注入子类型,(iii) 越狱尝试,(iv) 智能体注入,以及(v) 映射到11个B-XX标签的BFSI客户服务意图。

所有训练行都是真实世界数据,零合成或模板化提示——这是与最近完全在LLM生成的合成数据上训练的安全分类器工作相比有意的方法论选择。每个候选行在语料库构建过程中针对每个保留评估基准测试进行SHA-1和MinHash去重,以限制污染。

### 3.3 训练过程

我们从零开始微调microsoft/deberta-v3-base(无持续预训练传承)。损失是22类头部上的加权交叉熵加上4类超类别头部上的辅助交叉熵,其中α通过网格搜索在{0.05, 0.10, 0.20, 0.40}上选择(确切值在补充材料中)。优化使用AdamW(lr=2×10^{-5},权重衰减0.01),梯度裁剪为||g||_2 ≤ 1.0,线性预热占总步数的6%,余弦衰减。批次大小32;最大序列长度256个令牌;6个周期。验证拆分是按类别分层的5%保留,确保所有22个标签都有非零验证表示。

### 3.4 延迟和吞吐量

表2报告了在NVIDIA RTX 4090(24 GB VRAM)上以fp16精度使用PyTorch 2.4.1和HuggingFace transformers 4.46.3分词器测量的壁钟推理延迟和吞吐量。测量值是10次预热后100次前向传递的中位数;所有条件下的标准差<0.3毫秒。256个令牌的序列长度上限与训练配置匹配;超过256个令牌的提示在分词器处被截断,而不是在模型处。

相似文章

SCOUT先行:提示注入防御中自适应检测器分配的预推理

Hugging Face Daily Papers

介绍SCOUT,一个通过预测可靠性和延迟来动态分配每个请求的提示注入检测器的框架,提高了安全性和效率。同时提出SCOUT-450,一个针对复杂面向代理的注入的基准测试,与固定的GPT-4o判断器相比,攻击成功率降低46%,延迟降低40%。

领域伪装注入攻击规避多智能体LLM系统检测

Hacker News Top

本文识别出一类新的注入攻击,其载荷模仿领域语言以规避LLM注入检测器,实验显示检测率急剧下降(例如,在Llama 3.1 8B上从93.8%降至9.7%)。该漏洞具有系统性,且延伸至诸如Llama Guard 3等专用安全分类器,后者对伪装载荷的检测率为零。