编码器足够吗?LLM对抗评估中编码器与解码器安全评判器的系统比较
摘要
本文系统比较了微调的编码器分类器(ModernBERT系列)与基于解码器的安全评判器在LLM对抗评估中的表现,发现编码器可以在不显著损失性能的情况下,提供一种成本和延迟更低的替代方案。
查看缓存全文
缓存时间: 2026/06/25 05:13
# 编码器是否足够?用于LLM对抗性评估的编码器与解码器安全评判系统对比研究 来源:https://arxiv.org/html/2606.25782 11institutetext:PricewaterhouseCoopers, U.S.A. 11email:通讯作者: [email protected] ###### 摘要 随着大型语言模型(LLM)在聊天机器人和日常应用中的广泛采用,企业正在寻求延迟低、成本低但有效的防护措施。LLM输出的安全评估通常依赖于基于LLM的评判系统,这些系统虽然有效,但在大规模应用时速度慢且成本高。本文评估了来自ModernBERT家族(ModernBERT, Ettin)的微调现代编码器分类器,能否在用户-模型对话中可靠地识别有害的LLM输出,并且相对于基于LLM的评判系统不显著损失性能。我们在开源对抗性数据集上,将这些编码器分类器与基于规则的词缀匹配、微调LLM分类器以及采用不同评判提示策略的LLM评判系统进行基准测试。LLM评判系统包括StrongReject、ShieldGemma、JailbreakBench、AILuminate、SorryBench、Claude-as-a-judge的评估方法论,以及包括LlamaGuard 3和4在内的微调安全分类器。编码器分类器在多数投票标签策略下,使用评判系统标注的数据进行微调,然后针对一个留出黄金数据集进行评估,以衡量它们与LLM评判系统相比的表现。绝对性能通过F1分数、假阴性率和精确率-召回率报告。我们按攻击技术(具体为单轮提示、分解、升级和上下文操纵)细分结果,以识别编码器分类器与LLM评判系统一致或偏离的地方。研究结果为编码器分类器何时可以作为基于LLM的评估的成本和延迟高效替代方案提供了指导。 ## 1. 引言与相关工作 大型语言模型(LLM)正越来越多地部署在各种重要场景中,包括银行聊天机器人、航空公司客户服务和其他面向客户的应用程序;然而,这些LLM容易受到对抗性提示和越狱攻击的影响(Chao et al., 2024)。随着这些系统在复杂性和关键性上的增长,从业者必须平衡防护措施的有效性、API成本和延迟(Wang et al., 2023a)。目前,主流范式严重依赖基于解码器的安全评判系统:要么是使用LLM-as-a-judge提示的大型自回归模型(Zheng et al., 2023),要么是较小的微调解码器,如LlamaGuard (Meta AI, 2024)。虽然这两种方法都有效,但它们都存在与推理成本和延迟相关的问题,并且在分布偏移下性能可能会下降(Schwinn et al., 2026),导致无法泛化到训练期间未见的新攻击模式。虽然多轮策略已被证明可以改善解码器在指令遵循(Deng et al., 2023)和推理(Wang et al., 2023b)方面的性能,但它们进一步凸显了解码器本身并不像双向编码器那样,以完整性和理解能力来处理上下文。 安全分类本质上是一项语言理解任务,因为判断一个回答是否有害需要阅读和理解完整的输入,而不是生成新的token。我们认为这使得判别式编码器架构成为自然的选择,因为编码器在单次前向传播中双向处理整个输入,捕捉整个上下文中的有害意图,而不受自回归解码的顺序从左到右约束。最近的研究证实,编码器在分类任务上优于更大的纯解码器模型(Weller et al., 2026),而ModernBERT (Warner et al., 2024)因其扩展的上下文窗口和现代预训练方式,重新激起了人们对这种架构的兴趣。因此,我们研究了ModernBERT模型家族在对抗性安全评估中的表现,这些评估涉及来自问题和答案的模糊模式和指南。本文通过微调一个ModernBERT家族的编码器(Ettin)(基于通过多数投票从七个安全评判系统聚合的标签),然后在一组留出基准上针对四个前沿模型基线评估所得分类器,来解决这一空白。 我们的贡献包括: - • 首次在现代编码器分类器与LLM-as-a-judge系统以及微调的解码器安全模型之间,在对抗性安全基准上进行系统比较,使用真实留出标签。 - • 针对生产系统的成本-延迟-性能分析,量化了编码器分类器作为防护措施相对于解码器替代方案的实际权衡。 - • 按攻击技术对分类器性能进行细粒度分解,包括单轮提示、分解、升级和上下文操纵。这确定了编码器分类器与基于解码器的评判系统一致或偏离的地方。 ### 1.1 LLM-as-a-Judge与基于解码器的安全评估 最近的安全评估工作大致分为两类:集成基准框架和独立数据集。像StrongReject (Souly et al., 2024)、SorryBench (Xie et al., 2025)和HarmBench (Mazeika et al., 2024)这样的基准将提示集与内置评估流水线相结合,而像AdvBench (Zou et al., 2023)、ToxicChat (Lin et al., 2023)、BeaverTails (Ji et al., 2023)和XSTest (Röttger et al., 2023)这样的数据集则提供对抗性提示和注释,但没有固定的评估协议。 在这两类中,LLM-as-a-judge范式(Zheng et al., 2023)已成为默认的评分机制:灵活且对上下文敏感,但大规模使用时成本高昂。在这项工作中,我们使用StrongReject、SorryBench和HarmBench的评判方法论作为训练信号,并根据来自JailbreakBench和AILuminate的留出真实标签进行评估。 安全分类问题的另一种方法是使用微调的解码器分类器。有几个变体,包括LlamaGuard (Meta AI, 2024)、Qwen3Guard (Alibaba, 2024)和ShieldGemma (Google, 2024),它们是自回归模型,基于定义的危害分类法产生安全标签。这些模型受益于微调期间的指令,并学会了处理多轮对话上下文,但代价是拥有数十亿参数。这导致了显著的推理延迟,并且随着攻击方式的演变需要重复微调。在我们的评估中,我们利用LlamaGuard 3和4作为训练信号评判系统和结果中的基线。 ### 1.2 基于编码器的安全分类 先前的编码器工作将Sentence-BERT (Zheng et al., 2024)和基于BERT的分类器(Kumar et al., 2025)应用于安全任务,但这都是在现代编码器架构出现之前。随着ModernBERT (Warner et al., 2024)的发布,人们对用于分类的编码器重新产生了兴趣,例如PangolinGuard (Carpintero 2024)将其用于提示注入检测,以及Soares等人(2025)探索了对比训练以提高编码器鲁棒性。更广泛的编码器-解码器比较存在于相邻领域:Ettin (Weller et al., 2026)提供了ModernBERT家族中新的最先进编码器,RedLLM (Zhang et al., 2025)研究了跨模型类别的缩放行为,但两者都不是针对安全评估的。没有先前的工作系统地将现代编码器分类器与基于解码器的评判系统在对抗性安全分类方面进行基准测试。 ## 2. 数据集 ### 2.1 数据集构建 - 来源数据集与领域覆盖 训练语料聚合了14个来源数据集,涵盖标准化安全基准、真实世界交互、对抗性越狱集合和特定领域的合成数据。其中,11个是外部数据集,3个是合成生成的(医疗、金融、内部)。标准化安全基准包括HarmBench (Mazeika et al., 2024)、SafetyBench (Zhang et al., 2023)和Simple Safety Tests (Vidgen et al., 2024)。HarmBench和Simple Safety Tests提供了用于评估拒绝性能的有害行为和提示。SafetyBench的格式不同:它由旨在评估安全理解能力(而非对抗鲁棒性)的选择题组成。因此,它用作补充信号,而不是直接集成到对抗性提示流水线中。 真实世界和人工标注数据包括ToxicChat (Lin et al., 2023)和WildJailbreak (Zhang et al., 2024)。ToxicChat从真实的用户-AI交互中捕捉毒性,而WildJailbreak提供从生产对话中挖掘的大规模组合越狱提示。我们使用WildJailbreak中的有害和良性分割来捕捉对比行为。对抗性和评估导向的数据集包括AdvBench (Zou et al., 2023)、OR-Bench Hard和OR-Bench Toxic (Cui et al., 2024)、BeaverTails-Eval (Ji et al., 2023)、Do-Not-Answer (Wang et al., 2023c)和XSTest (Röttger et al., 2023)。这些数据集提供了直接有害指令、过度拒绝探测(OR-Bench Hard)、确实有害提示(OR-Bench Toxic)和边界测试示例(XSTest)的混合。BeaverTails-Eval特指经过策划的700提示评估子集及其人工注释,而不是整个数据集。 特定领域的合成数据集是为医疗和金融安全而构建的。对于每个领域,定义了危害类别,并使用OpenAI GPT-5.2生成带有链式思维解释的有害提示。所有生成的样本都经过人工审查,以确保每个提示代表一种不同的攻击。另外还包括一个以相同方式创建的内部合成对抗性数据集(150个提示)。每个源提示在一组目标LLM和对抗性提示技术的组合上执行,为每个输入产生多个(prompt, response)对。主要数据集提供广泛的对抗多样性或覆盖独特领域,在所有配置下获得完整的推理覆盖。这些包括WildJailbreak、SafetyBench、ToxicChat、HarmBench、Internal Adversarial、Medical Synthetic、Financial Synthetic和Simple Safety Tests,总计5,406个源提示和537,477行推理数据。补充数据集包括AdvBench、OR-Bench Hard、OR-Bench Toxic、BeaverTails-Eval、Do-Not-Answer和XSTest,增加了类别广度,但由于与主要来源重叠而进行了子采样。它们贡献了4,562个提示和25,739行数据。总计,训练语料包含9,968个源提示和563,216个(prompt, response)对。 * 包含安全提示和有害提示。 ### 2.2 泄漏预防与数据集划分 我们推理流水线中的16个目标模型中的每一个都会对语料库中的每个问题产生一个响应,这意味着同一个对抗性问题在数据集中最多出现16次(每个模型一次),并且进一步跨越不同的攻击技术和配置。一个简单的行级随机拆分是不够的,因为模型A对训练集中某个问题的回答可能会成为欺骗模型B在测试集中对同一问题的回答的先兆。由于分类器可以学习问题级别的特征,这将导致数据从训练集泄漏到评估集。模型执行的是记忆任务,而不是真正的响应级有害性检测。 为了缓解这个问题,我们采用了问题组划分策略。所有共享相同问题文本的行,无论模型、攻击技术或生成配置如何,在进行任何分层之前都被分配到同一个分区。使用`StratifiedGroupKFold`构建拆分,其中`groups=question_id`,并基于多数投票的有害性标签进行分层。这确保了类别分布(有害 vs. 安全)在k折中得以保留,同时在训练和测试数据之间保持问题级别的拆分。由此产生的配置使用5折交叉验证进行模型训练。 ### 2.3 留出和分布外评估数据 由42,899个示例组成的留出评估集来自两个外部基准:JailbreakBench Behaviors (Chao et al., 2024),包含200个行为;以及AILuminate v1 Demo (行业基准, 2024),包含1,200个带有真实标签的测试用例,总计1,400个源项目。真实标签直接继承自JailbreakBench和AILuminate,对应于提示级别标签,而非响应级别判定。因此,JailbreakBench标签指示源行为的安全状态,而AILuminate标签指示每个提示的基准定义安全类别。没有对生成的模型输出执行额外的响应级别标注。 每个源项目针对四个前沿模型(Claude Sonnet 4.5, Gemini 3.1 Pro, GPT-5.4, 和 GPT-OSS 120B)、四种对抗性攻击技术(单轮、分解、升级和上下文操纵)和两种温度设置进行评估,产生44,800个示例。推理成功率为95.5%,从最初的44,800个生成中移除了1,901个失败案例,最终得到42,899个示例。这些基准中的任何示例在任何阶段都未包含在训练池中。这个留出集专门用于在所有模型选择决策在验证拆分上确定之后,进行分布外(OOD)评估。 ## 3. 对抗性攻击方法论 ### 3.1 目标模型选择 我们通过一个完全自动化的流水线,评估了来自六个提供商(OpenAI, Anthropic, Meta, Mistral, Google, Amazon)的16个LLM的对抗鲁棒性,该流水线产生用于后续评估的(prompt, response)对。所有模型都通过API查询,没有自定义系统提示,温度设置为T=0.0和T=0.7。T=0.0建立了贪心解码基线,而T=0.7测试了在选择token时的一些随机性是否会导致有害结果。o4-mini不暴露温度参数,每个提示只查询一次。模型集合分为两个世代队列。传统队列(2025年之前)包括GPT-4o-mini, Claude 3 Haiku, LLaMA 3/3.3 (70B), Mixtral 8x7B, Mistral Large, 和 Amazon Nova Pro;现代队列(2025年及以后)包括GPT-4.1, o4-mini, Claude Sonnet/Haiku 4.5, LLaMA 4 Maverick, Pixtral Large, 和 Gemini 2.5/3/3.1。拥有六个提供商和两个世代的多样性服务于两个目的:增加来自多个供应商的拒绝风格变化,并且新一代模型产生的有害输出与旧模型显著不同。通过每个提示查询所有16个模型,保证了每个问题有足够的回答变化,这在如§2.3所述一起分组训练时允许唯一性。表1 (https://arxiv.org/html/2606.25782#S3.T1) 提供了模型分组的完整细节。 表 1:
相似文章
The Embedder's Dilemma: LLMs Are Better, but at What Cost?
This paper presents a cost-aware comparison of LLMs versus dedicated embedding models across 37 tasks, finding that the best LLM and embedding model are nearly tied on aggregate performance but LLMs are up to 1,431x more expensive and slower, leading to a recommended division of labor.
超越干净文本:在噪声文本中评估编码器和解码器对孟加拉语事件检测的鲁棒性
本文介绍了一个包含噪声文本(ASR、拼写错误)的孟加拉语事件检测基准,并评估了仅编码器和仅解码器的大语言模型,发现解码器模型对噪声的鲁棒性更强。
无奖励的表征:JEPA对LLM微调的审计
本文对联合嵌入预测架构(JEPA)在自然语言到正则表达式任务上的LLM微调进行了审计,测试了二十二个辅助目标。结果表明,隐藏状态表征的改进与解码任务准确率之间仅存在弱耦合,没有辅助目标通过族系校正。
LFM2.5-编码器:用于CPU上快速长上下文推理
Liquid AI发布LFM2.5-编码器(230M和350M),这是为CPU上长上下文推理优化的高效编码器模型,在基准测试中匹配或超越更大编码器,相比ModernBERT-base实现3.7倍加速。
高基数欺诈检测中可解释编码器与学习型编码器的对比
本文在 IEEE-CIS 欺诈数据集上对七种类别编码方法进行了受控比较,使用固定的 LightGBM 学习器评估了准确性、可解释性和计算权衡,发现实体嵌入获得了最高的 AUC-ROC,但没有任何编码器在两个指标上都占优。