利用基于DMD的提示-响应嵌入动态分类加强LLM安全

arXiv cs.AI 论文

摘要

本文提出了一种黑箱方法,用于LLM安全分类,该方法利用动力系统和Koopman算子对提示-响应嵌入动态进行建模,以检测不安全输出。

arXiv:2608.19579v1 公告类型:新 摘要:大型语言模型(LLMs)越来越多地应用于高风险场景,但其生成有毒、有害或违反政策内容的倾向带来了重大风险。以黑箱方式高效检测这些不安全输出仍然是一个开放挑战。本文将最近提出的一种用于幻觉检测的动力系统框架扩展到LLM安全分类。通过将提示和响应投影到高维嵌入空间,并为安全和不安全状态分别拟合基于Koopman的预测模型,我们使用一种新的差分残差分数对新输出进行分类,该分数比较了安全和不安全状态的预测误差。关键贡献是整合了提示和响应嵌入动态,得到了能捕捉关键交互模式的拟合Koopman算子。我们使用三个嵌入模型在三个安全基准上评估了我们的黑箱方法。结果显示,融入提示嵌入能带来一致改进,特别是在与因果解码器(如Llama-3)配对时对于依赖交互的违规行为,而仅响应违规则更受益于密集语义嵌入表示。这些发现为使用动力系统分析AI系统打开了大门,而不是主流的使用AI建模动力系统的范式。
查看原文
查看缓存全文

缓存时间: 2026/08/21 09:58

# 基于DMD的提示-响应嵌入动态分类实现LLM安全防护
来源:https://arxiv.org/html/2608.19579
Mohamed Akrout隶属:美国田纳西大学诺克斯维尔分校电气工程与计算机科学系,邮编37996
Olivera Kotevska隶属:美国橡树岭国家实验室计算机科学与数学部,邮编37830
Dan Wilson隶属:美国田纳西大学诺克斯维尔分校电气工程与计算机科学系,邮编37996

###### 摘要

大型语言模型(LLM)在高风险应用中的部署日益增多,但其生成有毒、有害或违反政策内容的倾向带来了重大风险。在黑盒环境中高效检测这些不安全输出仍是一个开放挑战。本文扩展了近期提出的用于幻觉检测的动力学系统框架,将其应用于LLM安全分类。通过将提示和响应投影到高维嵌入空间,并为安全与不安全机制拟合独立的基于Koopman的预测模型,我们使用新的微分残差分数对新输出进行分类,该分数比较安全与不安全机制的预测误差。关键贡献在于整合了提示与响应的嵌入动态,生成的拟合Koopman算子能够捕获关键的交互模式。我们使用三种嵌入模型在三个安全基准上评估了该黑盒方法。结果表明,纳入提示嵌入能带来持续改进,特别是在与因果解码器(例如Llama-3中)配对时,对交互依赖型违规行为效果显著;而仅响应型违规则更受益于密集语义嵌入表示。这些发现为利用动力学系统分析AI系统开辟了道路,而非采用AI来建模动力学系统的主导范式。

## 1 引言

大型语言模型(LLM)在广泛的自然语言处理任务中展现了变革性能力,涵盖文本生成、摘要、代码合成及多轮对话等领域\[8 (https://arxiv.org/html/2608.19579#bib.bib1), 1 (https://arxiv.org/html/2608.19579#bib.bib2)\]。然而,其在现实应用中的快速部署暴露了多种损害信任与安全的问题响应行为。其中研究最为广泛的失败模式可能是幻觉(即生成流畅但事实错误的内容),这对任何经过校准的语言模型而言已被证明是统计上的必然结果\[23 (https://arxiv.org/html/2608.19579#bib.bib3), 25 (https://arxiv.org/html/2608.19579#bib.bib4), 48 (https://arxiv.org/html/2608.19579#bib.bib5)\]。除幻觉外,LLM还表现出一系列其他令人担忧的行为,生成不安全或有毒内容,包括仇恨言论、非法活动指导以及色情材料,即便通过人类反馈强化学习进行安全调整后亦然\[13 (https://arxiv.org/html/2608.19579#bib.bib6), 18 (https://arxiv.org/html/2608.19579#bib.bib7)\]。LLM也被证明会进行欺骗性行为,生成可误导用户或规避安全防护的输出\[34 (https://arxiv.org/html/2608.19579#bib.bib11), 36 (https://arxiv.org/html/2608.19579#bib.bib12)\]。此外,围绕偏见与公平性的担忧持续存在,因为LLM可能放大其训练数据中嵌入的社会刻板印象\[7 (https://arxiv.org/html/2608.19579#bib.bib16), 16 (https://arxiv.org/html/2608.19579#bib.bib15)\]。除了这些固有问题,LLM对越狱和提示注入等对抗性攻击的易感性增加了另一层风险,使恶意行为者能够从原本对齐的模型中诱发出有害输出\[51 (https://arxiv.org/html/2608.19579#bib.bib13), 44 (https://arxiv.org/html/2608.19579#bib.bib14)\]。

鉴于这些失败模式的严重性,迫切需要高效且可扩展的方法来监控部署中的LLM行为。虽然人类反馈强化学习(RLHF)和宪法AI等技术旨在训练期间使模型对齐\[35 (https://arxiv.org/html/2608.19579#bib.bib8), 5 (https://arxiv.org/html/2608.19579#bib.bib9)\],但它们资源密集且无法完全消除不安全输出的风险。因此,部署后监控仍然至关重要,本文的重点是检测LLM输出中的不安全行为。具体而言,我们将问题表述为二分类任务,其中生成的文本被标记为安全或不安全。

一个分析LLM行为的新兴研究方向来自动力学系统(DS)理论\[47 (https://arxiv.org/html/2608.19579#bib.bib37)\]。动力学系统与AI的交集历史上沿两个方向发展。第一个是**AI for dynamical systems**,利用机器学习来建模、预测或控制由微分或差分方程支配的物理和工程系统\[10 (https://arxiv.org/html/2608.19579#bib.bib35), 28 (https://arxiv.org/html/2608.19579#bib.bib36)\]。这一方向取得了巨大成功,动态模式分解(DMD)和神经常微分方程等数据驱动方法已应用于流体力学\[42 (https://arxiv.org/html/2608.19579#bib.bib42), 39 (https://arxiv.org/html/2608.19579#bib.bib43)\]、神经科学\[9 (https://arxiv.org/html/2608.19579#bib.bib44)\]和气候建模\[15 (https://arxiv.org/html/2608.19579#bib.bib45)\]。第二个方向是**dynamical systems for AI**,目前发展相对不足。它寻求应用动力学系统理论的数学工具(例如,吸引子、不变流形、Koopman算子)来解释和/或改进AI系统。这一方向更具挑战性,因为LLM等AI系统并非基于物理第一性原理设计;其动态性源自在高维空间中运行的数十亿学习参数。本文在此方向迈出一步,基于以下假设:如果LLM的逐词生成过程可被建模为动力学系统,那么DS理论丰富的数学工具包可应用于检测、分类和控制等问题。本研究表明基于Koopman的预测能够区分LLM的安全与不安全输出。

本文组织如下。第2节 (https://arxiv.org/html/2608.19579#S2) 提供了LLM安全和用于分类的DS框架的先前工作背景,并总结了我们的贡献。第3节 (https://arxiv.org/html/2608.19579#S3) 描述了基于DMD的分类方法的扩展,以兼顾提示和响应嵌入动态。第4节 (https://arxiv.org/html/2608.19579#S4) 展示了我们使用三种嵌入模型在三个安全基准上的实验结果,并量化了序列长度和提示纳入对分类性能的影响。第5节 (https://arxiv.org/html/2608.19579#S5) 以讨论其意义和未来方向作结。

## 2 背景

### 2.1 动机与先前工作

检测不安全LLM输出的挑战自早期GPT版本以来就吸引了大量研究努力\[17 (https://arxiv.org/html/2608.19579#bib.bib10)\]。与安全分类密切相关的幻觉检测方法,可根据所需的模型访问级别进行分类。白盒方法利用内部表示,如隐藏状态、注意力图和梯度,来识别模型何时生成不可靠内容\[4 (https://arxiv.org/html/2608.19579#bib.bib17), 43 (https://arxiv.org/html/2608.19579#bib.bib18), 12 (https://arxiv.org/html/2608.19579#bib.bib19), 21 (https://arxiv.org/html/2608.19579#bib.bib20)\]。灰盒方法通过利用词元级别的输出概率来放宽这些要求,包括下一个词元概率和对数熵,这些通常由商业LLM API暴露\[37 (https://arxiv.org/html/2608.19579#bib.bib21), 6 (https://arxiv.org/html/2608.19579#bib.bib22), 14 (https://arxiv.org/html/2608.19579#bib.bib23), 27 (https://arxiv.org/html/2608.19579#bib.bib24)\]。黑盒方法施加的访问要求最少,因为它们仅对生成的文本输出进行操作。它们通常依赖于采样多个响应,并通过词汇重叠、基于蕴含的比较或知识图谱表示来评估其一致性\[32 (https://arxiv.org/html/2608.19579#bib.bib25), 49 (https://arxiv.org/html/2608.19579#bib.bib26), 26 (https://arxiv.org/html/2608.19579#bib.bib27), 19 (https://arxiv.org/html/2608.19579#bib.bib28), 40 (https://arxiv.org/html/2608.19579#bib.bib29)\]。

最近在\[47 (https://arxiv.org/html/2608.19579#bib.bib37), 3 (https://arxiv.org/html/2608.19579#bib.bib38)\]中提出了一种通过将LLM视为黑盒动力学系统来进行幻觉检测的方法。如图1 (https://arxiv.org/html/2608.19579#S2.F1)所示,该方法通过预训练的嵌入模型将LLM响应投影到高维嵌入空间,并将生成的词元嵌入序列表征为LLM潜在状态空间动态的可观测实现。然后使用扩展DMD(EDMD)\[46 (https://arxiv.org/html/2608.19579#bib.bib34)\]为事实和幻觉机制拟合独立的基于Koopman算子的预测模型,再根据各自的预测误差定义一个微分残差分数。

参见标题\(\(a\)\)先前工作:多个响应
参见标题\(\(b\)\)近期工作:单个响应的词元动态

图 1:分析LLM响应属性的两种方法:\(a\) 通过改变softmax温度参数为同一查询获取多个响应,以及 \(b\) 通过嵌入模型获得的单个响应的词元嵌入动态。该方法在多个数据集上(包括HaluEval\[30 (https://arxiv.org/html/2608.19579#bib.bib30)\]、WikiBio\[32 (https://arxiv.org/html/2608.19579#bib.bib25)\]和FELM\[50 (https://arxiv.org/html/2608.19579#bib.bib31)\])使用单次推理且无需多个随机样本、访问词元概率或外部知识检索,实现了具有竞争力的分类性能。然而,该方法仅依赖于LLM响应的词元嵌入动态,未利用提示中编码的信息。

要理解提示角色为何重要,表1 (https://arxiv.org/html/2608.19579#S2.T1)突出了两种不同类型的不安全LLM交互。在第一种情况下,危险仅存在于提供不安全医疗建议的响应中。这种仅响应的不安全行为原则上可以通过在生成后检查输出文本来捕获。然而,这种简单检查在第二个示例中失效,该示例显示了一个不安全交互,其中提示和响应单独看完全安全。相反,风险来自提示与响应之间的交互。在此情况下,模型基于用户的问题错误地批准了现金退款。从这个角度来看,与其将安全视为对LLM输出的一次性检查,我们提出的基于Koopman的方法通过拟合提示和响应DS来考虑这种交互,这些DS能够将词元演化轨迹映射以分类仅响应过滤器无法检测到的隐藏上下文漂移。

表 1:与LLM的两种不安全交互类型。
### 2.2 贡献

在这项工作中,我们扩展了\[47 (https://arxiv.org/html/2608.19579#bib.bib37)\]中提出的基于Koopman的二分类方法,以同时考虑提示和LLM响应的词元动态。我们重新审视了基于微分分数的分类方法,并结合了提示和响应的两个DS所引起的基于DMD的预测误差。这样做,我们允许分类器捕获对LLM安全至关重要的因果提示-响应模式。因为相同的响应可能根据引发它的提示而变得安全或不安全。我们证明,对提示和响应动态进行这种联合建模,相比仅响应分类能带来持续改进。我们使用三种不同规模的嵌入模型(0.6B参数的Qwen3-Embed、7.2B的Mistral和8.0B的Llama-3)在三个安全基准上的实证评估,确立了我们**提示感知**DS-based分类器的有效性。它还揭示了嵌入模型与检测到的安全违规性质之间微妙的关系,为不同嵌入模型在何种情况下表现优异提供了见解。

参见标题\(\(a\)\)阶段1:动力学系统拟合
参见标题\(\(b\)\)阶段2:安全检测

图 2:通过动力学系统(DS)进行安全检测:\(a\) DS拟合(阶段1):安全和不安全的文本数据集被映射为词元嵌入矩阵,以估计两个不同的Koopman算子,它们对安全与不安全词元轨迹的时间演化进行建模,\(b\) 安全分类(阶段2):将提示和响应通过拟合好的提示和响应DS模型,通过将微分分数与阈值进行比较来确定安全类别。

## 3 用于安全分类的动态模式分解

### 3.1 概述

我们将LLM的逐词生成过程视为一个离散时间动力学系统,其可观测轨迹根据生成的响应和提示的性质而演化不同。在图2(a) (https://arxiv.org/html/2608.19579#S2.F2.sf1)描绘的DS拟合阶段,为安全和不安全的响应与提示分别获得了四个Koopman算子。然后,在图2(b) (https://arxiv.org/html/2608.19579#S2.F2.sf2)所示的推理阶段计算微分残差分数,以确定LLM响应的安全性。纳入提示词元动态的动机在于观察到安全违规通常是交互依赖性的。

### 3.2 基于微分残差分数的提示感知LLM响应分类

词元嵌入的动态形式上可以使用Koopman算子理论\[33 (https://arxiv.org/html/2608.19579#bib.bib46)\], \[11 (https://arxiv.org/html/2608.19579#bib.bib47)\]来研究。对于给定的LLM响应,设 \(q_k\) 为第 \(k\) 个词元,\(y_k = G_2(q_k) \in \mathbb{R}^M\) 为其关联的词元嵌入,其中 \(G_2\) 将词元映射到嵌入(例如通过Qwen、Mistral等)。Koopman算子 \(K: \mathbb{R}^M \rightarrow \mathbb{R}^M\) 根据关系 \(y_{k+1} = K(y_k)\) 捕获可观测量的动态。Koopman算子是线性的,但可能是无限维的\[33 (https://arxiv.org/html/2608.19579#bib.bib46)\]\[11 (https://arxiv.org/html/2608.19579#bib.bib47)\]。动态模式分解可用于获得Koopman算子的数据驱动、有限维近似\[29 (https://arxiv.org/html/2608.19579#bib.bib51)\], \[41 (https://arxiv.org/html/2608.19579#bib.bib48)\], \[38 (https://arxiv.org/html/2608.19579#bib.bib50)\], \[45 (https://arxiv.org/html/2608.19579#bib.bib49)\]。遵循扩展DMD方法\[45 (https://arxiv.org/html/2608.19579#bib.bib49)\],我们首先将词元嵌入提升到一个更高维的空间 \(z_k = \begin{bmatrix} y_k^\top & f_{\rm lift}^\top(y_k) \end{bmatrix}^\top\)

相似文章