构造驱动的注入:基于语言学的编辑型代码混合指纹技术用于大型语言模型
摘要
提出一个统一框架LCF和LCFEdit,联合优化使用低资源语言为LLMs生成代码混合指纹的构造与注入过程,以实现不可察觉且鲁棒的所有权验证。
arXiv:2607.25633v1 公告类型:新
摘要:大型语言模型(LLMs)是昂贵的知识产权资产,面临未经授权的再分发和商业滥用的风险。注入指纹,即嵌入模型行为的触发-目标对,提供了一种实用的黑盒可验证所有权信号,但现有方法将指纹生命周期中的两个阶段——指纹的构造与注入——解耦。现有指纹框架存在两个局限性:自然语言指纹容易意外激活,而乱码指纹则容易被基于困惑度的检测过滤掉。此外,将构造与注入解耦使得后者无法感知触发器的语言结构,从而错失针对性优化的机会。我们认为指纹构造应驱动注入,并提出了一个统一框架,联合优化这两个阶段。首先,LCF通过结合低资源语言,在语义密度替换规则和语法偏置混合规则下构建代码混合指纹,生成触发器的困惑度远低于乱码基线,同时避免了自然语言触发器的意外激活问题。其次,LCFEdit利用源自高资源多语言表示的空空间投影来注入每个指纹,保留知识,并通过跨语言对齐步骤将权重更新引导至指纹语言的表示子空间。这种构造感知的注入确保了更新具有语言信息性,从而更加稳定。在不可察觉性、可检测性和无害性方面的广泛评估表明,该方法能实现持续的所有权验证,且对实用性影响极小。
查看缓存全文
缓存时间: 2026/07/29 09:55
# 基于语言学的编辑式代码混合指纹用于大型语言模型
来源:https://arxiv.org/html/2607.25633
## 构造驱动注入:基于语言学的编辑式代码混合指纹用于大型语言模型
Yongyi Cui¹, Yue Li¹¹¹, Tianbao Jiang¹, Xin Yi¹
###### 摘要
大型语言模型(LLMs)是昂贵的智力资产,仍然面临未经授权的再分发和商业滥用的风险。注入指纹,即嵌入模型行为中的触发-目标对,提供了一种实用的、黑盒可验证的所有权信号,但现有方法将指纹生命周期的两个阶段——指纹如何构造以及如何注入——分离开来。现有指纹框架存在两个局限性:自然语言指纹容易意外激活,而乱码指纹容易被基于困惑度的检测过滤。此外,将构造与注入分离使得注入阶段无法感知触发的语言结构,从而错失了针对性优化的机会。我们认为指纹构造应驱动注入,并提出了一个统一的指纹框架,联合优化这两个阶段。首先,LCF通过语义密度替换规则和语法偏置混合,结合低资源语言构建代码混合指纹,生成的触发词困惑度远低于乱码基线,同时避免了自然语言触发的意外激活失败。其次,LCFEdit利用从高资源多语言表示中导出的零空间投影注入每个指纹,该投影保留了知识,并辅以跨语言对齐步骤,将权重更新导向指纹语言的表示子空间。这种构造感知注入确保了更新具有语言信息,因此更加稳定。在不可感知性、可检测性和无害性上的广泛评估表明,该框架在效用影响可忽略的前提下实现了持久的所有权验证。
## 1 引言
大型语言模型(LLMs)需要大量的计算、数据和工程投入才能构建,因此它们是有价值的智力资产。一旦权重被发布,即使是在限制性许可下,也可能被再分发、微调、量化或合并,然后通过隐藏底层参数的黑盒API重新提供服务(Touvron et al. 2023 (https://arxiv.org/html/2607.25633#bib.bib34); Xu et al. 2024 (https://arxiv.org/html/2607.25633#bib.bib27))。因此,可靠的所有权验证必须能够承受现实中的发布后修改,并且不能要求白盒访问嫌疑模型。模型指纹识别已成为主要的应对方案。内在方法比较权重或激活,因此需要完全的参数访问,这排除了常见的黑盒侵权场景。注入指纹则将触发-目标对直接嵌入模型行为中,因此可以通过查询部署的模型来检查所有权(Russinovich and Salem 2024 (https://arxiv.org/html/2607.25633#bib.bib28))。注入指纹在其生命周期中经历两个阶段:首先构造(设计触发-目标对),然后注入(将对写入权重)。如表1 (https://arxiv.org/html/2607.25633#S1.T1) 所示,先前的工作孤立地优化这两个阶段,而这种分离正是持续弱点的根源。
参见图注
图1:我们的框架将指纹生命周期两个阶段耦合。(A) 构造:LCF通过语义密度替换规则和语法偏置混合,将中/低资源句子转换为代码混合触发-目标对;该设计源于数字岛假设,即低资源指纹令牌在主流微调中收到的梯度很少。(B) 注入:LCFEdit通过保留主流的零空间投影将对写入FFN键值记忆,随后进行跨语言对齐步骤,将更新集中在指纹语言的子空间中。橙色箭头标记了耦合:构造阶段的语言身份决定了注入集中在何处进行编辑。
表1:我们的LCF-LCFEdit框架与近期LLM指纹框架的比较。
在指纹构造的第一阶段,现有范式面临用户侧和模型侧不可感知性之间的权衡。自然语言指纹(NLFs)使用类似普通用户输入的英文短语(Wang et al. 2025 (https://arxiv.org/html/2607.25633#bib.bib17))。由于它们与良性输入分布重叠,因此会遭受意外激活:最近一项研究报告称,当NLF作为句子后缀出现时,错误触发率高达约60%(Li et al. 2025b (https://arxiv.org/html/2607.25633#bib.bib19))。乱码或“指令式”指纹(IFs)使用随机令牌序列(Xu et al. 2024 (https://arxiv.org/html/2607.25633#bib.bib27); Cai et al. 2025 (https://arxiv.org/html/2607.25633#bib.bib6))。这些避免了意外激活,但统计上异常,因为其困惑度比自然文本高几个数量级,因此攻击者可以用简单的困惑度过滤器标记它们。代码混合指纹(CFs)最近被引入以占据中间地带(表1 (https://arxiv.org/html/2607.25633#S1.T1)),但其构造是基于随机采样语言的规则,没有原则性地解释为什么特定的混合既能难以意外触发又难以被统计检测。在指纹注入的第二阶段,监督微调(例如LoRA(Hu et al. 2022 (https://arxiv.org/html/2607.25633#bib.bib30)))提供有限的令牌级控制且容易过拟合。知识编辑注入更强:定位-编辑方法如ROME(Meng et al. 2022 (https://arxiv.org/html/2607.25633#bib.bib23))和MEMIT(Meng et al. 2023 (https://arxiv.org/html/2607.25633#bib.bib25))将关联直接写入前馈层,而AlphaEdit(Fang et al. 2025 (https://arxiv.org/html/2607.25633#bib.bib1))将扰动投影到保留知识的零空间,使得无关事实不受干扰。FPEdit将这种机制适应于指纹识别,使用促进-抑制的值向量目标,而MCEdit则添加了多候选目标和基于边界的边界。然而,所有这些方法中,注入过程对指纹的构造方式视而不见:无论触发是英文、乱码还是代码混合,都使用相同的通用零空间和通用目标。构造阶段创建的语言先验恰恰在可以指导注入时被丢弃。
为了解决这些问题,我们认为代码混合指纹的语言结构应直接塑造其注入,并开发了一个端到端的框架,包含两个耦合组件。
*第一*,我们提出了LCF(基于语言学的代码混合指纹),它从由语义密度规则选择并由语法偏置混合塑造的低资源语言组合构建指纹。该设计源于我们称之为“数字岛”的工作假设:与低资源语言相关的参数在主流语言适应过程中收到的梯度信号很小,因此锚定在那里的指纹自然地免受再分发者可能应用的微调、量化和剪枝的影响。
*第二*,我们提出了LCFEdit,它通过将保留主流英语/中文知识的零空间投影与跨语言对齐步骤配对来注入每个指纹:将求解的权重更新重新对齐到指纹语言的表示子空间,该子空间从该语言的维基百科关键统计量中估计。这一步利用构造阶段的语言身份来决定在表示空间的何处集中编辑,从而连接构造和注入。实验结果表明,LCF在用户侧和模型侧不可感知性之间取得了有效平衡,在所有指纹范式(均值96,对比CF的104和乱码IF的1302)中实现了最低的模板困惑度,同时在12种语言中表现出零意外激活。此外,LCFEdit的构造感知注入实现了更鲁棒且容错的所有权验证,注入成功率达到93–99.5%,平均攻击后保留率比AlphaEdit基线提高9–34个百分点,在不同模型规模和架构下具有领先的可检测性。LCFEdit在各种模型修改下保持至少55%的平均可检测性,对模型效用的影响可忽略。总之,我们的贡献如下:
- • 我们提出了LCF,一种代码混合指纹构造方法,通过语义密度替换规则和低资源语言的语法偏置混合,缓解了先前范式的不可感知性权衡。
- • 我们提出了LCFEdit,一种多语言指纹注入方法,将保留主流的零空间编辑与根据构造阶段语言确定的跨语言对齐步骤相结合,使每次编辑都集中在指纹语言的表示子空间。
- • 我们的端到端框架在四个模型上展现出相对于现有方法的一致提升,平均注入成功率从55–70%提高到93–99.5%,平均攻击后保留率提高9–34个百分点,从而实现了现实部署中的可靠所有权验证。
## 2 相关工作
### 2.1 大语言模型指纹识别
随着LLMs面临日益增长的安全威胁,从越狱和有害微调攻击(Yi et al. 2026 (https://arxiv.org/html/2607.25633#bib.bib18), 2025a (https://arxiv.org/html/2607.25633#bib.bib29))到未经授权的再分发,保护其知识产权已成为紧迫问题。指纹识别和水印是两种相关的LLM知识产权保护技术。水印在生成内容中嵌入可识别信号,以区分机器生成文本和人类撰写文本,便于追溯内容来源(Kirchenbauer et al. 2023 (https://arxiv.org/html/2607.25633#bib.bib33); Li et al. 2026b (https://arxiv.org/html/2607.25633#bib.bib24); Yi et al. 2025b (https://arxiv.org/html/2607.25633#bib.bib22))。相比之下,指纹识别验证可疑模型是否源自原始模型,即使经过下游修改。LLM指纹大致分为两种类型(Zhang et al. 2025 (https://arxiv.org/html/2607.25633#bib.bib4)):注入指纹(Cai et al. 2025 (https://arxiv.org/html/2607.25633#bib.bib6)),它修改模型以嵌入特定的触发-目标对;以及内在指纹(McGovern et al. 2025 (https://arxiv.org/html/2607.25633#bib.bib5)),它依赖于模型固有的统计或行为特征。然而,内在指纹方法往往需要白盒访问模型参数,限制了其适用性。由于注入指纹需要参数更新来嵌入触发-目标对,它们不可避免地会引入一些模型效用损失。本文旨在开发一种不可感知且持久的注入指纹框架,同时最小化对无关知识的干扰。
### 2.2 基于编辑的指纹注入
知识编辑作为监督微调的轻量级替代方案,能够对模型知识进行针对性更新。现有方法分为三类:定位-编辑、超网络和基于记忆的技术(Wang et al. 2024a (https://arxiv.org/html/2607.25633#bib.bib3))。AlphaEdit是一种代表性的定位-编辑方法,它将更新限制在与无关知识正交的零空间中,从而保留模型效用。它也被广泛采用作为基于编辑的指纹注入工作的主要基础方法(Li et al. 2025a (https://arxiv.org/html/2607.25633#bib.bib2); Yue et al. 2025 (https://arxiv.org/html/2607.25633#bib.bib20))。这些技术引入改进以实现严格的指纹匹配,并优化以在模型修改攻击下保持可检测性。然而,它们将指纹构造和指纹注入视为两个独立阶段,错过了联合优化以实现更有效指纹识别的机会。
## 3 方法论
#### 概述。如图1 (https://arxiv.org/html/2607.25633#S1.F1) 所示,我们的框架包含两个阶段。第3.2节 (https://arxiv.org/html/2607.25633#S3.SS2) 介绍LCF,它通过语义密度替换规则和语法偏置混合,从低资源语言构建代码混合指纹,平衡意外激活和统计可检测性。第3.3节 (https://arxiv.org/html/2607.25633#S3.SS3) 介绍LCFEdit,它通过保留主流的零空间编辑,随后根据构造阶段语言进行跨语言对齐步骤来注入指纹。
### 3.1 问题设置与威胁模型
令 \(f_W\) 为具有权重 \(W\) 的受害模型。指纹是一对 \((x, y)\),其中 \(x\) 是触发提示,\(y\) 是目标补全。我们使用一对一指纹:每个触发映射到一个目标。所有权验证用 \(x\) 查询可疑模型,并检查输出是否以 \(y\) 开头。
#### 威胁模型。攻击者获得完整权重 \(W\) 并将模型作为黑盒提供服务。攻击者可能知道指纹已被嵌入,但不知道其具体形式或内容。为了逃避所有权验证,攻击者可以 (i) 应用保持效用的修改,如微调、量化或剪枝来擦除指纹,以及 (ii) 部署异常输入过滤器(例如基于困惑度)来阻止可疑的验证查询。因此,实用的指纹必须在用户侧(无意外激活)和模型侧(统计接近自然文本)保持不可感知,在模型修改后仍可检测,并保持模型效用不变。
### 3.2 LCF:基于语言学的构造
#### 数字岛假设。指令微调、量化和剪枝在绝大多数情况下由主流语言数据和激活驱动。我们假设,与低资源语言对齐的参数因此位于表示空间中相对“安静”的区域,在主流微调中收到较小的梯度,并且不太可能被量化剪枝或扭曲。形式上,对于微调梯度 \(g_{ft}\) 和指纹令牌嵌入 \(w\),我们假设
\[
\mathbb{E}\big[\langle g_{ft}, w_{\text{LCF}}\rangle\big] \ll \mathbb{E}\big[\langle g_{ft}, w_{\text{NLF}}\rangle\big].
\]
(1)
我们将公式 (1) (https://arxiv.org/html/2607.25633#S3.E1) 作为激发我们构造的假设。我们并不声称证明了它,而我们在模型修改下的可检测性结果(第5节 (https://arxiv.org/html/2607.25633#S5))与该梯度层面的陈述一致,但并未直接测量。
#### 语义密度替换。给定一个中/低资源语言NLF作为源,我们用其他低资源语言中的等价物替换选定的名词短语,以最大化跨语言区分性。我们将单词 \(w\) 的语义密度定义为
\[
D(w) = \frac{SI(w)}{L(w)}, \quad SI(w) = \frac{1}{k} \sum_{j=1}^{k} \lVert e(w) - e(w_j^{NN}) \rVert_2,
\]相似文章
一种基于MLIR的大型语言模型编译方法
本文提出了一种基于MLIR的大型语言模型编译方法,通过两种自定义方言(TopOp和TpuOp)将模型从框架无关的语义逐层降低为硬件专用指令,并针对自回归推理阶段(预填充、预填充KV和解码)引入三阶段静态编译。
隐藏、重建与越狱:利用多模态大语言模型中的重建-隐藏权衡
本文分析了针对多模态大语言模型(MLLMs)的意图混淆越狱攻击中存在的重建-隐藏权衡问题。提出了感知隐藏的变体构建方法和与关键词相关的干扰图像,以更有效地利用模型漏洞。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
可学习性引导的扩散语言模型微调
我们提出LIFT,一种可学习性引导的扩散语言模型微调算法,该算法根据 token 难度和时间步对齐训练,在推理基准测试上取得了显著提升。
轻量级风格一致性分析:用于多媒体内容审核的大语言模型生成文本鲁棒性检测
提出了 LiSCP,一种轻量级的风格一致性分析方法,旨在鲁棒性地检测大语言模型(LLM)生成的文本内容,重点关注在对抗性操纵下特征的稳定性。在域内和跨域检测中取得了优异的性能,并具有显著的鲁棒性。