Answer-then-Edit: 面向反蒸馏且保持效用性的推理骨架编辑
摘要
本文提出SGRE,一种Answer-then-Edit框架,通过修改大语言模型的推理轨迹来防止未经授权的知识蒸馏,同时保留答案准确性和自然度,借鉴认知负荷理论增加学生模型的外部认知负荷。
arXiv:2607.20440v1 公告类型:新 \n 摘要:专有大型语言模型(LLMs)涉及大量的智力和财务投入,使其成为宝贵的知识产权(IP)。然而,即使通过黑盒API部署,这些模型仍然容易受到未经授权的知识蒸馏攻击,使攻击者能够低成本地提取和复制模型能力。为解决这一问题,反蒸馏(AD)方法被提出,旨在生成防御性输出以阻碍蒸馏效果,克服了基于水印的方法依赖事后验证的局限性。然而,现有基于内部模型扰动的AD方法难以在反蒸馏性和推理轨迹的效用性(如答案准确性和自然度)之间取得平衡,更强的防御往往导致显著的效用损失。为填补这一空白,我们提出了\textbf{\underline{S}}keleton-\textbf{\underline{G}}uided \textbf{\underline{R}}easoning \textbf{\underline{E}}diting(SGRE),一个先回答后编辑(Answer-then-Edit)框架,用于对推理轨迹进行事后修改以实现反蒸馏。在回答阶段,教师模型首先生成清晰的推理轨迹,保留原始推理准确性的同时,对轨迹自然度实现更灵活的控制。在编辑阶段,我们借鉴认知负荷理论(CLT),引入三阶段策略:推理骨架提取、骨架图粗化和骨架语言化。这些操作共同扰动推理结构并增加文本复杂度,从而放大对学生模型的外部认知负荷,阻碍其获取底层推理模式。跨不同LLMs的大量实验表明,SGRE在降低蒸馏有效性方面达到了最先进的性能,同时保持了无损的推理准确性和优越的轨迹自然度。
查看缓存全文
缓存时间: 2026/07/24 05:16
# 先答后编:面向抗蒸馏的推理骨架编辑,同时保持效用不变
来源:https://arxiv.org/html/2607.20440
范李¹∗, 潘梦婷¹, 徐思佳¹¹¹footnotemark:1, 王晓阳¹, 陈晨², 张文杰¹
¹ 新南威尔士大学计算机科学与工程学院
² 深圳大学人工智能学院
\{fan.li, mengting.pan, sijia.xu, xiaoyang.wang1, wenjie.zhang\}@unsw.edu.au
[email protected]
###### 摘要
专有大语言模型(LLMs)涉及大量的智力和财务投入,使其成为宝贵的知识产权(IP)。然而,即使通过黑盒API部署,这些模型仍然容易受到未经授权的知识蒸馏攻击,攻击者可以廉价地提取和复制模型能力。为解决这一问题,研究者提出了抗蒸馏(AD)方法,生成防御性输出以阻碍蒸馏效果,克服了基于水印的方法仅依赖事后验证的局限性。然而,现有基于模型内部扰动的AD方法难以在抗蒸馏能力和实用性(例如,答案准确性和推理链的自然性)之间取得平衡,更强的防御往往导致显著的实用性损失。为填补这一空白,我们提出骨架引导推理编辑(Skeleton-Guided Reasoning Editing,SGRE),一种“先答后编”(Answer-then-Edit)框架,对推理链进行事后修改以实现抗蒸馏。在回答阶段,教师模型首先生成干净的推理链,保留原始推理准确性,同时为推理链的自然性提供更灵活的控制。在编辑阶段,我们从认知负荷理论(CLT)中汲取灵感,引入一个三阶段策略,包括推理骨架提取、骨架图粗化和骨架语言化。这些操作共同扰乱推理结构并增加文本复杂度,从而在学生模型上放大外部负荷,阻碍其获取底层推理模式。在多种LLM上的大量实验表明,SGRE在降低蒸馏效果方面达到了最先进的性能,同时保持了无损失的推理准确性和出色的推理链自然性。
## 1 引言
大语言模型(LLMs)展现了卓越的推理能力,并作为基础模型解决跨领域的复杂任务[1(https://arxiv.org/html/2607.20440#bib.bib12),23(https://arxiv.org/html/2607.20440#bib.bib13),41(https://arxiv.org/html/2607.20440#bib.bib14)]。开发此类模型需要大量资源,包括大规模数据整理、昂贵的计算预算、专业知识和大量人力,使其成为宝贵的知识产权(IP)。为保护这些资产,商业模型提供商通常限制对模型内部的访问,仅通过API暴露模型能力。然而,近期研究表明,专有LLM生成的推理链可被用于知识蒸馏(KD)[13(https://arxiv.org/html/2607.20440#bib.bib16),5(https://arxiv.org/html/2607.20440#bib.bib9),9(https://arxiv.org/html/2607.20440#bib.bib7),22(https://arxiv.org/html/2607.20440#bib.bib15)],将知识从大型强大的教师模型转移到更小、更高效的学生模型。这使得竞争对手能够廉价地复制前沿模型性能,构成显著的知识产权风险。为防御这一威胁,研究者提出了LLM水印[10(https://arxiv.org/html/2607.20440#bib.bib18),18(https://arxiv.org/html/2607.20440#bib.bib17)]和指纹识别[40(https://arxiv.org/html/2607.20440#bib.bib20),43(https://arxiv.org/html/2607.20440#bib.bib19)],通过在查询响应中嵌入可识别信号,使得在蒸馏模型中检测误用或未经授权的复制成为可能。然而,这些策略主要提供事后验证,未能防止通过知识蒸馏进行未经授权的能力提取。
请参见图注
图1:抗蒸馏推理链的自然性。
为填补这一空白,抗蒸馏(AD)[26(https://arxiv.org/html/2607.20440#bib.bib5),21(https://arxiv.org/html/2607.20440#bib.bib6)]作为一种生成防御性推理链以阻碍有效蒸馏的技术,日益受到关注。抗蒸馏采样(ADS)[26(https://arxiv.org/html/2607.20440#bib.bib5)]通过基于梯度的惩罚扰动教师的下一个词元分布,从而增加学生模型在生成推理链上训练时的损失,开创了AD方法。DOGe[21(https://arxiv.org/html/2607.20440#bib.bib6)]通过对教师最终线性层进行对抗微调,生成误导蒸馏的输出。尽管有效,现有AD方法难以在生成推理链的实用性(例如,教师答案准确性和推理链自然性)与抗蒸馏能力之间取得理想平衡。这一局限性体现在两个关键方面:(i)显著降低推理链的蒸馏效果往往以准确性大幅下降为代价。例如,如表1(https://arxiv.org/html/2607.20440#S4.T1)所示,在GSM8K上,ADS将Llama-3.2-3B的蒸馏性能降低了37.88%,但导致推理准确性下降超过19.03%。相比之下,DOGe保留了教师的推理能力,但仅使学生性能下降4.38%。(ii)提高推理链的抗蒸馏能力往往导致语言自然性显著下降。如图1(https://arxiv.org/html/2607.20440#S1.F1)所示,与原始教师的干净输出相比,ADS产生的推理链包含不规则词元、结构不连贯和语法错误,削弱了其语义可解释性并损害了商业LLM服务的用户体验。我们分析认为,这些权衡问题可能源于模型内部扰动范式。具体来说:(i)ADS在解码过程中直接扰动logit分布,引入不可控的采样噪声,使得语义连贯性难以维持,从而降低推理准确性和自然性;(ii)DOGe通过在模型参数上进行对抗优化实现抗蒸馏,设计有效的对抗损失具有挑战性且通常依赖于特定假设[21(https://arxiv.org/html/2607.20440#bib.bib6)],可能限制其实际效果。这些观察促使我们提出“先答后编”范式,即在已生成的教师推理链上进行事后编辑,而非扰动模型内部。这种设计保留了教师的原始推理能力和答案准确性,同时在文本和语义层面实现抗蒸馏。因此,该框架在可读性和自然性上提供了更好的可控性,同时避免了过度解码噪声和不可靠的优化目标。
为设计有效的事后推理链编辑策略,我们借鉴了认知负荷理论(CLT)[29(https://arxiv.org/html/2607.20440#bib.bib33),30(https://arxiv.org/html/2607.20440#bib.bib43),25(https://arxiv.org/html/2607.20440#bib.bib34)],这是一个在教育研究中广泛用于教学设计的有据可查的认知理论。CLT认为人类认知能力有限,学习效果同时受三种认知负荷的影响:内在负荷、外部负荷和关联负荷。具体而言,内在负荷反映学习任务的内在复杂性,对于给定问题通常是固定的。外部负荷由教学材料和任务的呈现方式引起,而关联负荷则对应于用于形成底层知识图式的认知资源。CLT的核心原则是有效的教学设计应最小化由教学呈现引起的不必要的外部负荷,从而使更多认知能力分配到关联负荷上,以实现有效的图式获取[28(https://arxiv.org/html/2607.20440#bib.bib44)]。例如,具有足够且结构良好内容、清晰逻辑组织和明确语言表达的教学材料可以减少不必要的信息处理负担,改善学生学习[30(https://arxiv.org/html/2607.20440#bib.bib43)]。这启发我们在抗蒸馏过程中增加推理链的呈现复杂度,从而将学生模型的注意力从核心推理过程转移,阻止底层推理模式的形成。基于这一洞察,我们提出骨架引导推理编辑(Skeleton-Guided Reasoning Editing,SGRE),一种事后抗蒸馏方法,从推理逻辑和文本表达两个维度编辑推理链。具体而言,SGRE包含三个阶段:推理骨架提取、骨架图粗化和骨架语言化。首先,我们使用一个小型LLM从教师生成的推理链中提取推理骨架图,将关键推理步骤及其依赖关系总结为紧凑结构。该过程压缩辅助细节并模糊显式逻辑连接,使底层推理过程更难重建。然后,我们对骨架图执行结构化粗化,打乱推理步骤的粒度并纠缠逻辑结构。最后,我们使用教师模型将粗化后的骨架语言化为输出推理链,注入受控的文本复杂度,同时保持整体正确性和自然性。
我们的主要贡献如下:
- •我们指出现有基于教师模型内部扰动的抗蒸馏方法无法在实用性和抗蒸馏能力之间取得理想平衡,并引入“先答后编”范式,将抗蒸馏与教师推理过程解耦。
- •受认知负荷理论(CLT)启发,我们提出骨架引导推理编辑(SGRE),一种新颖的事后抗蒸馏框架,结合推理结构扰动和文本复杂度增强,以放大推理链中的外部负荷,从而阻碍学生推理模式的学习。
- •在多种LLM架构上的大量实验表明,SGRE在降低蒸馏效果方面始终达到最先进性能,同时保持推理准确性。此外,自然性评估显示SGRE有效缓解了抗蒸馏过程中的可读性下降,突显其实用性。
## 2 预备知识
基于SFT的知识蒸馏。在本工作中,遵循[26(https://arxiv.org/html/2607.20440#bib.bib5),21(https://arxiv.org/html/2607.20440#bib.bib6)],我们关注基于监督微调(SFT)的知识蒸馏,这是实际基于文本的知识蒸馏设置中广泛采用的方法。具体而言,令T表示大型教师模型,S表示较小的学生模型。给定一组查询Q={qi}i=1^n,教师为每个查询qi自回归生成推理链ri=T(qi)=(yi,1,...,yi,Li),如下:
PT(ri|qi) = ∏_{t=1}^{Li} PT(yi,t | qi, yi, <t)
(注:原稿此处公式被截断,译文保留原文意图。)
首先,总共有12只狗。一半的狗用后腿站立,这意味着6只狗用后腿站立。每只用后腿站立的狗有2只爪子在地上。另一半狗用四条腿站立,这也意味着6只狗用前腿站立。每只用四条腿站立的狗有4只爪子在地上。为了计算地上的总爪数,我计算:(6只狗 × 2只爪) + (6只狗 × 4只爪) = 12只爪 + 24只爪 = 36只爪。让我们逐步解决问题。
**步骤1:确定每组狗的数量。**
\[ \text{后腿狗} = \frac{12}{2}=6\quad \text{四条腿狗} = \frac{12}{2}=6 \]
**步骤2:计算每组在地上爪数。**
\[ 6\text{狗}\times 2\text{爪}=12\text{爪} \]
\[ 6\text{狗}\times 4\text{爪}=24\text{爪} \]
**步骤3:地上总爪数。**
\[ 12\text{爪}+24\text{爪}=36\text{爪} \]
**最终答案:**
\[ \boxed{36\text{爪}} \]
语言化推理链:
[⬇](data:text/plain;base64,...)
(此处省略Base64编码内容,保留原文)
好吧,我需要弄清楚有多少只狗的爪子在地上。让我从理解问题开始。总共有12只狗。一半用后腿站立,另一半用四条腿站立。首先,分解数字。12的一半是6,所以有6只用后腿站立,6只用四条腿。现在,每只用后腿站立的狗有2只爪子在地上。因此,6只狗乘以2只爪子等于12只爪。接下来,四条腿站立的狗每只有4只爪子。所以,6只狗乘以4只爪是24只爪。要找到地上的总爪数,我需要将这两个数相加。那就是12只爪加24只爪,总共等于36只爪。我认为就这么简单。我只需要确保没有遗漏任何细节,并且计算正确。是的,6乘以2是12,6乘以4是24,12加24绝对是36。所以,地上的总爪数是36。
地上的总爪数是36。
**最终答案:**
\[ \boxed{36} \]
推理骨架:
[⬇](data:text/plain;base64,...)
(此处省略Base64编码内容,保留原文)
{
"steps": [
{
"id": "S1",
"type": "support",
"claim": "总共有12只狗,一半用后腿站立,另一半用四条腿站立。",
"depends_on": []
},
{
"id": "S2",
"type": "support",
"claim": "6只狗用后腿站立,6只狗用四条腿站立。",
"depends_on": ["S1"]
},
{
"id": "S3",
"type": "reasoning",
"claim": "每只用后腿站立的狗有2只爪子在地上;每只用四条腿站立的狗有4只爪子在地上。",
"depends_on": ["S1"]
},
{
"id": "S4",
"type": "support",
"claim": "后腿狗的总爪数:6 × 2 = 12只爪。",
"depends_on": ["S2"]
},
{
"id": "S5",
"type": "support",
"claim": "四条腿狗的总爪数:6 × 4 = 24只爪。",
"depends_on": ["S2"]
}
]
}
(注:根据原文上下文,此处骨架被截断,译文保留原意。后续部分未被提供,但根据原文结构,后续应为骨架图粗化和语言化的描述,以及实验等。由于用户只要求翻译提供的片段,我们在此停止。)相似文章
在策略自蒸馏中尊重自不确定性以实现高效LLM推理
本文提出了EGRSD和CL-EGRSD,这是在策略自蒸馏方法,通过教师熵对令牌级监督进行加权,以改善大语言模型推理准确性-长度的权衡,并在Qwen3-4B和Qwen3-8B上进行了评估。
基于外部子图生成的大语言模型逐步推理增强
本文提出了SGR框架,通过查询相关的子图生成将外部知识图谱与大语言模型相结合,融合基于Cypher的推理与协同推理集成,从而增强大语言模型的逐步推理能力。在CWQ、WebQSP、GrailQA和KQA Pro上的实验表明,该框架相比标准提示方法和知识增强基线具有更高的推理准确性。
用于LLM推理的自适应教师暴露自蒸馏方法
自适应教师暴露自蒸馏(ATESD)通过可学习的策略控制器和折扣学习进度奖励动态调整教师向学生展示参考推理的比例,从而提升LLM推理能力。在数学基准上的实验表明,该方法相较于现有自蒸馏和强化学习基线均取得了一致改进。
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
提出反自蒸馏(AntiSD),该方法逆转自蒸馏中的知识转移方向,以提高数学推理的效率和准确率,在4B到30B参数的多个模型上,用2-10倍更少的训练步数达到GRPO基线的准确率,最终准确率最高提升11.5个百分点。
Dynamic Rollout Editing:减少RL训练推理模型中的过度思考
本文介绍了一种训练时干预方法——动态展开编辑(Dynamic Rollout Editing, DRE),用于减少GRPO式强化学习推理模型中的过度思考。DRE通过保留可到达解的路径前缀并偏好经过验证的较短版本,来编辑成功轨迹,从而削弱对不必要思考的偏好。