知识蒸馏对小型语言模型偏见的非对称影响
摘要
本文表明,知识蒸馏对小型语言模型中的偏见具有非对称影响:在无歧义任务上,它提升了上下文遵循能力,但在有歧义任务上却损害了拒答校准;并提出了PCCD,一种用于诊断聚合指标遗漏的逐项损害的协议。
arXiv:2607.28639v1 公告类型:新
摘要:我们表明,在小型指令微调语言模型中,知识蒸馏对偏见具有非对称影响。在无歧义任务(BBQ-disambig)上,来自Gemma-2-9B教师模型的基于响应的蒸馏提升了上下文遵循能力:对于偏见最严重的基线模型(SmolLM2-1.7B-Instruct),它将上下文覆盖错误率从44%降至24%。在有歧义任务(BBQ-ambig)上,相同的蒸馏破坏了逐项拒答校准:基线模型原本正确弃答的15%的条目反而得到了刻板印象答案,即使总体拒答率保持不变。这一模式在第二个学生模型家族(OLMo-2-1B-Instruct)上复现,沉默损失为8%,填充沉默占新增偏见的89%。在整个28种配置的网格中,沉默损失和填充沉默的幅度不相关(Spearman $\rho=0.19$,不显著),表明这两种效应源于不同的机制。
聚合刻板印象指标(CrowS-Pairs、整体BBQ刻板印象依赖分数)对两种效应取平均,掩盖了逐项损害。我们将校准损失追溯到数据侧机制:对四个训练语料库的审计发现,以拒答作为答案形态的比例低于0.5%。带有拒答注入的监督微调(SFT)要么破坏解析,要么过度纠正进入琐碎拒答者状态(拒答率99.8%,无歧义准确率0.2%),而聚合指标会将其称为完美校准。我们提出了逐条件校准诊断(PCCD),这是一个三步协议,用于评估拒答校准、上下文遵循和能力保持。PCCD能够捕捉聚合评估所遗漏的非对称损害和琐碎拒答者失败模式。
查看缓存全文
缓存时间: 2026/08/03 07:32
# 知识蒸馏对小型语言模型偏见的非对称效应 Source: https://arxiv.org/html/2607.28639 Plawan Kumar Rath Meta plawan@meta\.com 本文工作以作者个人身份完成。本文表达的观点仅代表作者本人,并不反映 Meta 的立场。 ###### 摘要 我们证明,在小型指令微调语言模型中,知识蒸馏对偏见具有**非对称效应**。在无歧义任务(BBQ-disambig)上,基于响应的蒸馏(教师为 Gemma-2-9B)*改善*了上下文跟随:对于偏见最严重的基线模型(SmolLM2-1.7B-Instruct),它将上下文覆盖错误率从44%降至24%。在有歧义任务(BBQ-ambig)上,同样的蒸馏*破坏*了逐项拒绝校准:基线正确弃权的项目中有15%改而给出了刻板印象答案,即使总体拒绝率保持不变。这一模式在第二个学生模型家族(OLMo-2-1B-Instruct)上重现,沉默损失为8%,且“填充沉默”占新增偏见的89%。在整个28配置网格中,沉默损失与填充沉默的幅度不相关(Spearman ρ=0.19,不显著),表明这两种效应源于不同机制。聚合刻板印象指标(CrowS-Pairs、总体 BBQ 刻板印象依赖分数)将两种效应平均化,从而*掩盖*了逐项伤害。我们将校准损失追溯到一个数据侧机制:对四个训练语料库的审计发现,拒绝形态答案的比例<0.5%。使用拒绝注入的监督微调(SFT)要么破坏解析,要么过度纠正为琐碎拒绝器状态(拒绝率99.8%,disambig 准确率0.2%),而聚合指标会认为这种状态完美校准。我们提出**条件校准诊断(PCCD)**,一个三步协议,用于评估拒绝校准、上下文跟随和能力保持。PCCD 能同时捕捉到聚合评估遗漏的非对称伤害和琐碎拒绝器失败模式。 # 知识蒸馏对小型语言模型偏见的非对称效应 Plawan Kumar Rath††感谢:本文工作以作者个人身份完成。本文表达的观点仅代表作者本人,并不反映 Meta 的立场。Meta [email protected] ## 1 引言 小型指令微调语言模型(LM)越来越多地部署在资源受限的边缘设备上(Maliakkal et al., 2026),其中知识蒸馏(KD)是将较大教师压缩为可部署学生模型的主要技术。随着这些压缩模型到达最终用户,其公平性属性变得至关重要。关于 KD 与偏见的主流叙述认为*教师偏见会转移到学生偏见*:有偏见的教师会诱发有偏见的学生,解决办法是对教师进行去偏(Hooker et al., 2020; Mohammadshahi et al., 2022)。我们证明,对于小型指令微调语言模型,这种框架错误地定位了问题所在。 蒸馏是非对称的。在*已消歧*上下文(正确答案可由上下文确定)上,基于响应的蒸馏使小型学生模型*更好*:SmolLM2-1.7B-Instruct 基线在反刻板印象项目上有44%会覆盖正确上下文而选择刻板印象,而响应式 Gemma 蒸馏将其降至24%。在*有歧义*上下文(“未知”是正确答案)上,同样的蒸馏引入了新的伤害:基线正确拒绝的项目中有15%现在由蒸馏学生给出刻板印象答案。蒸馏后学生的边缘拒绝率通常*更高*(4%→57%),但拒绝发生在*错误的项目*上。基线与蒸馏后拒绝模式之间的逐项 Spearman 相关降至ρ=0.11。 这两种效应在结构上独立:在27个蒸馏配置中,沉默损失(ambig)与上下文覆盖(disambig)之间的跨条件 Spearman 相关为ρ=0.19(不显著)。一个配置在一种条件下的行为无法预测另一种条件。将两者平均的聚合指标,包括 CrowS-Pairs 整句刻板印象偏好和总体 BBQ 刻板印象率,掩盖了这种非对称伤害:同一个 1.7B 响应式 Gemma 模型在聚合上看似有益地蒸馏,却表现出显著的逐项校准损失。 我们将校准损失追溯到训练语料库。对我们流程中使用的四个训练语料库(Alpaca-cleaned 加上三组教师响应集)的审计发现,开场拒绝率为0.05%–0.33%,逐项分析显示,训练语料库中至少有一个拒绝形态邻居的项目,在蒸馏后保留拒绝的可能性高出5–21个百分点。蒸馏学生可以学习拒绝的边缘频率,但无法学习*哪些*提示词值得拒绝。 #### 贡献。 1. 我们记录了蒸馏对偏见的**非对称效应**,并在两个学生模型家族(SmolLM2 和 OLMo-2)中重现:基于响应的 KD 在已消歧项目上改善上下文跟随,同时在有歧义项目上破坏逐项拒绝校准,且这两种效应在我们的28配置网格中不相关(§4)。 2. 我们表明**聚合刻板印象指标**掩盖了这种非对称性(§5)。通过 CrowS-Pairs 和总体 BBQ SRS 检查的蒸馏配置在逐项校准上失败。 3. 我们提供了新引入的刻板印象答案的**单元分解**,分为继承/放大 vs 反/填充沉默(§6)。直接反驳教师标签的情况很少(≤12%);45–95%的新增偏见出现在教师正确弃权的项目中。 4. 我们识别出一个**数据侧机制**:对四个训练语料库的审计发现拒绝作为答案的比例<0.5%(§7),且逐项拒绝邻居计数可预测蒸馏后的拒绝保留。 5. 我们提出**条件校准诊断(PCCD)**(§8):一个三步协议,评估拒绝校准、上下文跟随和能力保持,并标记出仅聚合评估所遗漏的非对称伤害和琐碎拒绝器失败模式。 ## 2 相关工作 #### 蒸馏方法。 我们研究三个标准 KD 家族:基于响应的蒸馏(学生基于教师生成的补全进行训练)(Hinton et al., 2015);基于 logit 的蒸馏(最小化教师与学生输出分布之间的 Kullback–Leibler 散度)(Sanh et al., 2019; Gu et al., 2024);以及组合的响应+logit 目标。我们使用 SmolLM2 学生模型(Allal et al., 2025),从三个开源指令微调教师模型蒸馏:Gemma-2-9B-it(Gemma Team, 2024)、Mistral-7B-Instruct-v0.3(Jiang et al., 2023) 和 Phi-3.5-mini-Instruct(Abdin and others, 2024)。 #### KD 与偏见。 Gallegos 等人(2024)对大型语言模型(LLM)中的偏见进行了广泛综述。先前工作已将蒸馏与分类中放大的偏见联系起来(Hooker et al., 2020; Mohammadshahi et al., 2022),并观察到较小模型可能继承教师刻板印象(Ahn et al., 2022; Silva et al., 2021)。蒸馏过程中的偏见缓解方法包括反事实角色反转(Gupta et al., 2022)和显式惩罚刻板关联的约束蒸馏(Delobelle and Berendt, 2022)。更广泛的压缩已被证明会放大指令微调 LM 中的偏见:剪枝产生一种“智能剪枝悖论”,即保留困惑度的方法反而导致最高的偏见放大(Rath and Maliakkal, 2026b),而激进的量化会诱发剂量-反应式偏见出现,未知选择率下降17%,且对困惑度不可见(Rath and Maliakkal, 2026a; Marcuzzi et al., 2025)。Ramesh 等人(2023)比较了压缩技术;我们通过分析逐项拒绝校准而非聚合刻板印象率来扩展这一方向。 #### 偏见基准与方法论批评。 我们使用 BBQ(Parrish et al., 2022),它区分有歧义和已消歧上下文(从而实现我们的跨条件分解),并使用 CrowS-Pairs(Nangia et al., 2020)作为次要聚合指标。相关基准包括 StereoSet(Nadeem et al., 2021)和 WinoBias(Zhao et al., 2018)。Blodgett 等人(2021)列举了基于对的公平性基准中的方法论陷阱,Goldfarb-Tarrant 等人(2021)表明内在偏见指标不能预测下游任务公平性。这些批评促使我们从聚合刻板印象评分转向逐项拒绝校准。我们将*弃权*视为第一类结果而非解析失败,遵循校准工作(Kadavath et al., 2022)。 ## 3 实验设置 #### 模型。 三个 SmolLM2-Instruct 学生模型(135M、360M、1.7B)× 三个教师模型(Gemma-2-9B-it、Mistral-7B-Instruct-v0.3、Phi-3.5-mini-Instruct)× 三种 KD 方法(响应、logit、组合;我们分别称为响应-KD、logit-KD 和组合-KD)= 27 个 SmolLM2 蒸馏配置。我们另外使用响应-KD 将 AI2 OLMo-2-1B-Instruct(OLMo Team et al., 2025)从 Gemma-2-9B-it 蒸馏,作为第二家族泛化探针(§10)。加上三个仅 SFT 的对照(每个 SmolLM2 学生一个)和四个学生基线(三个 SmolLM2 + OLMo),完整网格共 28 个蒸馏配置。我们将 tokenizer 不匹配的 logit-KD 结果从主要分析中排除(困惑度 10^5–10^6,解析失败率高达100%;作为警示性发现报告在附录A)。 #### 训练数据。 51,760 个 Alpaca-cleaned 提示(Taori et al., 2023),源自 Self-Instruct 框架(Wang et al., 2023)。教师响应集通过在每个教师上运行相同提示集生成;指令微调遵循 Ouyang 等人(2022)的监督微调配方。我们使用低秩适应(LoRA)(Hu et al., 2022)适配器,秩为16,α=32,批大小为16,学习率1e-4,训练3个 epoch。 #### 评估。 BBQ-ambig 和 BBQ-disambig(各 12,148 个项目);每项 5 个种子;温度 0.3,max_tokens=5(多项选择题,MCQ,字母答案)。CrowS-Pairs 整句伪对数似然评分,1,508 对。总计 >1.5M 次推理。 #### 指标。 我们跟踪*刻板印象依赖分数*(SRS,有效响应中选择刻板印象答案的比例;Rath and Maliakkal, 2026b)、未知选择率(USR)和 BBQ-ambig 上的反刻板印象率;BBQ-disambig 上的*上下文覆盖率*(当上下文消歧为反刻板印象时选择刻板印象的概率)和准确率;以及 CrowS-Pairs 刻板印象偏好。我们定义两个逐项诊断:*沉默损失*,即基线拒绝的项目在蒸馏后变为刻板印象答案的比率;以及*逐项拒绝校准 ρ*,即基线与蒸馏后逐项 USR 之间的 Spearman 相关。全文报告 Wilson 置信区间、配对 χ² 检验和 Cohen's h 效应量;正文中的主要百分比在附录表中附有 95% Wilson CI。 #### 计算预算。 所有训练和推理均在配备 Apple Silicon(M 系列)的单工作站上使用 Apple 的 MLX 框架和 bfloat16 权重运行。近似墙钟预算:LoRA 微调所有蒸馏配置总计约 270 小时(每个配置约 10 小时 × 27 个配置 + 3 个 SFT 对照);推理约 210 小时(每次生成约 0.5 秒 × 150 万次生成);分析和基于嵌入的预测测试约 8 小时。总计算预算:单个加速器上约 490 墙钟小时。未使用多节点或集群计算。 #### 工件与许可。 我们使用以下数据集和模型。BBQ(Parrish et al., 2022)以 CC-BY 4.0 发布;我们使用通过 HuggingFace(Elfsong/BBQ)分发的版本。CrowS-Pairs(Nangia et al., 2020)以 CC-SA 4.0 发布。Alpaca-cleaned(Taori et al., 2023)以 CC-BY-NC 4.0(仅研究用途)发布;我们严格依照该许可用于非商业研究。教师模型(Gemma-2-9B-it(Gemma Team, 2024)、Mistral-7B-Instruct-v0.3(Jiang et al., 2023)和 Phi-3.5-mini-Instruct(Abdin and others, 2024))按其各自的社区许可条款(Gemma Terms of Use、Apache-2.0 和 MIT)使用。SmolLM2(Allal et al., 2025)、OLMo-2、OpenELM 和 Granite-3.1按 Apache-2.0 使用。我们不发布新数据集;衍生模型检查点将以 Apache-2.0 发布,并在适用处继承原始许可条款。代码和评估流程以 Apache-2.0 发布在https://github.com/plawanrath/knowledge-distilation-impact-analysis。蒸馏模型检查点将通过 HuggingFace 发布。 ## 4 蒸馏是非对称的 参见图注 图 1:蒸馏对两个 BBQ 条件产生相反效果。对于 SmolLM2-1.7B-Instruct,响应式 Gemma 蒸馏在已消歧项目上将上下文覆盖从44%降至24%(a,越低越好),同时在有歧义项目上引入15%的沉默损失(b,基线率按定义为0%)。主要发现总结为。
相似文章
确定性的幻觉:解耦策略蒸馏中的能力与校准
本文发现语言模型中的策略蒸馏(OPD)因训练与部署信息不匹配导致严重过度自信,提出校准感知框架 CaOPD,在提升性能的同时显著增强置信度可靠性。
通过交互作用统一解释大型语言模型知识蒸馏的方法
本文提出了一种基于博弈论交互的统一方法,用于解释大型语言模型中的知识蒸馏,发现蒸馏会稀疏化交互,并引入了一种损失函数CIP来提升性能。
@VukRosic99: 当小模型从大模型学习时,一半的教训被浪费了 设置:一个小的“学生”模型写出答案…
该论文识别了语言模型在策略蒸馏中的位置偏差,即学生模型生成的答案中后面的token接收到的监督质量下降。所提出的重要性加权在策略蒸馏(IW-OPD)根据累积漂移对修正进行加权,提高了学习速度和最终性能。
多教师同策略蒸馏中的行为杠杆失衡
本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。
揭秘同策略蒸馏:其益处、危害及原因
本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。