在正确性门控多教师蒸馏中的决策偏移、标签功能丧失和不确定的依据审计
摘要
论文研究了正确性门控多教师蒸馏,发现决策偏移、标签功能丧失和不确定的依据审计,与硬过滤相比没有增量优势。
arXiv:2609.09702v1 公告类型:新
摘要:候选决策正确性和依据基础是不同的目标。我们在固定实验中研究了正确性门控多教师蒸馏。八个分支共享4,330个源、一个63.9M参数的学生模型、12,990个优化行、406次更新、证据输入和一个解码器;七个基于教师的分支使用一个固定的三响应池。三个种子在267个保留样本上进行评估。与无过滤蒸馏相比,正确性加权分支的准确率差异为+0.1660(95%观测矩阵区间[0.0670, 0.2455]),五标签宏观F1为+0.1323([0.0916, 0.1731]),任务定义的条件不安全动作率为-0.4979([-0.5926, -0.3686])。这些偏移并不意味着行为普遍更好。源标签SFT具有最高的平均宏观F1(0.586)。加权分支在每个种子上的Refuted召回率为零,两个种子将所有167个声明样本标记为NotEnoughInfo。在一个参考种子的可用性修正审计中,加权和无过滤输出的证据支持正例为0/20对1/20,包含不支持材料的正例为20/20对19/20。样本非配对,源重叠未序列化,修正遵循自动摘要但先于注释。因此,审计无法估计共源依据效应,对系统级改进或损害不确定。硬过滤已实现0.660准确率、0.530宏观F1和0.135条件不安全率。实施的加权分支未显示出比硬过滤有增量决策优势。这一固定矩阵失败分析显示决策重分配与标签功能丧失;可用的人类审计未确立依据增益。
查看缓存全文
缓存时间: 2026/09/11 08:39
# 正确性门控的多教师蒸馏中的决策偏移、标签功能缺失及论证审计的不确定性
来源:https://arxiv.org/html/2609.09702
## 决策偏移、标签功能缺失及正确性门控多教师蒸馏中论证审计的不确定性
致谢:AI使用披露:OpenAI Codex于2026年8月30日和9月9日被用于辅助稿件重构、一致性检查、语言编辑和格式转换。该工具未被列为作者。作者仍负责核实科学主张、引用、数值结果及最终提交文本。
###### 摘要
候选决策的正确性与推理依据的论证性是不同的目标。我们考察了正确性门控如何改变选择性决策,以及在固定多教师蒸馏实验中现有证据是否支持论证性主张。所有八个实验分支共享4,330个源数据、63.9M参数的学生模型、12,990个优化行、406次更新、证据输入和解码器;七个基于教师的分支从一个固定的三响应池中抽取。在267个留出样本上评估了三种随机种子。相对于未过滤的多教师蒸馏,正确性门控加权分支在三个固定操作点决策摘要上表现出差异:准确率+0.1660(95%观测矩阵区间[0.0670,0.2455])、五标签宏F1+0.1323([0.0916,0.1731]),以及任务定义的条件不安全行动率-0.4979([-0.5926,-0.3686])。这些偏移反映的是不同的决策策略,而非普遍更好的任务表现。源标签监督微调具有最高的平均五标签宏F1(0.586)。加权分支在每个种子上的驳回类召回率均为零,并且有两个种子将“信息不足”分配给全部167个主张样本。在一个参考种子上的可用性修正审计中,加权和未过滤输出的证据支持阳性分别为0/20与1/20,包含无依据材料的阳性分别为20/20与19/20。样本非配对、源重叠未序列化,且修正发生在自动摘要之后、标注之前;因此该审计无法估计共源论证效应,对系统级改进或损害的结论不确定。硬过滤分支已实现0.660准确率、0.530宏F1和0.135条件不安全率。所实现的加权分支未展现出相对于硬过滤的增量决策优势。这项固定矩阵失败分析显示了决策重分布与标签功能缺失,而现有人类审计未证实论证增益。
关键词:知识蒸馏;推理依据蒸馏;多教师学习;证据论证;弃权;选择性预测;阴性结果。
## 1 引言
知识蒸馏将较大教师模型的行为压缩到较小学生模型中(Hinton et al., 2015)。推理依据蒸馏增加了自然语言中间监督(Shridhar et al., 2023;Wang et al., 2023;Lee et al., 2024),这种监督可以提高紧凑模型的数据效率(Hsieh et al., 2023)。多教师变体为学生提供来自多个预训练语言模型教师的候选推理轨迹或监督(Tian et al., 2025;Wu et al., 2021)。当延迟、隐私或硬件限制阻碍在推理时使用大模型时,这种额外监督很有吸引力。然而,其实用性取决于学生被要求模仿的内容。
基于证据的决策揭示了一个普通答案准确率可能隐藏的区别。主张应标记为“支持”或“驳回”仅在提供的证据支持该极性时成立。否则,适当的决策应是“信息不足”。推荐查询应仅在提供的证据充分时得到回答。否则,适当的决策是“弃权”。相同的输出可能包含正确决策和无依据的推理。反之,系统可能通过为几乎每个样本分配保守标签来减少假阳性决策。这两种行为本身都不构成论证性推理。
质量感知蒸馏方法选择教师、拒绝候选或调整监督权重(Yuan et al., 2021;Ding et al., 2024;Li et al., 2025)。推理依据专用方法评估质量、不确定性或学生需求(Wang et al., 2025;Zhang et al., 2024a;Yan et al., 2025;Song et al., 2025)。验证器可以对解决方案排序并支持修正(Hosseini et al., 2024;Kawabata and Sugawara, 2024;Zhang et al., 2024b;Dixit et al., 2026)。这些结果表明教师输出无需获得同等信任。但它们并未暗示为候选决策正确性训练的门控会改善学生生成语言的证据支持性。
我们在一项受控实验中研究这一差距。对于每个训练源,三个固定教师响应构成一个候选家族。复合门控估计候选的决策是否匹配人类训练标签。主要干预是移除低于阈值的候选,并按估计分数对保留的候选进行加权。七个比较分支分别对应直接源标签训练、最终答案迁移、单教师推理依据迁移、未过滤多教师迁移、硬过滤、替代乘积权重以及角色感知门控。所有分支使用相同的学生架构、证据输入、行数、更新次数和解码器。
主要比较是正确性加权多教师蒸馏(MTD)减去均匀未过滤MTD。我们提出两个问题。第一,各分支在固定决策终点(准确率、五标签宏F1和狭义定义的条件不安全行动率)上是否有差异?第二,向更高总体分数的偏移是否与每个标签的功能性召回以及证据支持的阳性输出共存?论证性解释需要两者。自动支持诊断不能替代人类判断,较低的条件不安全率不能补偿“支持”或“驳回”样本的零或接近零的正确恢复。
本研究做出三项贡献。首先,报告了一项受控的固定矩阵失败分析,其中总体决策终点发生偏移,同时标签功能缺失,且现有论证审计仍不确定。其次,保留集和决策匹配的硬分支已呈现总体模式,而实现的加权分支未展现增量决策优势;目标文本差异排除了仅标量或中介主张。第三,评估结合了最高宏F1源标签控制、每个观测种子的每标签召回率、狭义不安全行动核算以及系统标签掩蔽的可用性修正审计。这些检查揭示了仅凭总体准确率可能掩盖的行为。
结论刻意保持局限。我们不主张正确性加权蒸馏是普遍优越的方法,也不得出验证器引导选择在其他场景无效的结论。证据涉及一个学生、一个保留的教师池、一个英语餐厅证据域、一个留出集和一个决策策略。
## 2 相关工作
### 2.1 推理依据与多教师蒸馏
推理依据蒸馏除了任务标签外,还用中间解释监督紧凑模型(Hsieh et al., 2023;Shridhar et al., 2023;Wang et al., 2023;Lee et al., 2024)。推荐专用工作同样将包含推理依据的输出迁移到小模型(Wang et al., 2024)。多教师方法让学生接触候选推理轨迹或多个预训练语言模型教师(Tian et al., 2025;Wu et al., 2021),但教师数量或容量并不单调提升学生性能(Ding et al., 2024)。这一区分很重要:Wu et al. (2021) 支持从多个预训练教师蒸馏,而非单调教师集成主张则由Ding et al. (2024) 支持。
多教师方法在不同节点进行干预。强化选择学习实例相关的教师策略(Yuan et al., 2021)。委员会方法使用同行评审和阈值拒绝候选(Li et al., 2025)。其他工作修改推理依据对比、选择或权重(Wang et al., 2025;Zhang et al., 2024a;Yan et al., 2025;Song et al., 2025)。选择性知识蒸馏也过滤序列级目标(Liu et al., 2023)。这些方法激励了质量感知监督,但候选移除和连续加权是不等价操作。我们的硬分支和加权分支保留相同的候选ID,提供了保留集和决策匹配的比较;由于部分软目标和序列化对话存在差异,对比并未隔离连续质量分配。
### 2.2 验证器与目标对齐
验证器可以对候选解决方案排序并支持修正(Hosseini et al., 2024;Zhang et al., 2024b)。验证后的修复轨迹也可监督紧凑模型(Dixit et al., 2026)。推理依据感知的验证表明答案正确性与推理有效性可能分离(Kawabata and Sugawara, 2024),而自然语言批评者可通过识别推理错误来改进验证器(Gao et al., 2025)。我们门控使用的目标更狭隘:当结构有效的候选的决策等于裁定的训练标签时,该候选获得积极目标。验证器兼容性只是同意度、置信度、结构有效性、任务、决策和模型身份等特征族中的一项。因此该干预是复合候选正确性门控,而非验证器特征的纯粹因果检验,也不是直接的论证监督器。
这种目标区分产生了目标对齐问题。候选可能正确预测“支持”,同时添加未引用或过度概括的材料主张。查询可能选择“回答”正确,但其推理依据误述证据。优化候选决策正确性可能改进决策目标,但不一定改善伴随的语言模型目标。本研究在下游检验这种可能性,而非假设门控分数将其预期语义转移给学生。
最相关的工作跨越互补轴线而非相同证据比较。多教师和推理依据迁移研究激励候选轨迹和多个教师(Tian et al., 2025;Wu et al., 2021);选择和委员会方法激励拒绝或重新加权候选(Yuan et al., 2021;Li et al., 2025);推理依据感知验证分离答案正确性与推理有效性(Kawabata and Sugawara, 2024)。我们的增量贡献更窄:在一个冻结矩阵内,我们结合了决策正确性目标、保留候选集匹配的硬分支与加权分支对比、每标签操作点检查以及系统标签掩蔽的人类审计。我们声称这种组合是一项受控失败分析,而非对那些方法的优先声明或新的通用算法。
### 2.3 证据充分性与选择性预测
证据不充分性应与事实极性区分开来(Atanasova et al., 2022)。选择性问答和弃权研究同样评估模型何时应拒绝回答(Xin et al., 2021;Feng et al., 2024;Madhusudhan et al., 2025;Kamath et al., 2020)。选择性分类形式化错误-覆盖权衡和非对称拒绝(Geifman and El-Yaniv, 2017;Gangrade et al., 2021)。上下文自适应弃权策略进一步强调报告的风险值属于特定操作规则(Tayebati et al., 2025)。
概率拟合与操作选择性也是分离的。事后温度缩放可减少置信度校准误差(Guo et al., 2017);它本身不选择适合任务的操作点,也不保证固定阈值下的标签覆盖。因此我们报告五标签宏F1和每标签召回率,以及任务定义的条件不安全行动率。人类证据审查仅限于输出的阳性,因为那里涉及答案支持、推理依据忠实性、无依据材料和引用有效性。这种联合视角防止保守决策策略被误认为论证性能力。
## 3 任务、数据与教师材料
### 3.1 基于证据的任务与标签
每个样本包含任务类型、主张或推荐查询、固定的时间索引证据片段集合和泄漏组标识符。主张验证有三个互斥的合法标签:
$\mathcal{Y}_{c}=\{\mathrm{Supported},\mathrm{Refuted},\mathrm{NotEnoughInfo}\}$
推荐决策有两个:
$\mathcal{Y}_{q}=\{\mathrm{Answer},\mathrm{Abstain}\}$
阳性输出包括决策、自然语言答案或判断、推理依据和引用证据。相似文章
多教师同策略蒸馏中的行为杠杆失衡
本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。
多教师策略蒸馏中工具调用边界漂移的诊断与校准
本文诊断并提出SoftClamp校准方法,可减少智能语言模型在多教师策略蒸馏中的工具调用边界漂移,在保持准确率的同时降低过度调用。
在蒸馏前验证:用于在线策略蒸馏的提示级教师门控
本文介绍了教师门控在线策略蒸馏(TGOPD),一种在提示级别验证教师可靠性的方法,以改善在线策略蒸馏,从而在异步设置中实现更好的性能和更高的GPU利用率。
信任正确的教师:面向GUI定位的质量感知自蒸馏
提出面向GUI定位的质量感知自蒸馏方法,通过正确性感知门控和概率缩放改进坐标-标记教师信号,以提升视觉语言模型性能。
当教师误导:虚假信号感知的在线策略蒸馏
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。