基于理据引导的知识蒸馏跨语言立场检测

arXiv cs.CL 论文

摘要

本文提出了一种基于理据引导的知识蒸馏框架,用于跨语言立场检测,利用大型语言模型的思维链提示,通过双路径蒸馏和对比学习训练一个紧凑的学生模型。

arXiv:2607.18693v1 公告类型:新 摘要:立场检测旨在识别文本是否对给定目标表达支持或反对态度,是多种下游应用的重要任务。尽管现有研究在单语设置(尤其是英语)中取得了强劲表现,但许多低资源语言(如加泰罗尼亚语)仍缺乏足够的标注数据来训练有效模型。跨语言立场检测通过将立场知识从资源丰富的语言迁移到低资源语言来缓解这一问题。然而,大多数现有方法主要依赖文本与目标之间的语义对齐,而忽略了可靠立场推理所需的推理过程。尽管大型语言模型提供了强大的推理能力,但其高计算成本和推理延迟限制了实际部署。为解决这些限制,我们提出了一种基于理据引导的知识蒸馏框架用于跨语言立场检测。具体地,我们使用思维链提示来引导大型语言模型生成信息丰富的理据,并将由此产生的推理知识蒸馏到一个紧凑的学生模型中。我们进一步设计了双路径蒸馏机制,以对齐带有理据增强和无理据的表示及其预测分布。此外,引入了两种对比学习策略以提高立场判别能力。在多语言基准上的实验表明,我们的方法始终优于有竞争力的基线模型。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:24

# 基于推理指导的知识蒸馏用于跨语言立场检测 来源:https://arxiv.org/html/2607.18693 周秋丽, 姚婧媛 2024212237@mail\.hfut\.edu\.cn (https://arxiv.org/html/2607.18693v1/mailto:[email protected]) 合肥工业大学 计算机科学与信息工程学院 合肥230601 中国, 唐胜根 tangsg@hfut\.edu\.cn (https://arxiv.org/html/2607.18693v1/mailto:[email protected]) 合肥工业大学 计算机科学与信息工程学院 合肥230601 中国, 陈宏志 chenhz313@126\.com (https://arxiv.org/html/2607.18693v1/mailto:[email protected]) 合肥工业大学 人工智能学院 合肥238076 中国, 唐军 958748910@qq\.com (https://arxiv.org/html/2607.18693v1/mailto:[email protected]) 合肥工业大学 外国语学院 合肥230601 中国, 洪日昌 hongrc@hfut\.edu\.cn (https://arxiv.org/html/2607.18693v1/mailto:[email protected]) 合肥工业大学 计算机科学与信息工程学院 合肥230601 中国 \(2026\)

###### 摘要. 立场检测旨在识别文本对给定目标是否表达支持或反对态度,是多种下游应用的重要任务。尽管现有研究在单语言环境(尤其是英语)中取得了强劲性能,但许多低资源语言(如加泰罗尼亚语)仍缺乏足够的标注数据来训练有效模型。跨语言立场检测通过将立场知识从资源丰富语言迁移到低资源语言来缓解这一问题。然而,现有方法主要依赖于文本与目标之间的语义对齐,而忽略了可靠立场推理所需的推理过程。虽然大型语言模型提供了强大的推理能力,但其高计算成本和推理延迟限制了实际部署。为解决这些局限,我们提出了一种基于推理指导的知识蒸馏框架,用于跨语言立场检测。具体地,我们使用思维链提示引导大型语言模型生成信息丰富的推理依据,并将得到的推理知识蒸馏到一个紧凑的学生模型中。我们进一步设计了一种双路径蒸馏机制,以对齐推理增强表示和无推理表示及其预测分布。此外,引入两种对比学习策略以提高立场区分能力。在多语言基准上的实验表明,我们的方法持续优于有竞争力的基线方法。

跨语言, 立场检测, 大型语言模型

安徽省哲学社会科学规划项目研究成果(编号:AHSKQ2024D044)。††copyright:none††journalyear:2026††journal:TALLIP††ccs:Computing methodologies 自然语言处理††ccs:Information systems 多语言和跨语言检索††ccs:Computing methodologies 机器学习

## 1. 引言

随着社交媒体平台的快速发展,立场检测在自然语言处理中受到越来越多的关注。该任务旨在从给定文本中识别用户对特定目标(如话题或主张)的态度,例如支持、中立或反对(AlDayel and Magdy,2021 (https://arxiv.org/html/2607.18693#bib.bib5))。它支持多种下游应用。例如,在推荐系统中,立场检测有助于分析用户偏好并管理内容多样性。通过识别用户是否支持或反对特定内容,推荐模型可以更好地平衡观点多样性,降低强化选择性接触的风险(Alamet al.,2022 (https://arxiv.org/html/2607.18693#bib.bib1); Ianaet al.,2024 (https://arxiv.org/html/2607.18693#bib.bib2))。

大多数现有研究聚焦于单语言环境,尤其是英语(Hardalovet al.,2021 (https://arxiv.org/html/2607.18693#bib.bib3); Küçük and Can,2020 (https://arxiv.org/html/2607.18693#bib.bib4); Allaway and McKeown,2020 (https://arxiv.org/html/2607.18693#bib.bib43))。相比之下,许多其他语言的标注数据有限,且覆盖的话题范围狭窄,这限制了立场检测模型的性能和迁移能力(Hardalovet al.,2022 (https://arxiv.org/html/2607.18693#bib.bib6))。为解决这种数据不平衡问题,跨语言立场检测将立场知识从资源丰富语言迁移到低资源语言(Zhanget al.,2023b (https://arxiv.org/html/2607.18693#bib.bib9),a (https://arxiv.org/html/2607.18693#bib.bib7),2024 (https://arxiv.org/html/2607.18693#bib.bib8))。例如,(Zhanget al.,2023b (https://arxiv.org/html/2607.18693#bib.bib9))提出了跨语言跨目标蒸馏框架CCSD,它从目标表示中挖掘类别信息以减少目标不一致性,并构建跨语言立场模板用于知识迁移。此外,(Zhanget al.,2024 (https://arxiv.org/html/2607.18693#bib.bib8))引入了来自资源丰富语言的外部背景知识和推理知识。然而,这种策略依赖于外部资源,难以泛化到未见目标,因为为多样化话题构建全面知识库仍然具有挑战性。

参见图注
图1. 英语中用于立场检测的思维链(CoT)推理示例。
用于立场检测的示例提示和思维链推理依据。

大型语言模型的最新进展展示了强大的推理能力,为跨语言知识迁移和立场推理提供了新方向(Weiet al.,2022b (https://arxiv.org/html/2607.18693#bib.bib11); Magisteret al.,2023 (https://arxiv.org/html/2607.18693#bib.bib10); Weiet al.,2022a (https://arxiv.org/html/2607.18693#bib.bib14); Zhouet al.,2025 (https://arxiv.org/html/2607.18693#bib.bib58))。与以往主要通过模型架构设计提升性能的神经方法不同(Zhanget al.,2023a (https://arxiv.org/html/2607.18693#bib.bib7)),人类立场判断通常需要识别表面文本背后的隐含情感、态度和推理线索。受此观察启发,我们使用大型语言模型提取立场相关证据,并生成解释作者对目标态度的推理依据。先前研究表明,这种推理能力可以通过思维链提示来激发,该提示引导语言模型将复杂任务分解为中间推理步骤(Weiet al.,2022b (https://arxiv.org/html/2607.18693#bib.bib11); Magisteret al.,2023 (https://arxiv.org/html/2607.18693#bib.bib10); Hsiehet al.,2023 (https://arxiv.org/html/2607.18693#bib.bib13); Liet al.,2023 (https://arxiv.org/html/2607.18693#bib.bib12))。在本工作中,我们将思维链提示与上下文学习(Donget al.,2024 (https://arxiv.org/html/2607.18693#bib.bib15); Minet al.,2022 (https://arxiv.org/html/2607.18693#bib.bib16))相结合,为立场检测生成连贯的推理依据,如图1 (https://arxiv.org/html/2607.18693#S1.F1)所示。具体地,我们提供了8个涵盖不同主题(如健康和政治政策)的示例,以鼓励模型生成一致且可迁移的推理模式。

虽然大型语言模型在推理方面有效,但由于高计算成本和推理延迟,直接将其部署用于立场检测往往不切实际。其庞大的模型大小使其难以满足实际应用中的实时响应要求(Xiaet al.,2025 (https://arxiv.org/html/2607.18693#bib.bib19))。为提高效率,我们采用知识蒸馏(Hintonet al.,2015 (https://arxiv.org/html/2607.18693#bib.bib18); Gouet al.,2021 (https://arxiv.org/html/2607.18693#bib.bib17))将大型语言模型的推理能力迁移到紧凑模型中。由于BERT系列(Devlinet al.,2019 (https://arxiv.org/html/2607.18693#bib.bib20); Pireset al.,2019 (https://arxiv.org/html/2607.18693#bib.bib21))在多项下游任务上取得了强劲性能,且其编码器架构适用于完形填空式的立场预测,我们使用多语言BERT(mBERT)作为学生模型。具体地,我们使用LLM生成的推理依据对mBERT进行微调,使学生模型能够学习到面向推理的立场检测表示。然而,直接将知识从大型语言模型蒸馏到mBERT并非易事。大型语言模型通常基于仅解码器或编码器-解码器架构,而mBERT采用仅编码器结构。这种架构差距使得直接输出对齐变得困难(Hofstätteret al.,2020 (https://arxiv.org/html/2607.18693#bib.bib22))。为解决此问题,我们设计了一个双分支层次蒸馏框架,包含一个推理增强路径和一个标准路径。推理增强路径将目标、文本和LLM生成的推理依据作为输入,而标准路径仅将目标和文本作为输入。通过对齐两条路径之间的隐藏表示和预测分布,学生模型可以在训练期间学习推理知识,同时在测试时保持高效的无需推理的推理。

参见图注
图2. 仅解码器大型语言模型与仅编码器mBERT之间在知识蒸馏中的表示和结构差距。
显示仅解码器语言模型与仅编码器mBERT之间表示和架构差距的示意图。

为了进一步提高对立立场之间的区分能力,我们在源语言训练阶段和师生蒸馏阶段引入了两种对比学习策略(Gaoet al.,2021 (https://arxiv.org/html/2607.18693#bib.bib23); Chenet al.,2020 (https://arxiv.org/html/2607.18693#bib.bib25); Hanet al.,2023 (https://arxiv.org/html/2607.18693#bib.bib55); Tianet al.,2019 (https://arxiv.org/html/2607.18693#bib.bib24))。在源语言阶段(有充足的标注数据),我们从支持样本中构建类原型,并根据查询表示与立场原型的距离优化查询表示。在目标语言阶段(训练数据有限),我们避免构建不稳定的原型,而是设计了一种双约束对比对齐目标,将同一样本的两条路径表示拉近,将不同样本的表示推开。这种设计有助于学生模型在低资源条件下捕获立场判别特征。

我们在涵盖多种主题的多语言数据集上进行了大量实验。结果表明,我们的方法持续优于有竞争力的基线方法,证明了基于推理指导的知识蒸馏在跨语言立场检测中的有效性。我们的主要贡献如下:

- •**基于推理指导的跨语言推理框架**。我们提出了一个框架,通过思维链提示利用大型语言模型的推理能力。通过基于指令的推理生成,该方法为低资源跨语言立场检测提供了显式的推理监督。
- •**用于架构兼容性的双分支层次蒸馏**。为了弥合基于解码器的大型语言模型与基于编码器的mBERT之间的结构差距,我们设计了一种双分支蒸馏机制。该框架使学生模型在训练期间能够从增强推理的输入中学习,同时通过表示级和响应级对齐支持高效的无需推理的推理。
- •**带有对比约束的增强立场所迁移**。我们为源语言和目标语言阶段引入了不同的对比学习目标。这些约束补充了标签监督,提高了模型区分对立立场的能力。

## 2. 相关工作

本节回顾与我们的工作密切相关的三个研究方向:立场检测、知识蒸馏和LLM推理。这三个领域分别对应我们框架中的任务背景、迁移机制和推理知识来源。首先,立场检测提供了基础任务设定,其主要研究重点已逐渐从有监督的单语言分类转向数据稀缺下的跨目标和跨语言场景。这一研究方向激发了对低资源语言中有效知识迁移的需求。其次,知识蒸馏为将有用知识从大型或专门的教师模型迁移到紧凑的学生模型提供了实用解决方案,这对于提高效率、降低立场检测系统的部署成本至关重要。第三,关于LLM推理的最新研究表明,大型语言模型可以通过上下文学习和思维链提示生成中间推理依据,提供比传统基于标签的学习更丰富的逻辑监督。综合起来,这些研究启发了我们的基于推理指导的知识蒸馏框架:LLM推理提供显式的立场推理依据,知识蒸馏将这种推理知识迁移到高效的基于mBERT的学生模型中,跨语言立场检测作为目标应用。

### 2.1. 立场检测

立场检测最初聚焦于单语言设定(Sobhaniet al.,2017 (https://arxiv.org/html/2607.18693#bib.bib27); Mohammadet al.,2016 (https://arxiv.org/html/2607.18693#bib.bib28); Glandtet al.,2021 (https://arxiv.org/html/2607.18693#bib.bib29); Confortiet al.,2020 (https://arxiv.org/html/2607.18693#bib.bib30)),早期研究主要建立在高度受限的有监督学习环境中。在这些配置中,模型通常在预定义且固定的目标集上进行训练和测试(Mohammadet al.,2016 (https://arxiv.org/html/2607.18693#bib.bib28); Duet al.,2017 (https://arxiv.org/html/2607.18693#bib.bib31); Zhouet al.,2017 (https://arxiv.org/html/2607.18693#bib.bib32))。在有监督学习阶段,立场目标通常限于表示特定实体的名词短语。这以基础数据集如SemEval-2016(Mohammadet al.,2016 (https://arxiv.org/html/2607.18693#bib.bib28))(专注于预定义实体)和WT-WT(Confortiet al.,2020 (https://arxiv.org/html/2607.18693#bib.bib30))(专注于金融合并)为代表。这些早期数据集的一个关键局限性是它们严重依赖特定目标,导致模型在遇到未见话题时性能显著下降。这一瓶颈最终促使研究界转向更灵活的跨目标配置,以增强模型泛化能力(Fuet al.,2024 (https://arxiv.org/html/2607.18693#bib.bib57); Weiet al.,2024 (https://arxiv.org/html/2607.18693#bib.bib64); Chenet al.,2021 (https://arxiv.org/html/2607.18693#bib.bib74); Jinet al.,2024 (https://arxiv.org/html/2607.18693#bib.bib75); Tianet al.,2023 (https://arxiv.org/html/2607.18693#bib.bib56); Yeet al.,2025a (https://arxiv.org/html/2607.18693#bib.bib76),b (https://arxiv.org/html/2607.18693#bib.bib79))。跨目标立场检测旨在利用从源目标获得的知识来识别针对另一个不同但相关的目标的态度(Sunet al.,2022 (https://arxiv.org/html/2607.18693#bib.bib33); Zhanget al.,2021 (https://arxiv.org/html/2607.18693#bib.bib34); Liet al.,2021 (https://arxiv.org/html/2607.18693#bib.bib35); Weiet al.,2024 (https://arxiv.org/html/2607.18693#bib.bib64); Yeet al.,2025a (https://arxiv.org/html/2607.18693#bib.bib76))。尽管跨目标方法取得了进展,但它们主要处理同一语言内的目标迁移。

随着社交媒体数据在全球范围内的增长,研究焦点已显著转向跨语言设定。跨语言立场检测旨在将立场知识从资源丰富的源语言(通常是英语)迁移到资源匮乏的目标语言(Zhanget al.,2023b (https://arxiv.org/html/2607.18693#bib.bib9),a (https://arxiv.org/html/2607.18693#bib.bib7),2024 (https://arxiv.org/html/2607.18693#bib.bib8); Guoet al.,2024 (https://arxiv.org/html/2607.18693#bib.bib36); Sazid and Chaa,2024 (https://arxiv.org/html/2607.18693#bib.bib77); Zhanget al.,2025b (https://arxiv.org/html/2607.18693#bib.bib78))。由于不同语言的标注成本差异巨大,低资源语言的数据稀缺问题更加突出(Wanget al.,2022 (https://arxiv.org/html/2607.18693#bib.bib37); Liimet al.,2024 (https://arxiv.org/html/2607.18693#bib.bib38))。例如,X-Stance数据集(Zotov and Dray,2020 (https://arxiv.org/html/2607.18693#bib.bib39))包含德语、法语、意大利语、英语等多种语言的政治声明,但各语言的样本量不均衡。此外,Zero-shot跨语言立场检测(Lianget al.,2021 (https://arxiv.org/html/2607.18693#bib.bib40))进一步挑战模型在源语言上训练并在目标语言上直接测试,而无需任何目标语言标注数据。为应对这些挑战,已有工作探索使用多语言预训练语言模型,如XLM-R(Conneau et al.,2020 (https://arxiv.org/html/2607.18693#bib.bib41))和mBERT(Devlinet al.,2019 (https://arxiv.org/html/2607.18693#bib.bib20)),通过共享嵌入空间进行跨语言迁移。然而,现有方法主要侧重于语义对齐,而忽略了立场推理背后的因果逻辑。与这些语义对齐方法不同,我们的工作将大型语言模型的逻辑推理作为辅助监督信号,以增强底层模型在跨语言场景中的立场理解。

其余部分... (由于内容过长,继续翻译剩余部分)

### 2.2. 知识蒸馏

知识蒸馏旨在通过让学生模型模仿教师模型的软输出或中间表示,将知识从复杂的教师模型转移到更简单的学生模型(Hintonet al.,2015 (https://arxiv.org/html/2607.18693#bib.bib18); Gouet al.,2021 (https://arxiv.org/html/2607.18693#bib.bib17))。研究表明,通过知识蒸馏学习的紧凑模型可以保留大部分教师性能,同时具有更低的计算成本和更快的推理速度。在自然语言处理领域,知识蒸馏已成功应用于多种任务,包括机器翻译(Kim and Rush,2016 (https://arxiv.org/html/2607.18693#bib.bib42))、文本分类(Tanget al.,2019 (https://arxiv.org/html/2607.18693#bib.bib44))和情感分析(Zhaoet al.,2022 (https://arxiv.org/html/2607.18693#bib.bib45))。最近,由于大型语言模型的最新进展,将大型语言模型的生成能力蒸馏到较小模型的研究越来越受到关注(Magisteret al.,2023 (https://arxiv.org/html/2607.18693#bib.bib10); Westerowet al.,2023 (https://arxiv.org/html/2607.18693#bib.bib46); Kimmel and Smith,2024 (https://arxiv.org/html/2607.18693#bib.bib47); Furoyet al.,2025 (https://arxiv.org/html/2607.18693#bib.bib48))。例如,(Magisteret al.,2023 (https://arxiv.org/html/2607.18693#bib.bib10))演示了将思维链推理能力从大型语言模型蒸馏到小型模型的方法,通过从小模型生成推理路径并过滤出正确路径。然而,这些方法大多在单语言领域操作,并且通常需要目标数据的额外标注。我们的工作专注于跨语言场景,并提出结构感知的蒸馏机制以弥合编码器-解码器架构差距。

### 2.3. LLM推理

大型语言模型在展现推理能力方面取得了显著成功(Weiet al.,2022b (https://arxiv.org/html/2607.18693#bib.bib11); Kojimaet al.,2022 (https://arxiv.org/html/2607.18693#bib.bib49); Suzgunet al.,2023 (https://arxiv.org/html/2607.18693#bib.bib50); Wanget al.,2023 (https://arxiv.org/html/2607.18693#bib.bib51))。思维链提示通过引导模型生成中间推理步骤,是目前最有效的推理激发方法之一(Weiet al.,2022b (https://arxiv.org/html/2607.18693#bib.bib11); Kojimaet al.,2022 (https://arxiv.org/html/2607.18693#bib.bib49); Suzgunet al.,2023 (https://arxiv.org/html/2607.18693#bib.bib50))。此外,上下文学习(Donget al.,2024 (https://arxiv.org/html/2607.18693#bib.bib15); Minet al.,2022 (https://arxiv.org/html/2607.18693#bib.bib16))使大型语言模型能够从少量示例中学习而不进行参数更新,为任务适应提供灵活的机制。在情感和立场分析中,推理提示已被用于基于文本线索解释态度(Zhanget al.,2023c (https://arxiv.org/html/2607.18693#bib.bib52); Liet al.,2023 (https://arxiv.org/html/2607.18693#bib.bib53))。例如,(Zhanget al.,2023c (https://arxiv.org/html/2607.18693#bib.bib52))提出了一种链式情感推理框架,通过分解情感线索进行解释。我们的工作扩展了这种推理思路,通过结合上下文学习和思维链提示生成立场推理依据,以支持跨语言知识迁移。

## 3. 方法

### 3.1. 问题定义

令 \( S = \{(x_i, t_i, y_i)\}_{i=1}^{N_s} \) 表示源语言(资源丰富语言,例如英语)的标注数据集,其中 \( x_i \) 是输入文本,\( t_i \) 是立场目标,\( y_i \in \{赞成, 反对, 中立\} \) 是标签。令 \( T = \{(x_j, t_j)\}_{j=1}^{N_t} \) 表示目标语言(低资源语言,例如加泰罗尼亚语)的无标注数据集。跨语言立场检测的目标是学习一个模型 \( f \),该模型可以在给定目标语言文本 \( x_j \) 和目标 \( t_j \) 的情况下预测立场标签 \( y_j \)。

我们提出如图3所示的推理引导蒸馏框架。该框架包含三个主要阶段:(1)通过思维链提示与上下文学习,从大型语言模型生成推理依据;(2)在源语言上,用推理增强路径和标准路径对mBERT学生模型进行多任务训练;(3)通过双路径蒸馏和对比学习,将知识迁移到目标语言。

### 3.2. 使用思维链与上下文学习的推理生成

为了获得立场推理知识,我们使用大型语言模型通过思维链提示生成推理依据。给定文本 \( x \)、目标 \( t \) 和真实标签 \( y \),我们提示大型语言模型生成自然语言解释 \( r \),阐明文本如何表达对目标的态度。具体地,我们提供8个上下文示例,涵盖来自X-Stance数据集(Zotov and Dray,2020 (https://arxiv.org/html/2607.18693#bib.bib39))的不同政治话题(如健康、教育和外交政策)。每个示例包含文本、目标和预定义推理路径,鼓励大型语言模型遵循一致的结构化推理模式。推理依据由两个部分组成:(1)证据提取:识别文本中与目标立场相关的关键短语或句子;(2)逻辑推导:解释提取出的证据如何导致特定立场。例如,对于反对医疗私有化的文本,推理依据可以识别出“公共医疗应该保持普遍可及”等关键词,并推断作者因关心公平性而反对私有化。我们将大型语言模型生成的推理依据 \( r \) 作为蒸馏训练的辅助输入。

### 3.3. 学生模型与双路径架构

我们使用mBERT(Devlinet al.,2019 (https://arxiv.org/html/2607.18693#bib.bib20))作为学生模型。mBERT在104种语言上进行了预训练,具有跨语言表示能力,适合多语言立场检测任务。然而,mBERT采用仅编码器架构,而大型语言模型通常采用仅解码器或编码器-解码器架构。为弥合这一架构差距,我们设计了一个双路径层次蒸馏框架,如图4所示。

**标准路径。** 标准路径将文本 \( x \) 和目标 \( t \) 作为输入,并输出表示 \( h^{\text{std}} \) 和预测分布 \( p^{\text{std}} \)。具体地,我们遵循(Zhanget al.,2023b (https://arxiv.org/html/2607.18693#bib.bib9))中的模板构建方式,将文本和目标组合成如“[CLS] target: E [SEP] text: T [SEP]”的序列。mBERT编码最后一层的[CLS]表示作为立场表示 \( h^{\text{std}} \),然后通过线性分类头预测分布 \( p^{\text{std}} \)。

**推理增强路径。** 推理增强路径将文本 \( x \)、目标 \( t \) 和大型语言模型生成的推理依据 \( r \) 作为输入。我们以类似的方式拼接三个成分,得到序列 `[CLS] target: t [SEP] text: x [SEP] rationale: r [SEP]`。mBERT编码得到表示 \( h^{\text{rat}} \) 和预测分布 \( p^{\text{rat}} \)。增强路径在训练期间利用推理知识提高表示质量,但在测试时可以移除推理依据部分,退化为标准路径。

在训练过程中,我们最小化增强路径预测分布与其实标签 \( y \) 之间的交叉熵损失:
\[
\mathcal{L}_{\text{CE}}^{\text{rat}} = -\log p^{\text{rat}}(y | x, t, r)
\]
类似地,标准路径也使用交叉熵损失:
\[
\mathcal{L}_{\text{CE}}^{\text{std}} = -\log p^{\text{std}}(y | x, t)
\]

### 3.4. 双路径蒸馏与表示对齐

为了将推理增强路径的推理知识迁移到标准路径,我们在表示层和响应层同时对齐两条路径。

**表示级对齐。** 我们使用均方误差损失最小化两条路径的隐藏表示之间的距离:
\[
\mathcal{L}_{\text{Rep}} = \| h^{\text{rat}} - h^{\text{std}} \|_2^2
\]

**响应级对齐。** 我们使用KL散度最小化两条路径预测分布之间的差异:
\[
\mathcal{L}_{\text{Dist}} = \text{KL}(p^{\text{rat}} \| p^{\text{std}})
\]

蒸馏总损失为:
\[
\mathcal{L}_{\text{Distill}} = \mathcal{L}_{\text{Rep}} + \alpha \mathcal{L}_{\text{Dist}}
\]
其中 \( \alpha \) 是平衡超参数。

在源语言训练阶段,我们结合分类损失和蒸馏损失:
\[
\mathcal{L}_{\text{src}} = \mathcal{L}_{\text{CE}}^{\text{std}} + \mathcal{L}_{\text{CE}}^{\text{rat}} + \beta \mathcal{L}_{\text{Distill}}
\]
其中 \( \beta \) 是权衡蒸馏强度的超参数。

### 3.5. 对比学习约束

为进一步提高立场区分能力,我们在源语言和目标语言阶段引入了对比学习目标。

**源语言对比学习。** 在源语言阶段,我们有充足的标注数据。我们为每个立场类别构造原型表示。对于类别 \( c \),我们从训练集中随机采样 \( K \) 个支持样本,并通过增强路径模型提取它们的表示,取平均值作为原型 \( \mu_c = \frac{1}{K} \sum_{i \in \text{supp}(c)} h_i^{\text{rat}} \)。然后,对于查询样本 \( q \),我们计算其表示 \( h_q^{\text{rat}} \) 与所有原型之间的余弦相似度,并应用基于距离的对比损失:
\[
\mathcal{L}_{\text{Con}}^{\text{src}} = -\log \frac{\exp(\text{sim}(h_q^{\text{rat}}, \mu_{y_q})/\tau)}{\sum_{c'} \exp(\text{sim}(h_q^{\text{rat}}, \mu_{c'})/\tau)}
\]
其中 \( \tau \) 是温度参数。该损失鼓励查询表示与其对应原型聚类。

**目标语言对比学习。** 在目标语言阶段,由于缺乏标注数据,我们无法可靠地构建类原型。因此,我们采用基于样本的对比约束。对于每个目标语言样本,我们获得其标准路径表示 \( h^{\text{std}} \) 和增强路径表示 \( h^{\text{rat}} \),并构建正负样本对:正样本对包含来自同一样本的两条路径表示;负样本对包含来自不同样本的表示(不考虑标签)。我们使用InfoNCE损失(Chenet al.,2020 (https://arxiv.org/html/2607.18693#bib.bib25)):
\[
\mathcal{L}_{\text{Con}}^{\text{tgt}} = -\log \frac{\exp(\text{sim}(h_i^{\text{std}}, h_i^{\text{rat}})/\tau)}{\sum_{j \neq i} \exp(\text{sim}(h_i^{\text{std}}, h_j^{\text{rat}})/\tau) + \exp(\text{sim}(h_i^{\text{std}}, h_i^{\text{rat}})/\tau)}
\]
该损失拉近了同一样本的两条路径的表示,并推开不同样本的表示,从而在跨语言蒸馏中保持判别特征。

### 3.6. 训练与推理

整个训练过程分两个阶段进行。

第一阶段:在源语言标注数据上联合训练mBERT学生模型,损失函数为 \( \mathcal{L}_{\text{src}} = \mathcal{L}_{\text{CE}}^{\text{std}} + \mathcal{L}_{\text{CE}}^{\text{rat}} + \beta \mathcal{L}_{\text{Distill}} + \gamma \mathcal{L}_{\text{Con}}^{\text{src}} \),其中 \( \gamma \) 是源语言对比损失权重。

第二阶段:固定教师模型(推理增强路径),在目标语言无标注数据上蒸馏学生模型(标准路径)。我们通过教师生成推理依据,并优化目标语言蒸馏损失和对比损失:
\[
\mathcal{L}_{\text{tgt}} = \mathcal{L}_{\text{Distill}} + \eta \mathcal{L}_{\text{Con}}^{\text{tgt}}
\]
其中 \( \eta \) 是目标语言对比损失权重。注意,在第二阶段,教师仅提供推理增强表示和分布,并不更新参数。

推理时,仅使用标准路径(输入文本和目标),无需推理依据,因此推理成本与mBERT相同。

## 4. 实验

### 4.1. 数据集

我们在X-Stance数据集(Zotov and Dray,2020 (https://arxiv.org/html/2607.18693#bib.bib39))上评估我们的方法。X-Stance包含政治声明,涵盖英语、德语、法语、意大利语等多种语言。根据常见做法,我们以英语为源语言,其他语言为目标语言。数据集划分如下:训练集包含英语样本,验证集和测试集分别包含目标语言样本。为了评估低资源场景,我们使用了部分目标语言训练集(例如10%)。此外,我们还使用Catalan-Catalonia数据集(Vilares and Gómez-Rodríguez,2020 (https://arxiv.org/html/2607.18693#bib.bib54))进行额外评估,该数据集关注加泰罗尼亚语对独立话题的立场。

| 语言 | 训练样本 | 验证样本 | 测试样本 | 类别 |
|------|----------|----------|----------|------|
| 英语 | 10,000 | 1,000 | 1,000 | 赞成/反对/中立 |
| 德语 | 800 | 500 | 1,500 | 赞成/反对/中立 |
| 法语 | 600 | 300 | 1,000 | 赞成/反对/中立 |
| 意大利语 | 400 | 200 | 800 | 赞成/反对/中立 |
| 加泰罗尼亚语 | 300 | 100 | 300 | 赞成/反对 |

### 4.2. 基线方法

我们与以下基线进行比较:
- **mBERT (zero-shot)**:直接在英语上微调mBERT,然后在目标语言上零样本测试。
- **XLM-R (zero-shot)**:同样零样本测试的多语言模型。
- **CCSD (Zhanget al.,2023b)**:跨语言跨目标蒸馏框架。
- **DistilBERT (Sanh et al.,2019)**:知识蒸馏变体,但无推理指导。
- **CoT→Small (Magisteret al.,2023)**:思维链蒸馏到小型模型的方法。
- **Zero-shot LLM**:使用LLaMA-3-8B等大型语言模型直接进行零样本立场检测。

我们也报告了使用Oracle推理依据的变体(即人工编写的推理依据)作为上限参考。

### 4.3. 实现细节

我们使用LLaMA-3-8B作为教师模型生成推理依据。为每个源语言训练样本和每个目标语言无标注样本生成推理依据。我们使用mBERT-base作为学生模型,其隐藏维度为768。优化器采用AdamW,学习率为2e-5,批量大小为16。对比学习温度τ设为0.1;平衡超参数α、β、γ、η分别设为0.5、0.5、0.3、0.2。所有实验运行5次,报告平均结果。

### 4.4. 主要结果

表1展示了在多个目标语言上的宏平均F1分数。我们的方法在所有目标语言上均优于所有基线。具体地:

- 与零样本mBERT相比,我们的方法平均提升约8个点,表明推理引导蒸馏有效。
- 与CCSD和DistilBERT相比,我们的方法提升约3-5个点,验证了推理知识的重要性。
- 与CoT→Small相比,我们的方法提升约2个点,因为我们的双路径架构更好地保留了推理能力。
- 与Oracle推理依据相比,我们的方法性能相近,显示自动生成的推理依据有效性。

| 方法 | 德语 | 法语 | 意大利语 | 加泰罗尼亚语 | 平均 |
|------|------|------|----------|--------------|------|
| mBERT (zero-shot) | 0.654 | 0.632 | 0.611 | 0.598 | 0.624 |
| XLM-R (zero-shot) | 0.671 | 0.653 | 0.629 | 0.612 | 0.641 |
| CCSD | 0.702 | 0.684 | 0.668 | 0.645 | 0.675 |
| DistilBERT | 0.678 | 0.659 | 0.642 | 0.625 | 0.651 |
| CoT→Small | 0.693 | 0.672 | 0.654 | 0.639 | 0.665 |
| Zero-shot LLM (LLaMA-3-8B) | 0.712 | 0.695 | 0.673 | 0.651 | 0.683 |
| Ours | **0.736** | **0.718** | **0.691** | **0.672** | **0.704** |
| Ours (Oracle rationale) | 0.745 | 0.725 | 0.698 | 0.681 | 0.712 |

表1:在X-Stance目标语言上的宏平均F1分数。加粗表示最佳结果(除Oracle变体)。

### 4.5. 消融研究

我们通过移除各个组件进行消融研究,结果如表2所示。

| 变体 | 德语宏F1 | 法语宏F1 |
|------|---------|---------|
| 完整模型 | **0.736** | **0.718** |
| 不含推理增强路径 | 0.712 | 0.693 |
| 不含表示对齐损失 | 0.725 | 0.707 |
| 不含响应对齐损失 | 0.719 | 0.701 |
| 不含源语言对比学习 | 0.728 | 0.710 |
| 不含目标语言对比学习 | 0.720 | 0.703 |

表2:在德语和法语上的消融结果。

结果分析:
- 移除推理增强路径(即仅用标准路径进行训练)导致性能下降最大,证明了推理知识的必要性。
- 表示对齐和响应对齐都是必要的,两者结合效果最好。
- 两个对比学习目标均贡献了进一步提升,源语言对比学习在帮助原型构建方面效果更明显。

### 4.6.

相似文章

掩码蒸馏:将思维链内化到语言模型中

arXiv cs.AI

掩码蒸馏是一种知识蒸馏框架,它训练学生大语言模型仅预测解决方案令牌,同时推理教师提供反馈,旨在将思维链计算内化到模型参数中。该方法显示任务相关的成功,在GSM8K上有效,但对于像Countdown这样更困难的任务需要小型脚手架。

通过混合层蒸馏和关键信息的逐步注意力改进小模型的推理能力

arXiv cs.CL

本文提出一种新颖的思维链蒸馏框架,通过混合层模块的动态层对齐,将教师模型对关键信息的逐步注意力转移到学生模型中。该方法通过明确指导学生模型在推理过程中逐步聚焦关键信息,在数学和常识推理基准测试中实现了一致的性能提升。

面向多语言推理的跨语言在线策略自蒸馏

Hugging Face Daily Papers

本文提出了跨语言在线策略自蒸馏(COPSD)方法,该方法通过共享的学生-教师架构,将高资源语言的推理能力迁移到低资源语言中。在17种非洲语言上的实验表明,该方法的数学推理能力和答案格式遵循度均得到显著提升,性能优于组相对策略优化(GRPO)。