蒸馏学生路径:面向英文证据跨语言RAG的教师正则化强化学习

arXiv cs.CL 论文

摘要

提出TR-RAG,一种面向英文证据跨语言RAG的教师正则化强化学习方案,将奖励优化与在线策略蒸馏相结合,以解决语言漂移和证据使用不可靠的问题。实验表明,在多个基准测试中,该方法在语言一致性和基于证据的正确性方面均有提升。

arXiv:2607.02966v1 公告类型:新 摘要:跨语言检索增强生成(RAG)通常部署在英文证据场景下,即用户使用多种语言查询,但检索到的段落仍然是英文的。在这种设置下,即使基础模型很强,生成也可能失败:英文证据会导致语言漂移(输出英文或代码切换),并且在生成非英文答案时,模型不可靠地使用证据。我们将这些失败归因于两个训练后挑战:(i)错误是前缀相关的,因此固定轨迹监督面临前缀不匹配问题;(ii)序列级(部分离散/基于评判的)奖励导致有噪声的信用分配和高方差更新。我们提出TR-RAG,一种教师正则化强化学习方案,它将奖励优化与学生访问前缀上的在线策略蒸馏相结合。一个紧凑型学生模型采样在线策略答案,而一个更强的冻结教师模型仅在这些前缀上被查询,并提供逐前缀的学生到教师反向KL锚点。我们进一步引入了一种针对英文证据多语言生成的奖励分解方法,结合了语言一致性、字符3-gram召回率和基于证据正确性的LLM评判分数。在三个基准测试(BioASQ-ENKB5、Hotpot-ENKB5和自然多语言的MKQA)以及两个骨干模型上,TR-RAG提高了语言一致性和基于证据正确性的综合指标,优于强基线。关键的是,教师锚点起到了安全网的作用:在域内语言上,它防止了仅奖励RL可能出现的重大语言一致性崩溃(高达约27个百分点),甚至降到基础模型以下;而在遥远的分布外语言上——仅奖励RL停滞在基础模型的上限——它仍然改善了证据基础;在字符3-gram召回率方面,紧凑型学生模型有时甚至超越了其70B的教师模型。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:36

# 将学生轨迹用于蒸馏:面向英语证据跨语言检索增强生成的教师正则化强化学习方法

来源:https://arxiv.org/html/2607.02966

周昊天¹,²,∗‡黄炜然¹,³,∗刘思琦²,⁴,‡王希婷⁴ 张鑫²文志浩²,†

¹上海交通大学计算机科学与工程系
²蚂蚁国际,蚂蚁集团
³上海创新研究院
⁴中国人民大学高瓴人工智能学院

###### 摘要

跨语言检索增强生成(RAG)通常部署在*英语证据*模式下,即用户使用多种语言查询,但检索到的段落仍为英文。在这种场景下,即使基础模型强大,生成仍可能失败:英语证据会导致*语言漂移*(输出英语或代码混合内容),并且模型在生成非英语答案时对证据的使用不可靠。我们将这些失败归因于两个后训练挑战:(i) 错误具有*前缀依赖性*,因此固定轨迹的监督会遭受*前缀不匹配*问题;(ii) 序列级(部分离散/基于评判器)奖励导致噪声信用分配和高方差更新。我们提出**TR-RAG**,一种教师正则化强化学习方案,将奖励优化与*在策略蒸馏*相结合,作用于学生访问的前缀上。一个轻量级学生模型采样在策略答案,而一个更强的*冻结*教师模型仅在这些前缀上被查询,并提供一个逐前缀的学生到教师的反向KL锚点。我们进一步针对英语证据多语言生成提出了一种奖励分解方法,结合了语言一致性、字符三元组召回率以及用于证据支撑正确性的LLM评判分数。在三个基准测试(BioASQ-ENKB5、Hotpot-ENKB5 和天然多语言的 MKQA)和两个骨干模型上,TR-RAG 在语言遵循和证据支撑正确性的综合指标上优于强基线。关键的是,教师锚点起到了*安全网*的作用:在领域内语言上,它防止了仅使用奖励的强化学习可能出现的严重语言一致性崩溃(高达~27个百分点),这种崩溃会使模型漂移到甚至低于基础模型;而在远程的分布外语言上——仅用奖励的强化学习停滞在基础模型的天花板——它仍然能改进证据支撑;在字符三元组召回率上,轻量学生模型有时甚至超越其700亿参数的教师模型。

---

## 1 引言

检索增强生成(RAG)将大型语言模型(LLM)锚定于外部证据,并实现快速知识更新[[26], [10]]。许多部署是跨语言的:用户使用多种语言查询并期望得到相应语言的答案,而知识库仍然以英语为主[[6], [2], [63]]。我们研究这种实际场景——*英语证据跨语言RAG*——其中查询和答案是非英语的,但检索到的段落是英语的。当检索能力足够强时,主要瓶颈转移到生成侧[[38]]:模型必须利用*英语*证据,同时生成流畅、正确的*非英语*响应——在单个解码轨迹中选择、聚合并用目标语言呈现证据。因此,我们固定检索环节,专注于生成器的后训练。

工业动机。这一场景是生产中反复出现的瓶颈。在跨境商户助手和全球客服系统中,文档和政策文本往往是纯英文的,而用户使用母语查询[[28], [5]],因此检索器返回英文段落,生成器必须以用户语言流利回答。一个常见的失败是*语言漂移*:即使底层答案正确,模型也会切换输出语言[[27], [34]]。这推动了我们的问题建模、奖励设计以及逐前缀教师锚点的构建。

两个生成阶段挑战及其共享的优化瓶颈。当英文段落被注入上下文后,LLM面临两个突出问题:❶ 英文证据下的语言漂移。模型经常在查询-证据语言不匹配时用英语回答或进行代码混合[[28]];英文证据将下一个词元的概率向英文延续偏移,而推理式解码可能进一步放大这种拉力[[57], [27]]。❷ 用非英语答案进行跨语言证据使用。模型必须识别相关片段,聚合多个文档,并用目标语言忠实地表达结论;实践中,模型可能关注不相关的证据、不可靠地聚合或引入无依据的细节[[5]]。这两种失败都具有强烈的*前缀依赖性*——一个早期的错误语言词元或部分错误会加剧后续错误——暴露了两个训练瓶颈:

(i) 前缀不匹配——SFT/离线KD仅在参考轨迹上提供梯度,因此一旦学生偏离,它就会访问到没有直接监督的失败前缀(*曝光偏差*)[[4], [44], [1]]。
(ii) 噪声信用分配——语言遵循和证据正确性在序列级别(部分离散/基于评判器)进行判断,导致高方差的策略梯度更新[[58], [52], [32], [21]]。

我们的方法。我们提出**TR-RAG**,一种教师正则化的在策略后训练方案,直接针对(i)-(ii)。一个轻量级学生模型在策略生成答案,而一个更强的*冻结*教师模型在*学生访问过的前缀*上被查询,以提供密集的词元级指导(无需教师 rollout),通过逐前缀的反向KL锚点KL(πθ(·|s_t)∥π_T(·|s_t))[[1]]。这抑制了不可能的延续,减轻了前缀不匹配并稳定了奖励优化。在此锚点之上,我们优化一个跨语言任务奖励,结合语言一致性[[28], [27]]、字符三元组召回率[[36], [23]]和LLM评判分数[[68]]。我们的主要贡献:

- • 我们从生成中心的视角研究了*英语证据跨语言RAG*,并识别出两种前缀依赖的失败模式:语言漂移和脆弱的证据使用。
- • 我们引入TR-RAG,它通过作用于学生访问前缀上的密集逐前缀反向KL锚点,将序列级奖励与*在策略蒸馏*相结合。
- • 在三个基准测试(BioASQ-ENKB5、Hotpot-ENKB5 和天然多语言的 MKQA)和两个骨干模型上,TR-RAG 取得了最佳综合分数,并且——与仅用奖励的强化学习不同——起到了*安全网*的作用:它防止了仅用奖励的强化学习可能出现的严重(高达~27pp)领域内语言一致性崩溃(这种崩溃会使模型漂移到低于基础模型),同时在远程的分布外语言(挪威语、高棉语)上仍然改进了证据支撑(仅用奖励的强化学习在这些语言上停滞在基础模型天花板),并且在字符三元组召回率上有时超越其700亿参数的教师模型。

---

图1:概览。(a) *英语证据跨语言RAG*:查询/答案使用目标语言,而检索到的段落是英语。(该面板将检索到的文档标为“Top-K”,是通用检索含义;全文中文档数量记为M,因为K保留用于每个输入的在策略 rollout 次数。) (b) 两种前缀依赖的失败模式——*语言漂移*和*证据使用失败*——导致了两个训练障碍:固定轨迹监督下的*前缀不匹配*和*序列级*奖励下的高方差优化。(c) TR-RAG 将在策略强化学习与在策略蒸馏相结合:冻结教师在学生访问的前缀上被查询,产生密集的反向KL锚点KL(πθ∥π_T)(无需教师 rollout)。“T.A.”表示这个*教师锚点*。

---

## 2 预备知识

任务:英语证据跨语言RAG。我们研究一种实际的跨语言RAG场景,其中知识库仅为英语。给定一个用目标语言ℓ编写的用户查询q,检索器返回一组前M篇英文段落D={d_k}_{k=1}^M。生成器必须生成一个长度为L的答案y=(y_1,...,y_L),使用相同的目标语言ℓ,并基于D。

策略与解码状态。令x=(q,D)表示条件输入。我们将学生/策略模型记为πθ(y|x),将更强的教师模型记为π_T(y|x)。生成是自回归的:πθ(y|x)=∏_{t=1}^L πθ(y_t | x, y_{<t}),其中前缀状态s_t = (x, y_{<t})。在整个后训练过程中,教师模型被冻结。

奖励函数。我们定义跨语言RAG奖励r(x,y)为以下三项的加权和:

(1) 语言一致性r_lang(x,y):计算y中与输入查询q的ISO-639-1语言代码匹配的词元比例[[28], [27]]。

(2) 字符三元组召回率r_3gram(x,y):在y和参考答案之间计算字符级三元组召回率,作为未提供参考答案检索结果时的近似指标[[36], [23]]。(在提供参考答案的基准测试中,我们使用参考答案;否则我们使用检索段落中提取的最兼容片段。)

(3) LLM评判分数r_judge(x,y):使用评判LLM(我们实验中为Qwen2.5-72B-Instruct)评估答案是否在事实上基于提供的证据且正确,评分范围0-5[[68], [24]]。

最终奖励:r(x,y) = w_l · r_lang(x,y) + w_g · r_3gram(x,y) + w_j · r_judge(x,y)/5,其中w_l, w_g, w_j是平衡权重。该奖励是序列级且可微性有限的(由于语言计数和评判器离散性)。

目标。我们的目标是在期望奖励上优化策略,并增加一个逐前缀反向KL正则化项:max_πθ E_x∼D, y∼πθ(·|x)[r(x,y)] - β · E_x∼D [1/L(y) ∑_{t=1}^{L(y)} KL(πθ(·|s_t) || π_T(·|s_t))]. (1)

第二项是我们在第3节中推导的“教师锚点”。β>0控制教师锚点的强度。下面所有陈述在L(y)随机时仍然有效。

---

### B.2 反向KL分解:教师似然 + 熵

引理 B.1 (逐词元反向KL恒等式)。对于任意前缀状态s和分布π(·|s)与π_T(·|s),有

-KL(π(·|s) || π_T(·|s)) = E_{a∼π(·|s)}[log π_T(a|s)] + H(π(·|s)), (15)

其中H(π) = -E_{a∼π}[log π(a)]是熵。

证明。根据定义,KL(π||π_T) = E_{a∼π}[log π(a) - log π_T(a)]。两边取负得 -KL(π||π_T) = E_{a∼π}[log π_T(a)] - E_{a∼π}[log π(a)] = E_{a∼π}[log π_T(a)] + H(π)。 ∎

推论 B.2 (学生前缀上的词元平均反向KL分解)。对于采样轨迹 y∼πθ(·|x),有

-L_revKL(x,y) = 1/L(y) ∑_{t=1}^{L(y)} ( E_{a∼πθ(·|s_t)}[log π_T(a|s_t)] + H(πθ(·|s_t)) ). (16)

含义。式(16)表明教师锚点有两个作用:(i) 通过鼓励学生采取教师赋予高概率的动作,增加*教师一致性*;(ii) 添加了一个*局部熵奖励*,稳定了奖励优化下的探索。

关于实现值与期望值的重要说明。通常,当L(y)依赖于轨迹时,不应声称 E_{y∼πθ}[ 1/L(y) ∑_{t=1}^{L(y)} E_{a∼πθ(·|s_t)}[log π_T(a|s_t)] ] 完全等价于用实现词元的log π_T(y_t|s_t)替换内部期望。实现词元形式是每个状态期望的*蒙特卡罗估计量*,但随机归一化因子1/L(y)的存在意味着在重写目标时需要额外小心。因此,我们使用式(16)中的分解作为数学上正确的恒等式,并在讨论实现时将实现词元量仅视为估计量。

---

### B.3 简化赌博机视角下的闭式最优解(和KL变体)

为建立直觉,考虑一个上下文赌博机抽象,其中“动作”是整个序列y,并考虑一个*和KL*正则化项(无长度归一化)。定义一个序列级教师“先验”,通过在y诱导的相同前缀状态上评估教师,即 π_T(y|x) ≜ ∏_{t=1}^{L(y)} π_T(y_t|s_t). (17)

定义序列级反向KL KL(π(·|x) || π_T(·|x)) = E_{y∼π(·|x)}[log π(y|x) - log π_T(y|x)]. (18)

引理 B.3 (自回归KL链式法则)。如果π和π_T在相同前缀状态下共享相同的自回归分解,那么序列级KL等于期望的逐词元KL项之和:

KL(π(·|x) || π_T(·|x)) = E_{y∼π(·|x)} ∑_{t=1}^{L(y)} KL(π(·|s_t) || π_T(·|s_t)). (19)

证明。由相同前缀状态s_t=(x,y_{<t})上共享的自回归分解,直接写出log π(y|x)和log π_T(y|x)的乘积形式,然后代入KL定义。 ∎

引理 B.4 (和KL正则化目标的闭式解)。对于用和KL(式(18))代替平均KL(式(1))的目标:max_π E_x,y∼π(·|x)[r(x,y)] - β KL(π(·|x) || π_T(·|x)). (20) 假设支撑集条件:如果π_T(y|x)>0对支撑集内所有y成立,则最优解为:

π^⋆(y|x) = π_T(y|x) exp(r(x,y)/β) / ∑_{y'} π_T(y'|x) exp(r(x,y')/β). (21)

证明。引入拉格朗日乘子,对π(y|x)求导并令为零,整理后归一化即得式(21)。 ∎

注记(标准结论)。式(21)是KL正则化(最大熵)目标的标准闭式形式,在RLHF/控制-作为-推理文献中反复出现(例如DPO奖励-策略对应[[42]])。

---
**注意:** 原文中的引用和公式编号(如[26]、[10]等)保留原样,数学公式以LaTeX或Unicode形式呈现,未做修改。翻译力求准确、自然,术语一致。

相似文章

超越 GRPO 与策略内蒸馏:语言模型后训练的经验性“稀疏至稠密”奖励原则

Hugging Face Daily Papers

本文提出了一种用于语言模型后训练的经验性“稀疏至稠密”奖励原则,主张应使用稀疏奖励配合稀缺的标注数据进行教师模型发现,并使用稠密奖励通过蒸馏进行学生模型压缩。作者证明,这种连接稀疏强化学习与策略内蒸馏的分阶段方法,在数学基准测试中优于在部署规模模型上直接运行 GRPO 的效果。

面向LongEval-RAG的候选约束检索增强生成:系统设计与实证分析

arXiv cs.CL

本文介绍了为CLEF 2026 LongEval-RAG任务设计的候选约束检索增强生成(RAG)系统,该系统结合了确定性溯源追踪与段落检索、查询扩展、伪相关反馈、互惠排名融合、证据重排序以及引文感知聚合。对十种流水线变体的消融研究表明,采用基于规则的分块流水线并辅以句子级神经选择的方案取得了最佳性能。