LEAF: 面向语音感知大语言模型后训练的无分支树生长方法

arXiv cs.LG 论文

摘要

本文提出LEAF,一种基于回顾树的强化学习方法,用于语音感知大语言模型后训练,无需在线分支即可改进信用分配。在语音问答和语音翻译基准测试中,LEAF优于GRPO。

arXiv:2606.07610v1 公告类型:新 摘要:当前最先进的GRPO风格方法用于语音感知大语言模型后训练存在粗粒度信用分配问题,即对响应中的每个令牌赋予相同的终端奖励优势。这忽略了批次展开中的有用结构——语音条件下的补全通常在重要决策分歧之前共享前缀。我们提出低秩自适应分叉探索(LEAF),一种基于回顾树的强化学习方法,无需在线分支或额外解码即可恢复该结构。LEAF采样完整响应,选择高意外度边界,按共享前缀对响应分组,并使用后代奖励分配跨度级优势。我们从理论上证明了LEAF的跨度级信用分配和边界选择设计的合理性。实验表明,在相同的展开和低秩自适应预算下,LEAF在语音问答和语音翻译基准上优于GRPO。值得注意的是,使用LEAF训练的较小模型优于当前最先进的全参数基线模型。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:50

# LEAF:无需分支的树结构增长用于语音感知大语言模型后训练 来源:https://arxiv.org/html/2606.07610 Mark Hasegawa-Johnson & Venugopal V. Veeravalli 伊利诺伊大学厄巴纳-香槟分校

###### 摘要

当前最先进的 GRPO 风格的语音感知大语言模型后训练方法存在粗粒度信用分配问题,即将相同的终端奖励优势广播给响应中的每一个词元。这忽略了采样批次中有用的结构——语音条件化的补全通常共享前缀,然后在重要决策点处发生分歧。我们提出**低秩探索自适应分叉 (LEAF)**,一种回顾式基于树的强化学习方法,无需在线分支或额外解码即可恢复此结构。LEAF 采样完整响应,选择高意外度边界,按共享前缀对响应分组,并使用后代奖励分配跨度级优势。我们从理论上证明了 LEAF 的跨度级信用分配和边界选择设计的合理性。实验表明,在相同的采样和低秩适配预算下,LEAF 在语音问答和语音翻译基准测试上优于 GRPO。值得注意的是,较小的 LEAF 训练模型超越了当前最先进的全参数基线。

## 1 引言

语音感知大语言模型 (SALLM) [Arora 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib2) 实现了端到端的语音交互,涵盖语音问答 (SQA)、自动语音翻译 (AST) 和语音识别等多个任务。随着这些模型的改进,后训练对于使生成与下一词元预测无法捕获的任务级目标对齐变得至关重要。强化学习 (RL) 是自然的选择,最近的 GRPO 风格方法 [Shao 等人, 2024](https://arxiv.org/html/2606.07610#bib.bib34);[Yu 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib12) 表明,奖励驱动的适配可以改进开放式语音理解,同时通过归一化多个补全的终端奖励避免额外训练成本。

尽管简单,GRPO 受限于粗粒度信用分配:它对每个响应计算一个终端奖励,并将相同的标量优势广播给每个词元。虽然高效,但这丢弃了补全在何处变得有希望或有害的信息。此问题在开放式语音后训练中尤为突出,因为候选答案通常共享早期片段,仅在不确定的语义决策附近分叉,因此瓶颈不仅仅是奖励设计,而是采样组织结构和信用分配。

树结构 RL 提供了一种更精细的替代方案:通过从中间状态分支并使用后代结果进行过程级监督,它将信用定位到重要决策。然而,直接将在线树扩展引入 SALLM 后训练成本高昂,因为语音输入长且多模态,解码是批量的,且奖励是任务特定的。这引出了我们的核心问题:**能否在保留批量 GRPO 风格训练简单性的同时,获得结构化探索和过程感知信用分配的好处?**

我们的答案是:**低秩探索自适应分叉 (LEAF)**,一种用于 SALLM 后训练的回顾性 RL 方法。LEAF 采样与 GRPO 相同的 K 个完整响应,然后将它们重新组织成一个稀疏的回顾性前缀树。它选择少量高意外度词元边界,在这些边界处按精确共享前缀对补全进行分组,从后代终端奖励估计前缀值,并分配保留节点之间的跨度级优势。因此,LEAF 保持了 GRPO 的批量生成模式,同时用源于采样批次本身的结构化跨度级监督取代了序列级信用。

最后,LEAF 专为参数高效的语音后训练而设计。我们使用 LoRA [Hu 等人, 2022](https://arxiv.org/html/2606.07610#bib.bib11) 实例化它,受到最近证据表明低秩适配可以接近全参数 RL 后训练性能的启发 [Schulman and Lab, 2025](https://arxiv.org/html/2606.07610#bib.bib16)。这使我们能够测试更好的信用分配是否能在轻量级可训练参数预算下转化为更强的 SALLM 适配。据我们所知,LEAF 是第一个用于语音后训练的基于树的 RL 方法,也是在回顾性信用分配中第一个使用不确定性引导机制来构建前缀级监督的方法。

**贡献。** 我们引入了 LEAF,一种用于 SALLM 后训练的回顾性基于树的 RL 方法,它从 GRPO 使用的相同独立同分布采样组中提取过程感知的跨度优势。我们为 LEAF 的设计提供了理论支持,表明跨度级前缀优势是有效的信用信号,分叉预算控制着支持度与分辨率的权衡,纯粹的精确前缀匹配偏向于浅层高碰撞前缀。实验上,我们表明语音理解采样在不同任务和骨干模型上高度可分叉,并且 LEAF 在相同采样和 LoRA 适配预算下持续优于 GRPO,在自动指标、评判分数和尾部风险行为上均有提升。

## 2 相关工作

**SALLM 的 GRPO。** GRPO [Shao 等人, 2024](https://arxiv.org/html/2606.07610#bib.bib34) 是一种无评论家的 RL 目标,它在一组采样的补全中归一化终端奖励。最近的工作将 GRPO 应用于语音感知语言模型,用于开放式语音理解,包括 SQA 和 AST [Elmakies 等人, 2026](https://arxiv.org/html/2606.07610#bib.bib1),以及自动语音识别 [Shivakumar 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib14) 和文本转语音 [Liu 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib15)。这些工作表明奖励驱动的后训练对语音有效,但保留了 GRPO 的扁平信用分配:一个终端奖励优势被广播给响应中的所有词元。LEAF 保留相同的基于组的采样接口,但用源于共享前缀的跨度级信用取代了序列级信用。

**细粒度和树结构信用。** 近期几种方法寻求比 LLM RL 中的轨迹级奖励更密集的信用。VinePPO 通过从部分状态采样延续来估计中间值 [Kazemnejad 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib3),SPO 在片段级别分配优势 [Guo 等人, 2026](https://arxiv.org/html/2606.07610#bib.bib36),高熵分析表明少数不确定的词元通常驱动下游决策 [Wang 等人, 2026](https://arxiv.org/html/2606.07610#bib.bib37)。基于树的方法通过将采样组织成分支结构来获得过程级监督 [Li 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib6); [Yang 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib5); [Ji 等人, 2026](https://arxiv.org/html/2606.07610#bib.bib13); [Hou 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib4)。LEAF 与 TreeRL 和 TEMPO/P2T [Hou 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib4); [Tran 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib18) 最为接近,它们从一组固定的采样补全中估计前缀级信用,但在设置、构建和信用分配上有所不同:LEAF 不进行额外解码,目标是语音而非文本 LLM,并且仅在稀疏的高意外度位置分叉,而不是通过精确词元匹配构建完整的前缀树。我们在第 4 节中正式说明为什么纯粹的碰撞匹配有问题,因为它将信用偏向于浅层、高支持度的前缀,而这些前缀可能不携带奖励相关信息。

## 3 方法

LEAF 脱离了树结构 RL 中占主导的执行模式,该模式在推理时迭代扩展搜索树。相反,它利用训练期间收集的独立同分布轨迹批次中已经存在的结构:共享前缀的候选响应被回顾性地组织成前缀树,无需额外的采样。此树取代了 GRPO 的优势计算。LEAF 不是为响应中的每个词元分配一个标量优势,而是推导出词元跨度上的分段常数优势,将信用定位到补全出现分歧的位置(图 1)。

### 3.1 预备知识:GRPO

令 x 为语音条件化输入,π_old 为采样策略,π_θ 为优化策略,π_ref 为固定参考策略。GRPO 采样 K 个响应 y^{(1)},...,y^{(K)} ∼ π_old(·|x) 并分配终端奖励 r_i = r(x,y^{(i)})。它形成组相对优势 A_i^{GRPO} = (r_i - r̄) / σ_r,其中 r̄ 和 σ_r 是样本均值和标准差,并将此标量广播给响应 i 中的每个生成词元。对于从状态 s_t^{(i)} = (x, y_{<t}^{(i)}) 生成的词元 a_t^{(i)},GRPO 目标包含基于分类的优势加权项和 KL 散度惩罚。

### 3.2 回顾性前缀树

LEAF 的核心创新是一种将一组 K 个 i.i.d. 响应重新组织成稀疏前缀树而无需额外解码的程序。

**高意外度边界选择。** 给定频率 f_t (是来自 π_old 的 K 个响应对齐位置 t 处唯一词元的计数) 和 KL 散度 D_t (衡量位置 t 处 π_θ 和 π_ref 之间的差异)。我们在位置 t 处的总体意外度定义为 u_t = f_t * D_t,依此原则:高多样性(高 f_t)和高策略变化(高 D_t)都提示围绕词元决策的可操作差异。我们按降序 u_t 排序,选取前 B 个位置。

**前缀节点构建。** 在每个选定的边界位置 j,我们将所有 K 个响应切片到该位置(从开始到索引 j-1 的词元)。完全相同的切片被分组到一个节点中,由该前缀字符串索引。我们只保留至少有两个成员(即至少两个响应共享该确切前缀)的节点。根节点 v_0 包含所有 K 个响应。

**值估计。** 对于每个保留的非根节点 v,其支持响应集 Resp(v) 的大小 n(v) 至少为 2。我们通过以下公式估计其前缀值:V̂(v) = (1 / n(v)) Σ_{i∈Resp(v)} r_i。我们为根节点设置 V̂(v_0) = r̄(所有 K 个奖励的均值)。

### 3.3 LEAF 优势函数

对于每个响应 i,设 {v_1^{(i)}, ..., v_Q_i^{(i)}} 为从根到叶子的路径上与响应 i 完全匹配的保留前缀节点集合(按深度排序)。设 H_i 为响应 i 的长度。响应 i 在位置 t 处词元的优势根据其相对于下一个最近保留前缀节点的位置分段定义。

内部跨度:对于每个保留节点 v_j^{(i)},j = 1, ..., Q_i - 1,设 p(v) 为 v 的结束位置。跨度 [p(v_j^{(i)}), p(v_{j+1}^{(i)}) - 1] 中的每个词元 t 获得优势:A_internal^{(i)}(t) = (V̂(v_{j+1}^{(i)}) - V̂(v_j^{(i)})) / 2。这样的跨度感知优势将信用分配到不同决策点。

尾部跨度:设 v_last^{(i)} 为在响应 i 完成之前匹配的最后一个保留前缀节点。如果 Q_i > 0,则 v_last^{(i)} = v_{Q_i}^{(i)};否则 v_last^{(i)} = v_0。我们设 A_tail^{(i)} = (r_i - V̂(v_0)) + (r_i - V̂(v_last^{(i)}))。每个位于 [p(v_last^{(i)}), H_i) 的词元 t 接收 A_tail^{(i)}。如果响应 i 没有保留的前缀节点,则整个响应是一个尾部跨度,得到 2(r_i - V̂(v_0)),其方向与 GRPO 响应级优势归一化前相同。实践中,原始跨度优势在进入公式 1 的损失函数之前会在整个采样批次中归一化。

## 4 理论见解

我们对 LEAF 的三种设计选择提供了理论见解:跨度级优势估计器、分叉预算 B 以及基于意外度的边界选择。具体来说,我们展示了 LEAF 使用的经验优势估计器保持了正确的更新方向,描述了 B 值相关的权衡,并强调了纯前缀匹配的问题。由于篇幅限制,我们在此陈述简洁的非正式版本结果,正式陈述和证明推迟到附录 E。

###### 定理 1(跨度级优势的有效性,非正式)。对于以前缀 U_j 结尾的任何跨度,根节点相对差异 V(U_j) - V(U_0) 和父节点相对差异 V(U_j) - V(U_{j-1}) 都是有效的标量优势。在固定前缀条件采样下,V̂(v) 是 V(v) 的无偏估计,方差与 1/n(v) 成正比。因此,共享前缀平均在 LEAF 分配跨度级信用之前就对值进行了去噪处理。

###### 定理 2(分叉预算权衡,非正式)。分叉预算 B 增加了可以估计前缀值的选定边界的数量。在采样预算 K 下,最多 B * floor(K/2) 个非根前缀节点可以被保留。此外,增加 B 可以得到更细的信用分配,但可能产生更多低支持度的值估计。对于 K=8,每个边界最多保留四个节点;使用 B=2 将非根前缀值的最大数量保持在 8,同时仍允许内部跨度级信用。

###### 定理 3(纯前缀匹配偏向浅层,非正式)。前缀碰撞质量随边界深度单调非增,因此仅最大化碰撞的选择器会选择最早的高碰撞平台。因此,纯前缀匹配可能将分叉预算花费在浅层的模板前缀上。LEAF 将两种角色分开:意外度选择在哪里检查,而精确前缀匹配决定该边界处的哪些前缀有足够支持度被保留。

## 5 实验设置

**数据集。** 我们在四个语音语言基准测试上评估 LEAF,涵盖短格式 SQA、长格式 SQA 和 AST。对于短格式 SQA,我们使用 LibriSQA 第一部分 [Zhao 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib30),这是一个基于 LibriSpeech 音频 [Panayotov 等人, 2015](https://arxiv.org/html/2606.07610#bib.bib21) 的开放式问答基准。对于长格式 SQA,我们使用两个源自 LongAudio 的设置 [Ghosh 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib19):DailyTalk [Lee 等人, 2023](https://arxiv.org/html/2606.07610#bib.bib22)(移除多项选择示例后)和 Europarl/VoxPopuli 拆分 [Koehn, 2005](https://arxiv.org/html/2606.07610#bib.bib23); [Wang 等人, 2021](https://arxiv.org/html/2606.07610#bib.bib20),我们称之为 LongAudio。我们将两种长格式设置限制为最多 40 秒的音频片段。对于 AST,我们使用 CoVoST2 英译德 [Wang 等人, 2020](https://arxiv.org/html/2606.07610#bib.bib24)。当数据集提供指令时我们使用它们,仅调整输入格式以适配每个 SALLM;拆分细节见附录 B.2。

**基线与骨干模型。** 我们将 LEAF 与 [Elmakies 等人, 2026](https://arxiv.org/html/2606.07610#bib.bib1) 的最先进 GRPO 语音 RL 基线进行比较。他们报告的结果使用全参数调优;我们的控制 LEAF 与 GRPO 对比实验对两种方法都使用 LoRA,以在相同可训练参数预算下隔离 RL 目标。由于计算限制,我们没有复现他们的全参数 GRPO 基线。此外,Elmakies 等人 (2026) 报告了采样预算但未报告其他训练细节(如 epoch 数或学习率),这使得精确复现变得困难。当可能与他们报告的数字直接比较时,我们会注明;否则,我们使用我们自己的 LoRA GRPO 实现。对于采样,我们匹配他们报告的预算,每个提示 K=8 个响应。LEAF 使用相同的采样预算,分叉预算 B=2;LEAF 和 GRPO 之间所有其他优化和解码超参数匹配,并在附录 B.1 中报告。我们评估 Granite Speech 3.3 2B/8B [Saon 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib25)、Granite-4.0-1B-Speech [Team, 2026](https://arxiv.org/html/2606.07610#bib.bib26) 和 Qwen2-Audio-7B [Chu 等人, 2024](https://arxiv.org/html/2606.07610#bib.bib27)。

**评估指标。** 为了确保与现有最先进技术 [Elmakies 等人, 2026](https://arxiv.org/html/2606.07610#bib.bib1) 进行公平比较,我们报告 BLEU、ROUGE-1/2/L、METEOR 和 BERTScore-F1,使用温度 0.9 和 top-p=0.9 解码。为了补充自动指标,我们使用 M-Prometheus-14B [Pombal 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib28) 进行基于评分标准的 Likert-5 评分,以及 GEMBA 风格的 DA-100 [Kocmi and Federmann, 2023](https://arxiv.org/html/2606.07610#bib.bib29) 使用 Qwen2.5-14B-Instruct [Qwen 等人, 2025](https://arxiv.org/html/2606.07610#bib.bib31) 进行连续逐项评分¹。DA-100 分数在 N=5 次判断上平均。

相似文章

LEAF:事件增强预测的实时基准

arXiv cs.LG

LEAF是一个用于评估大语言模型在事件增强预测任务(如未来事件概率和时间序列预测)上的实时基准。它采用递归检索代理系统结合双代理交叉验证来提供相关的辅助文本,并表明大语言模型能够利用复杂事件来提升预测性能。

解密语言模型的强化学习后训练

arXiv cs.LG

本文剖析了大型语言模型的强化学习后训练算法,探讨了基础模型分布、奖励信号粒度和提示多样性如何影响后训练结果。