STAR-OPD: 用于ABSA四元组提取的结构化方面级联感知在线策略奖励蒸馏
摘要
STAR-OPD是一种新颖的在线策略蒸馏方法,用于ABSA四元组提取,它使用集合结构化奖励来纠正学生模型中的结构错误,提高性能并缩小与教师模型之间的差距。
查看缓存全文
缓存时间: 2026/08/24 04:26
# 结构化方面级联感知的在策略奖励蒸馏用于ABSA四元组抽取 来源:https://arxiv.org/html/2608.20831 唐 旭 | 隶属机构:阿里巴巴国际数字商业集团 | 邮箱:[email protected] / [email protected] / [email protected] 马 明阳 | 隶属机构:阿里巴巴国际数字商业集团 | 邮箱:[email protected] / [email protected] / [email protected] 余家阳 | 隶属机构:阿里巴巴国际数字商业集团 | 邮箱:[email protected] / [email protected] / [email protected] ###### 摘要 基于方面的情感分析(ABSA)四元组抽取需要对通常包含多个细粒度情感元组的评论联合预测目标、方面、观点和情感。虽然大型思维链(CoT)模型在此任务上表现优异,但将其蒸馏为更小的可部署模型仍然困难。我们识别了蒸馏ABSA抽取中的一种任务特定失败模式:学生在目标-方面接口处的错误会产生结构无效的状态,例如破裂的目标-方面绑定和幻觉目标,进而破坏下游预测。传统的策略外蒸馏不适用于此设置,因为它仅在教师生成的轨迹上进行训练,对于主导推理过程的学生诱导的结构状态几乎不提供监督。为解决这种不匹配,我们提出了STAR-OPD(结构化方面级联感知的在策略奖励蒸馏),它建立在通用在策略蒸馏的基础上,并通过级联感知、集合结构的奖励将其实例化用于ABSA四元组抽取。STAR-OPD在学生轨迹上进行训练,并应用直接针对绑定一致性、目标落地和细粒度方面消歧的集合结构奖励。在E-ABSA20K和SemEval-2014上的实验表明,STAR-OPD持续优于策略外和通用在策略基线,减少了目标幻觉,并显著提高了结构困难案例上的性能。使用Qwen3-4B时,STAR-OPD在提升推理效率的同时,大幅缩小了学生-教师之间的差距,凸显了在策略结构修正对蒸馏ABSA抽取的重要性。 ## 1 引言 基于方面的情感分析(ABSA)四元组抽取旨在识别形如 `(目标, 方面, 观点, 情感)` 的结构化情感元组。与更简单的ABSA设置相比,其挑战性显著增加:每条评论可能包含多个元组,目标可能指代产品或产品部件,而方面则从细粒度的领域分类法中选择。近期的思维链(CoT)大语言模型(LLMs)在此任务上表现强劲,但其推理成本对于高吞吐量的电子商务应用而言仍然过高,这促使我们将知识蒸馏到更小的可部署模型中。参考图1说明:**STAR-OPD的动机。左图:** 目标-方面接口处的错误会产生结构无效的元组,并破坏下游预测。**中图:** 策略外蒸馏仅在教师轨迹上训练,错过了学生诱导的级联失败。**右图:** 在策略训练暴露这些状态并使用级联感知奖励进行纠正。 我们识别了蒸馏ABSA抽取中一种任务特定的失败模式,我们称之为**结构化方面级联**:目标-方面接口处的错误会产生结构无效的元组状态,最常见的形式是破裂的绑定和幻觉出的、无落地依据的目标。在一项使用SeqKD蒸馏基线的初步研究中,我们观察到从仅目标正确率到目标-方面正确率存在显著下降,这表明主要瓶颈不仅在于目标识别本身,还在于保持有效目标-方面结构。例如,在“皮革看起来高档,但表带感觉廉价”这句话中,将`表带`错误分配到错误的方面或幻觉出一个未见过的产品部件,即使局部的表达情感的词看起来合理,也可能使整个元组无效。传统的策略外蒸馏不适合解决这个问题,因为它仅在教师生成的轨迹上监督学生,而这些轨迹绝大多数是结构有效的。然而,在推理时,学生必须基于其自身的预测进行条件推断,包括错误的目标-方面绑定和训练中很少见到的幻觉目标。因为这类错误改变的是元组结构,而不仅仅是局部token的准确性,策略外模仿对于恢复主导推理失败的学生诱导状态几乎没有提供直接监督。 为解决这种不匹配,我们提出了**STAR-OPD**(结构化方面级联感知的在策略奖励蒸馏),它建立在通用在策略蒸馏的基础上,并针对ABSA四元组抽取进行了专门化。STAR-OPD在学生轨迹上而非仅教师轨迹上进行训练,并应用级联感知的奖励,这些奖励直接针对错误的目标-方面绑定和幻觉出的、无落地依据的目标,同时采用轻量级的过滤和采样作为稳定措施。在E-ABSA20K和SemEval-2014上的实验表明,STAR-OPD持续优于策略外基线和一个强大的通用在策略基线。使用Qwen3-4B时,它将目标幻觉率从9.75%降低到7.22%,并在结构困难的评论上获得了最大的提升,同时提高了部署效率。 **贡献:** * 我们识别了**结构化方面级联**,这是一种在蒸馏ABSA抽取中以目标-方面绑定和目标幻觉为中心的任务特定失败模式。 * 我们提出了**STAR-OPD**,这是针对ABSA四元组抽取的通用在策略蒸馏的一种实例化,它采用级联感知的奖励来处理绑定一致性、目标落地和方面消歧。 * 我们展示了在E-ABSA20K和SemEval-2014上,相对于策略外和通用在策略基线的一致性提升,尤其是在结构困难的案例上。 ## 2 相关工作 #### 基于方面的情感分析。ABSA已从方面级分类发展到三元组和四元组抽取。近期的基于生成和LLM的方法表现良好,但现有的四元组抽取工作并未研究多四元组评论中出现的结构依赖性和蒸馏特有的错误传播问题。 #### LLM知识蒸馏。SeqKD以策略外方式蒸馏教师输出,存在训练-测试不匹配的问题。近期的在策略方法通过优化学生生成的序列来解决此问题,包括MiniLLM、GKD和DistiLLM。后续工作进一步扩展了此框架,包括G-OPD、熵感知蒸馏和RLKD;CoT蒸馏传输推理轨迹,但尚未在结构化抽取中进行研究。然而,这些方法是为通用文本生成设计的,并优化通用序列级目标,未对四元组抽取中的字段级绑定约束或依赖结构建模。我们的方法并非提出新的通用在策略蒸馏原则,而是将这一系列方法实例化用于ABSA四元组抽取,采用集合结构、级联感知的奖励,为绑定一致性、目标落地和细粒度方面消歧提供任务特定的结构信用分配。 #### 结构化预测中的错误传播。先前关于暴露偏差和结构化预测中错误传播的研究表明,训练-推理不匹配会放大上游错误。我们将这一视角扩展到四元组抽取蒸馏中,在那里,目标-方面接口处的错误充当结构瓶颈,破坏单个四元组内的下游字段。 ## 3 问题分析 ### 3.1 任务结构与失败模式 给定评论文本 x,ABSA四元组抽取的目标是预测一组情感四元组 Q(x) = { (t_i, a_i, o_i, s_i) }_{i=1}^K,其中 t_i 是通用产品标签或评论文本中落地的目标提及,a_i ∈ C 是来自封闭分类法的细粒度方面类别,o_i 是观点片段,s_i ∈ {pos, neu, neg} 是情感极性。四元组抽取在结构上具有挑战性,因为每条评论可能包含多个元组,且字段在语义上相互依赖。在这些字段中,目标-方面接口尤为关键,因为它决定了每个元组内下游的观点和情感应如何解释。详细的标签定义、目标层次结构和数据集统计信息见附录A。 为了解蒸馏模型在此任务上的失败之处,我们在E-ABSA20K-Hard上进行了一项初步诊断比较,对比了我们强大的CoT教师模型和一个更小的直接模型。注:此处的教师是同一高质量的32B模型,后续用于伪标签生成和蒸馏;准备细节见附录D。更小的直接模型是一个未经在策略蒸馏训练的4B直接基线模型。我们发现,当评估仅考虑目标识别时,小模型已经接近教师模型(91.0% vs. 97.6%),差距仅为6.6个百分点。然而,一旦正确性要求每个目标与其方面一起保持正确时,差距急剧扩大到30.5个百分点(50.6% vs. 81.1%)。相同的模式在下游继续:当情感也必须正确时,差距进一步增加到36.1个百分点(42.5% vs. 78.6%),而完整四元组正确性对于小模型仍然低36.3个百分点(40.0% vs. 76.3%)。相对来看,小模型在仅目标识别上保留了教师性能的93.2%,但一旦要求正确的目标-方面绑定,仅保留了62.4%。这表明主要瓶颈不是目标落地本身,而是在细粒度方面模糊性下保持有效的目标-方面结构。小模型还表现出明显更高的目标幻觉率,这表明问题不仅仅是为现有目标选择了错误的方面,还包括进入了结构无效的状态,包含了捏造的、无落地依据的目标。我们将这种失败模式称为**结构化方面级联**。它以目标-方面接口为中心,主要表现为破裂的目标-方面绑定和幻觉目标。一旦进入这种无效状态,下游字段就基于错误的元组结构解释进行条件推断,即使局部情感表达仍然合理,也会降低完整四元组的正确性。第二个使用SeqKD基线的初步研究也表现出相同的模式:目标识别保持相对较强,但一旦要求目标-方面正确性,性能急剧下降,并且8.1%正确识别的目标-方面对仍然被赋予了错误的情感标签。综合来看,这些观察表明蒸馏ABSA抽取的主要失败模式不是通用的序列噪声,而是目标-方面接口处的结构破坏。以上所有值均为微平均F1,除非另有说明;详细的统计数据和指标定义见附录B。 参考图2:**STAR-OPD概览**。我们首先准备一个高质量的CoT教师模型,并生成经过过滤的四元组抽取伪标签。然后,我们让学生在策略下基于自身轨迹进行训练,使用级联感知奖励来纠正目标-方面绑定错误和幻觉目标。 ### 3.2 为何策略外蒸馏不足 策略外蒸馏在教师生成的轨迹上监督学生,而这些轨迹绝大多数是结构有效的。然而,在推理时,学生基于其自身的预测进行条件推断,可能进入包含错误的目标-方面绑定或幻觉目标的状态。因为这些学生诱导的结构状态在训练期间基本不存在,策略外模仿几乎没有提供直接信号来纠正它们。这种不匹配在ABSA四元组抽取中尤其有害,因为一个早期的结构错误会改变剩余字段的语义解释,而不仅仅是降低局部token的准确性。因此,一个有效的解决方案需要既让学生暴露于其自身的轨迹,又在元组结构层面提供反馈,尤其是在目标-方面接口周围。 ## 4 方法 ### 4.1 概述 为解决第3.2节中识别的策略外不匹配问题,我们提出了STAR-OPD,它建立在通用在策略蒸馏的基础上,通过学生轨迹训练并在元组级别应用结构化的方面级联感知奖励,特别是针对错误的目标-方面绑定和幻觉目标。在实践中,我们首先准备一个高质量的CoT教师模型用于伪标签生成和过滤,然后使用学生轨迹、反向KL蒸馏和结构感知奖励,在策略下优化学生模型,同时采用难度感知采样和回放作为轻量级稳定措施(附录D,E)。 ### 4.2 在策略级联感知蒸馏 令 π_T 表示教师策略,π_S 表示学生策略,π_ref 表示在策略更新前从学生初始化并保持冻结的参考策略。给定输入评论 x,标准策略外蒸馏仅在教师生成的轨迹上优化学生。在STAR-OPD中,遵循通用在策略蒸馏,学生在自身采样的输出 ŷ ∼ π_S(·|x) 上进行优化。这使得训练能够暴露于与推理时相同的、通常结构无效的学生诱导状态,包括错误的目标-方面绑定和幻觉目标。我们使用奖励加权的在策略蒸馏目标来优化学生: L = L_rKL + β L_ref, (1) 其中 α(x, ŷ) = w(R(x, ŷ)) 表示由奖励派生的轨迹权重,L_rKL = E_{ŷ ∼ π_S} [ α(x, ŷ) log( π_S(ŷ|x) / π_T(ŷ|x) ) ] 是加权反向KL项,L_ref = D_KL( π_S(·|x) || π_ref(·|x) ) 是防止学生偏离参考策略过远的正则化项。关键的奖励函数 R(x, ŷ) 被设计为直接针对结构化方面级联失败模式(见4.3节)。
相似文章
SAF-OPD:用于在线策略蒸馏的稳定优势融合
SAF-OPD 引入了一种稳定优势融合框架,将 RLVR 与在线策略蒸馏相结合,解决了幅度失配和时间失配问题,从而提高了数学和代码基准测试中的训练稳定性与性能。
同策略Delta蒸馏(OPD^2)
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。
β-OPSD:以策略优化推导,以自蒸馏训练
本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.