SHALA-LLM: 智能处理大模型对齐中的模糊标签

arXiv cs.LG 论文

摘要

SHALA-LLM是一个强化学习框架,使大语言模型能够直接从标注者分布中学习,并在对齐过程中动态优先处理高模糊样本,从而提升与人类标签分布的一致性及分类性能。

arXiv:2606.05376v1 公告类型:新发布 摘要:许多以人为中心的任务,包括自然语言推理(NLI)和情感识别(ER),都存在多种合理的解释,导致标签模糊性及标注者之间的分歧。随着大语言模型在现实场景中的广泛应用,准确建模这种模糊性对于识别有争议的输入、保留模糊情况下的多样性以及捕捉人类判断的完整分布至关重要。然而,现有的大语言模型对齐方法大多假设存在单一正确标签,在优化过程中排除了标注者分歧。我们并未将这种模糊性视为噪声,而是展示如何通过一种名为SMARTLY HANDLING AMBIGUOUS LABELS IN ALIGNING LLMS(SHALA-LLM)的新算法将其视为改善模型行为的信息。该强化学习框架提供了一种新方式,使大语言模型能够直接从标注者分布中学习,同时在优化过程中动态优先处理高模糊样本。在混沌NLI、GoEmotions和MSP-Podcast等对模糊性敏感的NLI和ER基准上的实验表明,SHALA-LLM提升了与标注者标签分布的一致性,例如在混沌NLI上,它将杰森-香农距离降低了多达62.1%。同时,SHALA-LLM将F1分数提升了多达16.7%,表明建模标注者分歧也能增强分类性能。
查看原文
查看缓存全文

缓存时间: 2026/06/05 08:10

# SHALA-LLM:智能处理对齐大语言模型中的模糊标签

**来源:** https://arxiv.org/html/2606.05376

Jingyao Wu¹†††Equal contribution., Ashley Wang¹¹†, Keane Ong¹,², Paul Pu Liang¹, Rosalind W. Picard¹

¹MIT Media Lab, Massachusetts Institute of Technology
²National University of Singapore

{jingyaow, ashley25, keaneong, ppliang}@mit.edu
[email protected]

###### 摘要

许多以人为中心的任务,包括自然语言推理(NLI)和情感识别(ER),存在多种合理的解释,导致标签模糊性和跨人工标注者的分歧。随着大语言模型(LLM)越来越多地部署在真实世界场景中,忠实地建模这种模糊性对于识别存在争议的输入、保留模糊情况下的变异性以及捕捉人类判断的完整分布至关重要。然而,现有的LLM对齐方法主要假设存在单一的正确标签,在优化过程中排除了标注者分歧。我们不将这种模糊性视为噪音,而是将其视为信息,并通过一种新算法——智能处理对齐大语言模型中的模糊标签(SHALA-LLM)——来改进模型行为。这种强化学习框架为LLM提供了一种新方法,可以直接从标注者分布中学习,同时在优化过程中动态优先处理高度模糊的样本。在模糊敏感的NLI和ER基准测试(包括ChaosNLI、GoEmotions和MSP-Podcast)上的实验表明,SHALA-LLM提高了与标注者标签分布的一致性,例如在ChaosNLI上,它将Jensen–Shannon距离减少了高达62.1%。同时,SHALA-LLM将F1分数提高了高达16.7%,表明建模标注者分歧也能增强分类性能¹¹代码将在发表后提供。

SHALA-LLM:智能处理对齐大语言模型中的模糊标签

Jingyao Wu¹†††Equal contribution., Ashley Wang¹¹†, Keane Ong¹,², Paul Pu Liang¹, Rosalind W. Picard¹

¹MIT Media Lab, Massachusetts Institute of Technology
²National University of Singapore

{jingyaow, ashley25, keaneong, ppliang}@mit.edu
[email protected]

## 1 引言

在许多以人为中心的任务中,不同个体可能根据上下文理解、个人经验、文化背景或情感感知对相同的文本、语音或交互做出不同解释 (Uma et al., 2021 (https://arxiv.org/html/2606.05376#bib.bib43))。这种现象在自然语言推理(NLI)(Nie et al., 2020 (https://arxiv.org/html/2606.05376#bib.bib11); Chen et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib12))和情感识别(ER)(Sethu et al., 2019 (https://arxiv.org/html/2606.05376#bib.bib40); Wu et al., 2026 (https://arxiv.org/html/2606.05376#bib.bib22))中尤其常见,导致跨人工标注者的分歧,并使大语言模型(LLM)的对齐复杂化。大多数现有的LLM对齐范式将分歧视为标注噪音,通过多数投票、标签平均或假设单一黄金标准的校准方法,将模糊标注压缩成单一目标标签 (Radharapu et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib44))。这样做,它们丢弃了嵌入在人工标注中的分歧,尤其是在标注者不确定性和冲突判断突出的高度模糊环境中 (Baan et al., 2022 (https://arxiv.org/html/2606.05376#bib.bib15))。

尽管最近的研究探索了LLM中的分布式和多元化对齐,包括不确定性感知的分布引出以及与多样化的人类观点或偏好对齐 (Sorensen et al., 2024 (https://arxiv.org/html/2606.05376#bib.bib45); Meister et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib46)),但它们主要在推理时通过提示或分布估计来操作,而不是在训练期间直接利用标注者分歧优化LLM,从而限制了高度模糊环境下的学习动态和模型适应能力 (Baan et al., 2022 (https://arxiv.org/html/2606.05376#bib.bib15))。

在本文中,我们提出了SHALA-LLM:智能处理对齐大语言模型中的模糊标签,这是一个新的模糊感知分布对齐框架,可以直接在模糊监督下从人类分歧中学习。SHALA-LLM根据标注者分歧的程度动态重新加权rollout奖励,使得包含更丰富分歧结构的高度模糊样本在学习过程中发挥更大影响力,同时保持与模糊监督下人类判断的潜在分布对齐。在模糊敏感的NLI和ER基准测试(包括ChaosNLI (Nie et al., 2020 (https://arxiv.org/html/2606.05376#bib.bib11))、GoEmotions (Demszky et al., 2020 (https://arxiv.org/html/2606.05376#bib.bib20))和MSP-Podcast (Busso et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib21)))上的评估表明,与多数标签监督相比,SHALA-LLM持续改善了分布对齐和分类结果。在ChaosNLI上,SHALA-LLM将Jensen-Shannon距离(JSD)减少了62.1%,同时将F1提高了16.6%;在MSP-Podcast上,SHALA-LLM将JSD减少了6.2%,并将F1提高了29.2%。系统分析表明,SHALA-LLM在高度模糊条件下表现出更强的鲁棒性,对本质上模糊的语义类别提供特别强的益处,并鼓励更能反映不确定性以及在模糊监督下多种合理解释的推理行为。这表明,保留分歧结构能够使LLM在模糊性下表现出更鲁棒且更符合人类的行为。

## 2 相关工作

##### 自然语言处理中的模糊性建模。来自多个标注者的以人为本任务的标注可能存在分歧,这反映了重要信息 (Aroyo and Welty, 2015 (https://arxiv.org/html/2606.05376#bib.bib16); Davani et al., 2022 (https://arxiv.org/html/2606.05376#bib.bib10); Chen et al., 2024b (https://arxiv.org/html/2606.05376#bib.bib17); Plank, 2022 (https://arxiv.org/html/2606.05376#bib.bib28))。这一现象已在多个领域得到研究,包括自然语言推理(NLI)等语义推理任务 (Jayaweera and Dorr, 2025 (https://arxiv.org/html/2606.05376#bib.bib14); Pavlick and Kwiatkowski, 2019 (https://arxiv.org/html/2606.05376#bib.bib23))以及情感识别和情感计算等主观感知任务 (Niu et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib51); Chou et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib26); Wu et al., 2024b (https://arxiv.org/html/2606.05376#bib.bib41); Sethu et al., 2019 (https://arxiv.org/html/2606.05376#bib.bib40))。研究人员越来越认识到解决标注模糊性的重要性,先前的工作在类别化表示设置(如NLI和离散ER)中研究了软标签监督 (Wu et al., 2026 (https://arxiv.org/html/2606.05376#bib.bib22); Fard et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib52))、多标签公式 (Ando et al., 2019 (https://arxiv.org/html/2606.05376#bib.bib36); Ju et al., 2020 (https://arxiv.org/html/2606.05376#bib.bib37))以及分歧感知学习方法 (Chou and Lee, 2019 (https://arxiv.org/html/2606.05376#bib.bib50))。在连续情感预测设置中,其他人探索了高斯分布 (Han et al., 2017 (https://arxiv.org/html/2606.05376#bib.bib33))、Beta分布 (Bose et al., 2024 (https://arxiv.org/html/2606.05376#bib.bib34); Wu et al., 2024a (https://arxiv.org/html/2606.05376#bib.bib42))和非参数标签分布 (Wu et al., 2022 (https://arxiv.org/html/2606.05376#bib.bib35))。然而,这些方法主要针对传统的监督学习开发,而LLM对齐需要进一步发展。

**参见图注**

图1:提出的SHALA-LLM概述:智能处理对齐大语言模型中的模糊标签。给定模糊敏感任务(如NLI和ER)(a),来自多个标注者的标注被聚合为经验标签分布。SHALA-LLM提示LLM对候选类别的概率分布进行语言化表达(b-a),这些分布通过SHALA奖励直接与标注者分布对齐(b-b)。在GRPO优化过程中,根据标注者分歧动态重新加权rollout奖励(b-c),从而产生能够更好捕捉模糊监督下不确定性和多样化人类解释的分布(b-d)。

##### 针对模糊标签的LLM对齐。随着LLM在以人为中心的应用中扩展使用,它们越来越多地遇到模糊标签。为此,最近的研究开始分析LLM在标注者分歧和主观监督设置下的行为 (Lu et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib18); Jia et al., 2026 (https://arxiv.org/html/2606.05376#bib.bib19))。相关努力探索了模糊感知的指令微调 (Hong et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib27))、软标签监督 (Mostafazadeh Davani et al., 2022 (https://arxiv.org/html/2606.05376#bib.bib9); Chen et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib12), 2024a (https://arxiv.org/html/2606.05376#bib.bib13))、分布对齐 (Meister et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib46))和分歧感知的对齐策略 (Baan et al., 2022 (https://arxiv.org/html/2606.05376#bib.bib15)),以更好地将LLM输出与人类判断的分布对齐。针对对齐的模糊标签智能处理仍有待扩展到强化学习推理方法,如组相对策略优化(GRPO)(Shao et al., 2024 (https://arxiv.org/html/2606.05376#bib.bib8))。

## 3 提出的 SHALA-LLM 框架

### 3.1 问题概述

图 1 (https://arxiv.org/html/2606.05376#S2.F1) 概述了我们的问题。我们考虑人类主观任务(图 1 (https://arxiv.org/html/2606.05376#S2.F1) a),其中标注源自人类感知、解释和意见。标签从多个标注者收集,我们将它们之间出现的模糊性视为信息,而非噪音。假设从 NN 个标注者收集的样本 qq 的标签表示为:

{l(q,1),l(q,2),...,l(q,N)},\{l_{(q,1)}, l_{(q,2)}, \dots, l_{(q,N)}\}, (1)

其中每个 l(q,i)∈{1,...,C}l_{(q,i)} \in \{1, \dots, C\} 对应于 CC 个候选类别之一。我们不将标注压缩为单一多数标签,而是推导出基于标注者判断的**经验标签分布**,作为监督信号:

p(q,c)=n(q,c)N,c=1,...,C,∑c=1Cp(q,c)=1,p_{(q,c)} = \frac{n_{(q,c)}}{N}, \quad c=1,\dots,C, \quad \sum_{c=1}^{C} p_{(q,c)} = 1, (2)

其中 n(q,c)n_{(q,c)} 表示将类别 cc 分配给样本 qq 的标注者数量,而 p(q)∈RC\mathbf{p}_{(q)} \in \mathbb{R}^{C} 表示相应的标注者分布。给定输入样本 xqx_{q},LLM 生成一个采样的文本响应 o(q,i)o_{(q,i)},其中包含对候选标签空间的预测概率:

p^(q,i)=[p^(q,i),1,p^(q,i),2,...,p^(q,i),C].\hat{\mathbf{p}}_{(q,i)} = [\hat{p}_{(q,i),1}, \hat{p}_{(q,i),2}, \dots, \hat{p}_{(q,i),C}]. (3)

p^(q,i),c=P(y^=c∣xq,o(q,i)).\hat{p}_{(q,i),c} = P(\hat{y}=c \mid x_{q}, o_{(q,i)}). (4)

我们在基于奖励的优化框架(图 1 (https://arxiv.org/html/2606.05376#S2.F1) b)中制定学习目标。我们的目标不是优化至单一压缩标签,而是**鼓励生成的预测更好地与人类解释的潜在分布对齐**。基于此公式,我们开发了 SHALA-LLM,使 LLM 能够在模糊的人工标注下直接从标注者分布中学习。我们采用 GRPO (Shao et al., 2024 (https://arxiv.org/html/2606.05376#bib.bib8)) 作为优化骨干,因为它在奖励设计方面具有灵活性以及在 LLM 对齐中的有效性。该公式允许将模糊标签的智能处理自然地融入基于奖励的学习中。

### 3.2 来自LLM的语言化分布

为了从LLM获得分布输出,我们采用语言化分布预测公式(图 1 (https://arxiv.org/html/2606.05376#S2.F1) .b-a),其中模型直接以文本形式生成对候选类别的概率估计。这种语言化分布已被证明能为LLM提供一种有效的机制,用于引出不确定性感知的预测 (Radharapu et al., 2025 (https://arxiv.org/html/2606.05376#bib.bib44))。来自输入样本 xqx_{q} 的采样文本响应 o(q,i)o_{(q,i)} 被表示为对候选类别的语言化分布:

o(q,i)={(c1,p^(q,i),1),...,(cC,p^(q,i),C)},o_{(q,i)} = \{(c_{1}, \hat{p}_{(q,i),1}), \dots, (c_{C}, \hat{p}_{(q,i),C})\}, (5)

其中 p^(q,i),c\hat{p}_{(q,i),c} 表示在 rollout o(q,i)o_{(q,i)} 中分配给候选类别 cc 的预测概率。所得到的概率估计随后被解析为公式 (3) (https://arxiv.org/html/2606.05376#S3.E3) 中定义的预测标签分布 p^(q,i)\hat{\mathbf{p}}_{(q,i)}。

### 3.3 组相对策略优化

我们将参数化为 θ\theta 的LLM视为策略模型 πθ(a∣s)\pi_{\theta}(a \mid s),其中 ss 表示输入提示,a 表示生成的输出。遵循 GRPO (Shao et al., 2024 (https://arxiv.org/html/2606.05376#bib.bib8)),对于每个样本 qq,生成一个 rollout 组 G(q)G_{(q)},包含多个采样的输出 {o(q,i)}\{o_{(q,i)}\},其中 i∈G(q)i \in G_{(q)} 索引单个 rollout,并带有相应的奖励 r(q,i)r_{(q,i)}。然后 GRPO 计算组归一化的优势值:

A^(q,i)=r(q,i)−μ^G(q)σ^G(q)+ε\hat{A}_{(q,i)} = \frac{r_{(q,i)} - \hat{\mu}_{G_{(q)}}}{\hat{\sigma}_{G_{(q)}} + \varepsilon} (6)

其中 μ^G(q)\hat{\mu}_{G_{(q)}} 和 σ^G(q)\hat{\sigma}_{G_{(q)}} 是 {r(q,i)}i=1|G(q)|\{r_{(q,i)}\}_{i=1}^{|G_{(q)}|} 的均值和标准差。利用从 A^(q,i)\hat{A}_{(q,i)} 构建的 PPO 裁剪替代项 A~(q,i):k(θ)\tilde{A}_{(q,i):k}(\theta),GRPO 随后使用 PPO 风格的信任区域目标优化 πθ(a∣s)\pi_{\theta}(a \mid s)²²GRPO的完整公式见附录A (https://arxiv.org/html/2606.05376#A1)。:

JGRPO(θ)\displaystyle J_{\mathrm{GRPO}}(\theta)=E(q)∼DE{o(q,i)}∼πθold[1|G(q)|∑i∈G(q)\displaystyle = \mathbb{E}_{(q)\sim\mathcal{D}}\mathbb{E}_{\{o_{(q,i)}\}\sim\pi_{\theta_{\mathrm{old}}}} \! \Bigg[ \frac{1}{|G_{(q)}|} \sum_{i \in G_{(q)}} (7)

1no(q,i)∑k=1no(q,i)A~(q,i):k(θ)]−βE[DKL(πθ∥πref)]\displaystyle \hskip -60.0pt \phantom{=\mathbb{E}\Bigg[} \frac{1}{n_{o_{(q,i)}}} \sum_{k=1}^{n_{o_{(q,i)}}} \tilde{A}_{(q,i):k}(\theta) \Bigg] \;-\; \beta\,\mathbb{E}\! \left[ D_{\mathrm{KL}}\!\left( \pi_{\theta}\;\|\;\pi_{\mathrm{ref}} \right) \right]

### 3.4 SHALA 奖励

我们的假设是,模糊样本通常包含能提供关于细微差别、解释多样性、不确定性和冲突人类感知的信息性信号的分歧结构。我们提出了一种利用此假设改进LLM对齐的新颖方法:SHALA-LLM,并描述了其在GRPO内基于奖励的优化算法。SHALA-LLM包含两个关键组成部分:

相似文章

LLM-as-Judge的几何学:为何LLM间共识并非人类对齐

arXiv cs.CL

本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。

从提示到行为对齐:用于推荐评估的个性化LLM评判器

arXiv cs.AI

本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。