VA-DPO: 用于语言模型中可控情感生成的效价-唤醒直接偏好优化
摘要
本文提出了VA-DPO,一种使用连续效价-唤醒维度在语言模型中进行可控情感生成的方法,它在不降低模型性能的前提下改进了提示技术。
arXiv:2608.20374v1 公告类型:新
摘要:我们能多么精确地告诉语言模型如何感受?大多数情感生成工作使用离散标签如快乐、愤怒、悲伤来回答,但无法表达像'轻微沮丧但平静'这样的目标。相反,我们将期望的情感指定为效价-唤醒平面上的一个连续点 (v*, a*),并训练模型以达到它。我们的方法VA-DPO是对直接偏好优化的一个小改进:一个冻结的效价-唤醒回归器根据每个采样生成与目标的欧几里得距离进行评分,我们只保留距离间隔超过阈值τ的候选对,并使用普通DPO损失针对冻结参考优化LoRA适配器。DPO目标本身未变;新的是偏好数据的构建方式。在Llama-3.1-8B-Instruct上,这比系统提示减少了33%的平均效价-唤醒距离,比少样本提示减少了25%,将效价/唤醒相关性提高到r_v=0.93和r_a=0.75。这些收益也适用于Qwen3-8B和Llama-3.2-3B,并且没有以通常的代价出现:MMLU未变(Delta=+0.0),HellaSwag和TruthfulQA得以保持。我们发布了代码、配置和偏好构建管道。
查看缓存全文
缓存时间: 2026/08/24 04:15
# 用于语言模型可控情感生成的效价-唤醒直接偏好优化
来源:https://arxiv.org/html/2608.20374
###### 摘要
我们究竟能多精确地告诉语言模型*该*如何感受?大多数关于情感生成的研究使用离散标签来回答——快乐、愤怒、悲伤——这些无法表达诸如“略带忧郁但平静”这样的目标状态。我们改用效价-唤醒平面 [13 (https://arxiv.org/html/2608.20374#bib.bib13)] 中的一个连续点 \((v^\star,a^\star)\) 来指定所需情感状态,并训练模型去达到它。我们的方法 VA-DPO 是对直接偏好优化 [12 (https://arxiv.org/html/2608.20374#bib.bib12)] 的一个微小修改:一个冻结的效价-唤醒回归器通过每个采样生成与目标的欧氏距离来评分;我们只保留距离差超过边距 \(\tau\) 的候选对;我们使用针对冻结参考模型的普通 DPO 损失来优化 LoRA 适配器 [7 (https://arxiv.org/html/2608.20374#bib.bib7)]。DPO 目标本身未改变;新颖之处在于偏好数据的构建方式。在 Llama-3.1-8B-Instruct 上,该方法将平均效价-唤醒距离相比系统提示降低了 33%,相比少样本提示降低了 25%,并将效价/唤醒相关性提升至 \(r_{v}=0.93\) 和 \(r_{a}=0.75\)。这些改进同样适用于 Qwen3-8B 和 Llama-3.2-3B,并且并未带来通常的代价:MMLU 保持不变 (\(\Delta=+0.0\)),HellaSwag/TruthfulQA 得以保留。我们开源了代码、配置文件以及偏好构建流程。
## 1 引言
共情对话智能体、叙事协作工具和情感感知 TTS 前端都需要同一件事:一种不仅能说明模型*应该*写什么,还能指定*以何种情感基调*来写的方法 [5 (https://arxiv.org/html/2608.20374#bib.bib5), 3 (https://arxiv.org/html/2608.20374#bib.bib3)]。NLP 中的常规做法是使用来自少数类别的离散标签——快乐、愤怒、悲伤等。然而,心理学描述情感的方式通常并非如此。Russell [13 (https://arxiv.org/html/2608.20374#bib.bib13)] 用两个连续轴建模情感:*效价*(正面-负面)和*唤醒度*(平静-激动),这种环状模型现已成为情感计算领域的标准。分类标签无法区分“轻微忧郁且平静”与“深度忧郁且烦躁”;它抹平了情感强度以及命名情感之间的空间。简单的替代方案也不完全奏效。指示模型“快乐地回应”或向其展示几个情感样例,可以提供一定的控制力,但效果在不同提示间不均衡,且会在对话过程中衰减 [3 (https://arxiv.org/html/2608.20374#bib.bib3)]。RLHF 可能缩小差距,但它需要重新引入一个独立的奖励模型及其所有脆弱性。直接偏好优化 [12 (https://arxiv.org/html/2608.20374#bib.bib12)] 避免了这一点:它将奖励融入策略自身的对数比中,并直接在偏好对 \((y_w, y_l)\) 上进行训练,其中 \(y_w\) 是被偏好的。DPO 通常应用于二元人类偏好,但其 Bradley-Terry 基础 [1 (https://arxiv.org/html/2608.20374#bib.bib1)] 并不关心排序来源——任何对两个输出进行排序的标量效用都可以。这正是我们利用的切入点。给定连续目标 \((v^\star,a^\star) \in [-1,+1]^2\) 和一个冻结的效价-唤醒回归器 \(R\),我们通过候选生成 \(y\) 的预测情感与目标的距离 \(d(y;v^\star,a^\star)=\lVert R(y)-(v^\star,a^\star)\rVert_2\) 来评分,并通过此距离对候选进行排序来形成偏好对。有两个选择将我们的流程与朴素的“软标签 DPO”区分开来:
1. 1\. 边距阈值配对选择。我们只保留满足 \(\|d(y_w)-d(y_l)\|>\tau\) 的配对。接近平局的配对会引入无信息梯度的标签噪声;该阈值将更新集中在回归器空间中排序明确的配对上。
2. 2\. 双层正则化。我们仅对 LoRA 适配器 [7 (https://arxiv.org/html/2608.20374#bib.bib7)] 应用 DPO,保持基础模型和所有参考模型权重冻结。结合 DPO 的 \(\beta\)-KL 锚点,这提供了两个独立的正则化控制:结构性(低秩更新)和分布性(与参考模型的 KL 距离)。
简而言之,我们的贡献包括:一个用于效价-唤醒空间的连续奖励 DPO 配方,带有明确的配对构建规则(§3 (https://arxiv.org/html/2608.20374#S3));一项对照比较,分离出*哪个*成分起关键作用,对比系统提示、少样本提示、监督微调和离散标签 DPO,以及一项无边距消融实验;一项保留研究(MMLU, HellaSwag, TruthfulQA),表明控制能力的提升并非以降低通用能力为代价。
## 2 相关工作
#### 维度情感模型与语料库。Russell [13 (https://arxiv.org/html/2608.20374#bib.bib13)] 奠定了情感的二维观点。EmoBank [2 (https://arxiv.org/html/2608.20374#bib.bib2)] 提供了约 10K 个带有读者和作者视角人类效价-唤醒-支配度 (VAD) 标注的英语句子。我们使用 EmoBank 的训练集来拟合我们的回归器,测试集用于所有报告的指标。NRC VAD 词典 [11 (https://arxiv.org/html/2608.20374#bib.bib11)] 提供了约 20K 个英语单词的 VAD 分数,是我们词典奖励基线(下文 B4)的基础。
#### 偏好优化。DPO [12 (https://arxiv.org/html/2608.20374#bib.bib12)] 将 RLHF 重新表述为针对冻结参考模型的闭式策略更新,消除了对学习奖励模型的需求。存在多种变体——IPO、KTO 等——改变了损失公式;我们刻意保持标准 DPO 目标不变,仅修改*配对构建*步骤,以隔离连续排序和边距过滤的贡献。
#### 生成模型中的情感控制。Gao 等人 [5 (https://arxiv.org/html/2608.20374#bib.bib5)] 将 DPO 应用于可控情感语音合成,在语音端对比偏好的和不偏好的情感类别。他们的设置是离散的且属于音频模态;我们的方法是文本模态且连续的。Konen 等人 [8 (https://arxiv.org/html/2608.20374#bib.bib8)] 推导出用于情感/情感转向的激活空间“风格向量”,在推理时无需训练。这种免训练方法很吸引人,但依赖于向隐藏状态添加固定偏移量;其效果难以定量校准以达到目标 \((v^\star,a^\star)\)。Fazzi 等人 [3 (https://arxiv.org/html/2608.20374#bib.bib3)] 表明,LLMs 难以在多轮对话中维持极端或变化的情感状态,这说明需要微调而不仅仅是提示控制。Sun 等人 [14 (https://arxiv.org/html/2608.20374#bib.bib14)] 证明 LLM 内部表征已经将情感组织在一个近似圆形的效价-唤醒子空间中,并且沿着这些轴进行转向会单调地改变输出的情感;这验证了我们奖励背后的几何假设,也是我们计划纳入的最接近的免训练比较点(B6)。
## 3 方法
### 3.1 问题设定
设 \(x\) 为输入提示,\((v^\star,a^\star) \in [-1,+1]^2\) 为效价-唤醒平面中的目标。我们寻求一个生成策略 \(\pi_{\theta}(y \mid x, v^\star, a^\star)\),其输出在由固定回归器 \(R:\mathcal{Y}\to[-1,+1]^2\) 评分时,具有较小的距离
\[d(y;v^\star,a^\star)=\lVert R(y)-(v^\star,a^\star)\rVert_2,\]
同时保持为对 \(x\) 流畅、符合分布的响应。我们通过将 \((v^\star,a^\star)\) 格式化为追加到提示后的文本前缀来使策略以目标为条件(§4 (https://arxiv.org/html/2608.20374#S4))。
### 3.2 连续奖励与配对构建
我们将 \(-d(y;v^\star,a^\star)\) 视为标量效用。对于训练池中的每个 \((x,v^\star,a^\star)\),我们从基础策略的采样分布中抽取 \(N\) 个候选完成 \(\{y^{(1)},\ldots,y^{(N)}\}\)(温度 \(T\),从参考模型中进行核采样;我们使用参考模型,以便候选集独立于后续 DPO 更新,并可被缓存)。每个候选用 \(R\) 评分一次。为了形成偏好对,我们列举所有 \(\binom{N}{2}\) 个无序对,并保留满足
\[\bigl\|d(y^{(i)};v^\star,a^\star)-d(y^{(j)};v^\star,a^\star)\bigr\| > \tau\]
的配对,将距离较小的成员标记为胜者 \(y_w\),较大的标记为败者 \(y_l\)。超参数 \(\tau \in \mathbb{R}_{\geq 0}\) 是*边距阈值*。设 \(\tau=0\) 可恢复朴素变体(B5),其中每个非平局配对都成为训练样本;正的 \(\tau\) 会丢弃排序受回归器噪声主导的近似平局配对。我们在 \(\{0,0.1,0.2,0.3,0.5\}\) 中调整 \(\tau\)(§5 (https://arxiv.org/html/2608.20374#S5))。
### 3.3 训练目标
给定过滤后的配对集 \(\mathcal{D}_{\mathrm{pref}}=\{(x_i, v_i^\star, a_i^\star, y_{w,i}, y_{l,i})\}\),我们优化标准 DPO 损失 [12 (https://arxiv.org/html/2608.20374#bib.bib12)]:
\[\mathcal{L}_{\mathrm{DPO}}(\theta)=-\mathbb{E}_{\mathcal{D}_{\mathrm{pref}}}\Big[\log\sigma\Big(\beta\log\frac{\pi_{\theta}(y_{w}\mid x,v^\star,a^\star)}{\pi_{\mathrm{ref}}(y_{w}\mid x,v^\star,a^\star)}-\beta\log\frac{\pi_{\theta}(y_{l}\mid x,v^\star,a^\star)}{\pi_{\mathrm{ref}}(y_{l}\mid x,v^\star,a^\star)}\Big)\Big],\]
其中 \(\sigma(\cdot)\) 是逻辑 sigmoid 函数,\(\pi_{\mathrm{ref}}\) 是基础模型的冻结副本。只有 \(\pi_{\theta}\) 上的 LoRA 适配器权重 [7 (https://arxiv.org/html/2608.20374#bib.bib7)] 接收梯度;在整个 DPO 训练过程中,基础模型、参考模型和回归器 \(R\) 均保持冻结。
算法 1 VA-DPO 训练(对提示池的一次外部遍历)
1: 提示池 \(\mathcal{P}\);目标效价-唤醒分布 \(p(v^\star,a^\star)\);参考模型 \(\pi_{\mathrm{ref}}\);回归器 \(R\);\(N, T, \tau, \beta\)。
2: \(\mathcal{D}_{\mathrm{pref}} \leftarrow \emptyset\)
3: 对于每个 \(x \in \mathcal{P}\),从 \(p(v^\star,a^\star)\) 中采样 \((v^\star,a^\star)\),执行:
4: 从 \(\pi_{\mathrm{ref}}(\cdot \mid x,v^\star,a^\star)\) 中以温度 \(T\) 采样 \(\{y^{(k)}\}_{k=1}^N\)
5: 对于 \(k=1,\ldots,N\),计算 \(d^{(k)} \leftarrow \lVert R(y^{(k)})-(v^\star,a^\star)\rVert_2\)
6: 对于每个满足 \(\|d^{(i)}-d^{(j)}\| > \tau\) 的配对 \((i,j)\),执行:
7: \((y_w, y_l) \leftarrow\) 按 \(d\) 升序排序的配对
8: 将 \((x,v^\star,a^\star,y_w,y_l)\) 添加到 \(\mathcal{D}_{\mathrm{pref}}\)
9: 结束循环
10: 结束循环
11: 在 \(\mathcal{D}_{\mathrm{pref}}\) 上最小化公式 (3) 来训练 LoRA 适配器 \(\theta\)
12: 返回适配器权重 \(\theta\)
#### 新颖与非新颖之处。公式 (3) 是标准的 DPO 损失;我们并未修改它。我们的贡献在于从连续标量(公式 (1))*构建* \(\mathcal{D}_{\mathrm{pref}}\),并带有明确的边距过滤器(公式 (2)),以及回归器 vs. 词典和边距开/关的消融实验,这些隔离了每个设计选择(§5 (https://arxiv.org/html/2608.20374#S5))。
## 4 实验设置
#### 基础模型。主要模型:meta-llama/Llama-3.1-8B-Instruct [6 (https://arxiv.org/html/2608.20374#bib.bib6)]。稳健性检查 #1:Qwen/Qwen3-8B [15 (https://arxiv.org/html/2608.20374#bib.bib15)]。稳健性检查 #2:meta-llama/Llama-3.2-3B-Instruct。三者均为开源、指令微调、具备英语能力的稠密模型。我们刻意将主要模型和稳健性 #1 的骨干与最接近的先前关于 LLM 效价-唤醒几何结构的工作 [14 (https://arxiv.org/html/2608.20374#bib.bib14)] 所用的保持一致,以便我们训练的策略与其免训练转向结果(我们的 B6 基线)在*完全相同的权重*上操作并可进行头对头比较。稳健性 #2 与 Fazzi 等人 [3 (https://arxiv.org/html/2608.20374#bib.bib3)] 中的 Llama 系列 3B 条件相匹配,证明了该方法可在不同系列(Llama↔Qwen)和规模(8B↔3B)之间迁移。每个 8B 消融单元在单块 NVIDIA H100 80 GB GPU 上以全 bfloat16(无量化)运行约 1-2 小时完成,每个 3B 单元约 30 分钟完成。
#### 奖励回归器。一个 RoBERTa-large [9 (https://arxiv.org/html/2608.20374#bib.bib9)] 编码器,带有一个二维线性回归头,在 EmoBank [2 (https://arxiv.org/html/2608.20374#bib.bib2)] 训练集上微调了 5 个周期,使用 MSE 损失,并在将人类 VAD 评分从 [1,5] 重新缩放为 \([-1,+1]\) 后进行训练(通过 \(x'=(x-3)/2\))。我们报告了回归器自身在 EmoBank 验证集上的 CCC 和 Pearson \(r\)(§5 (https://arxiv.org/html/2608.20374#S5)),以便审稿人校准信号质量。回归器权重在整个偏好构建和 DPO 训练期间保持冻结。
#### 条件格式。目标以 `[VA: v*=, a*=]` 的形式前置到提示中。这使条件完全基于文本且可复现,代价是每个样本固定增加 4-6 个 token 开销。
#### 超参数范围(已搜索)。\(\beta \in \{0.05, 0.1, 0.2, 0.5\}\),\(\tau \in \{0.0, 0.1, 0.2, 0.3, 0.5\}\),LoRA 秩 \(r \in \{4, 8, 16, 32\}\) 且 \(\alpha=2r\),学习率 \(\in \{1,5\} \times 10^{-5} \cup \{1 \times 10^{-4}\}\),批大小 8-32(通过梯度累积实现有效批大小)。优化器:AdamW [10 (https://arxiv.org/html/2608.20374#bib.bib10)],LoRA 参数解耦权重衰减为 0。候选生成温度:\(T=0.9\)。每个提示的候选数:\(N \in \{4,8\}\)。所有未搜索的设置见附录 A (https://arxiv.org/html/2608.20374#A1)。
#### 基线。B0:基础模型,系统提示为“*以效价 \(v^\star\) 和唤醒度 \(a^\star\) 回应*”。B1:B0 + 4 个上下文示例。B2:在 \((x, v^\star, a^\star, y)\) 三元组上进行监督微调,其中 \(y\) 是 EmoBank 参考句子(LoRA,与我们相同秩)。B3:DPO,将效价-唤醒分为 4 个象限(\(v^\star\) 和 \(a^\star\) 的符号)。B5:\(\tau=0\) 的 VA-DPO(无边距过滤)。另外两个基线已定义但未在本版本中运行:B4(使用 NRC VAD 词典 [11 (https://arxiv.org/html/2608.20374#bib.bib11)] 而非回归器作为奖励的 VA-DPO)和 B6(免训练的效价-唤醒转向,参考 Sun 等人 [14 (https://arxiv.org/html/2608.20374#bib.bib14)] 的精神);我们将它们作为未来比较进行讨论。
#### 评估。主要指标:平均欧氏效价-唤醒距离 \(\bar{d}=\frac{1}{|\mathcal{T}|}\sum_{(x,v^\star,a^\star)\in\mathcal{T}}\lVert R(y)-(v^\star,a^\star)\rVert_2\)。相似文章
通过潜在向量引导的可控情感生成
本文提出EmoVec,一个轻量级框架,通过潜在向量引导在大型语言模型中实现可控情感生成,无需更新模型权重即可实现对情感强度的连续控制。
面向聊天机器人微调的直接偏好优化:一项实证研究
本文对直接偏好优化(DPO)在大型语言模型微调中的应用进行了实证研究,表明DPO简化了训练流程,在实现竞争性性能的同时,也解决了训练不稳定性问题。
TD-DPO: 差异感知偏好优化在临床自闭症干预对话中缓解谄媚行为
本文提出TD-DPO,一种令牌级差异感知偏好优化方法,用于缓解临床自闭症干预对话中大语言模型的谄媚行为,在减少谄媚行为和保持干预能力之间实现了更好的权衡。
Data-DPO: 用于LLM后训练中目标模型数据选择的直接偏好优化
Data-DPO是一种面向目标模型的LLM监督微调数据选择方法,通过单步探测学习数据偏好,并结合质量分数和多样性,在Vision-Flan和LLaVA-CoT数据集上超越了基线方法。
EmoDistill: 对抗性谈判中语言模型智能体的离线情感技能蒸馏
EmoDistill是一个离线框架,通过隐式Q学习进行情感选择,并基于LoRA的监督微调和评判策略优化进行情感表达,从而将情感谈判技能蒸馏到语言模型智能体中,在对抗性谈判中实现更高的效用。