通过潜在向量引导的可控情感生成

arXiv cs.CL 论文

摘要

本文提出EmoVec,一个轻量级框架,通过潜在向量引导在大型语言模型中实现可控情感生成,无需更新模型权重即可实现对情感强度的连续控制。

arXiv:2608.25569v1 Announce Type: new 摘要:大型语言模型(LLMs)在对齐后常产生情感平淡的响应,限制了其在情感敏感应用中的有效性。本文提出EmoVec,一个轻量级框架,通过潜在向量引导实现可控情感生成。EmoVec使用对比激活添加从配对的中立和情感条件响应中提取特定情感方向,并通过任务特定去偏和主子空间去除进一步优化它们。在推理过程中,这些向量通过静态或场景自适应缩放注入到最终残差流中,无需更新模型权重即可实现对情感强度的连续控制。在三种LLMs和八种情感上的实验表明,EmoVec在基本保留语义内容、流畅性和连贯性的同时,持续提高情感显著性。消融研究和人类评估进一步证实了向量净化和自适应缩放的有效性,确立了EmoVec作为部署LLMs中情感控制的实用推理时方法。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:22

# 通过潜在向量引导实现可控情感生成
来源:https://arxiv.org/html/2608.25569

**Xixian Yong**  
隶属机构:中国人民大学高瓴人工智能学院  
邮箱:[[email protected]](mailto:)

**Siyuan Chang**  
隶属机构:中国人民大学高瓴人工智能学院  
邮箱:[[email protected]](mailto:)

**Xian Wu**††  
*††*通讯作者:周潇、吴健。  
隶属机构:腾讯杰瑞实验室

**Xiao Zhou**††  
*††*  
隶属机构:中国人民大学高瓴人工智能学院  
隶属机构:北京大模型与智能治理重点实验室  
隶属机构:教育部下一代智能搜索与推荐工程研究中心

###### 摘要
大型语言模型(LLMs)在对齐后常产生情感平淡的响应,限制了其在情感敏感应用中的效果。本文提出 EmoVec,一个通过潜在向量引导实现可控情感生成的轻量级框架。EmoVec 利用对比激活加法从成对的中性与情感条件响应中提取情感特定方向向量,并通过任务特定去偏和主子空间移除进一步提纯。在推理时,这些向量以静态或场景自适应的缩放方式注入最终残差流,无需更新模型参数即可实现对情感强度的连续控制。跨三个 LLM 和八种情感的实验表明,EmoVec 在显著提升情感显著性的同时,最大程度保留了语义内容、流畅度和连贯性。消融研究与人类评估进一步证实了向量提纯和自适应缩放的有效性,确立了 EmoVec 作为已部署 LLM 中情感控制的实用推理时方法。代码与数据已发布于:https://github.com/chicosirius/EmoVec。

## 1 引言
大型语言模型(LLMs)的出现彻底改变了自然语言处理(NLP)(Brown 等,2020),使系统在推理、编程和通用知识检索方面展现出卓越能力。然而,尽管这些认知能力飞跃,情感智能领域仍存在显著差距(Sabour 等,2024)。虽然当前模型在明确提示下能模拟情感,但其默认输出(受人类反馈强化学习(RLHF)严重约束)常遭受情感扁平化问题(Kirk 等,2023;Ibrahim 等,2025)。为了追求安全与无害性,RLHF 倾向于将模型输出分布压缩至中性,常表现为依赖泛泛安慰语、过度模糊或记录在案的奉承行为——优先考虑附和而非语境敏感的表达(Dahlgren Lindström 等,2025;González Barman 等,2025)。这种“对齐税”(Askell 等,2021;Lin 等,2024)限制了 LLM 在需要高度情感微妙性的领域的应用,如心理健康支持、创意写作和共情人机交互(Yong 等,2025b;Yong 等,2026;Guo 等,2026b;Zhang 等,2026c)。

*如图1(概念示意图所示),通过本文提出的潜在向量引导机制,模型输出沿“快乐梯度”进行调制。这产生了三个保持语义一致性的不同响应,同时情感强度逐级递增,从专业确认(级别1)到热情庆祝(级别3)。*

当前缓解此限制的方法主要依赖提示工程或监督微调(SFT)。基于提示的策略(Li 等,2023)(如“扮演共情治疗师”)效果极不稳定,占用宝贵的上下文窗口空间,且结果对词汇变化敏感(Wang 等,2022;Miehling 等,2025)。监督微调虽有效,但需要大规模标注数据集和大量计算资源,并可能引入灾难性遗忘或模型通用能力下降等风险(Lin 等,2024;Zhu 等,2026)。这些局限性凸显了对一种轻量、可控方法的需求,使其无需重新训练模型即可实现情感生成。

为奠定方法基础,我们首先研究情感在 LLMs 中的表现位置与方式。通过将不同情感极性的文本输入模型,并在每层隐藏状态上训练线性分类器进行探测分析。结果揭示出一致且可解释的规律:**情感状态表征在模型的中后层呈现日益增强的线性可分性**。该发现与近期研究一致并有所扩展。例如,Cintas 等(2025)表明人格特定表征在模型最后三分之一层最易分离;Ju 等(2025)则证明人格特质渐进出现并在上层固化。综合来看,这些结果表明早期层编码语法与浅层语义,而更高层则捕捉抽象情感与人格相关属性(Rogers 等,2020)。这种层级结构为情感控制提供了精确且原则性的干预点(Guo 等,2026a)。

基于此观察,我们提出 EmoVec——一个通过潜在向量操控实现可控情感生成的框架。该框架建立在表征工程(RepE)(Zou 等,2023)基础上,后者将高层语义表示为激活空间中的线性方向(Park 等,2023;Turner 等,2023)。EmoVec 引入原则性方法以隔离并提纯情感特定向量,同时将其与任务语义解耦。这些向量在推理时以可调强度注入,无需权重更新或提示工程即可实现细粒度控制。

EmoVec 使用对比激活加法(CAA)(Rimsky 等,2024;Chen 等,2025)提取情感引导向量。我们构建语义内容匹配但情感影响不同的成对提示-响应轨迹,计算目标层平均激活差异,得到捕捉情感变化同时最小化任务相关混淆的向量。这些向量在推理时应用可调节缩放因子,以控制情感类型与强度。如图1所示,该机制能在固定输入下连续调制情感强度,同时保持语义一致性。这种细粒度可控性使 LLMs 能够适应多样化情境需求,包括专业中立、共情支持和表达创新。此能力对面向人的应用尤为宝贵,如心理支持、创意写作和个性化对话代理(Zhou 等,2025;Guo 等,2025)。

我们的贡献如下:
- • 我们提供实证证据验证 LLMs 中情感表征的层级涌现性,强化了情感计算领域的线性表征假说。
- • 我们开发了使用对比样本提取并验证情感引导向量的稳健流程。
- • 我们实现了对情感强度进行动态、细粒度控制的机制,使模型能根据场景特定需求调整情感表达力。

*如图2(潜在向量引导框架概览图所示),流程包括:(1) 使用 CAA 和两阶段去偏提取净化情感向量;(2) 通过线性探测进行层定位以确定最终层最优干预点;(3) 将情感向量注入最终残差流,其强度由场景自适应适配器动态调制。*

## 2 相关工作

#### 语言模型中的情感计算。
情感计算旨在使机器能够识别人类情感状态并生成相应表达。随着 LLMs 的出现,研究转向评估其涌现情感能力。研究表明,GPT 系列等模型能仅从语言数据估计效价、唤醒度,并进行基于评估的情感唤起(Broekens 等,2023;Zhang 等,2024b)。LLMs 还通过辅助人类识别低质量标签来优化情感标注流程,从而提升下游性能(Niu 等,2025)。虽然这些模型擅长捕捉一般情感极性和基于对话的识别,但在细粒度区分和多模态语境方面仍面临挑战(Sabour 等,2024;Sorin 等,2024;Castro 等,2025)。尽管如此,LLMs 在生成合成情感数据集和执行共情评估等社会情感任务方面展现出潜力(Kaplan 等,2025;Dong 等,2025)。

#### 表征工程与激活引导。
表征工程通过操控隐藏表征来控制 LLM 行为,无需更新模型参数(Zou 等,2023;Turner 等,2023)。先前研究表明潜在方向能引导写作风格、情感等属性(Diallo 等,2025;Farooq 等,2025)。其他研究直接从预训练语言模型提取引导向量(Subramani 等,2022)或识别激活空间中的人格相关表征(Chen 等,2025)。近期研究进一步表明,情感和人格相关信息在 LLMs 中后层变得日益可分(Cintas 等,2025;Ju 等,2025)。情感特定神经元和情感表征也从机制角度被研究(Lee 等,2025a;Tak 等,2025a;Yong 等,2025a)。不同于先前工作,EmoVec 专注于细粒度情感强度控制,而非粗粒度情感或通用风格迁移。我们进一步引入任务特定去偏以减少语义污染,并评估不同引导强度下的语义保持能力。

## 3 情感向量提取
我们将可控情感生成建模为语义保持约束下的情感强度调制。目标是在保持原始语义意图的同时增强目标情感强度。我们从中性与情感条件响应的配对中提取情感特定潜在方向,并在推理引导前减少任务特定语义变异。对于每个目标情感 $e$,我们旨在获取一个向量 $v_e \in \mathbb{R}^d$,该向量捕捉表达情感 $e$ 所引发的表征偏移,同时对场景特定语义保持鲁棒性。

### 3.1 符号与预备知识
假设包含 $N$ 个场景任务的数据集。对于每个任务 $t$ 和每个目标情感类 $e \in \mathcal{E}$,LLM 对同一场景进行两次提示:1)中性响应,我们提取表征向量 $\mathbf{h}^{(0)}_{e,t} \in \mathbb{R}^d$;2)情感条件响应,产生 $\mathbf{h}^{(e)}_{e,t} \in \mathbb{R}^d$。实际操作中,表征 $\mathbf{h}$ 通过对响应 token 的层级隐藏激活平均计算得出。为简洁起见,我们将任务 $t$ 和情感 $e$ 的配对简记为 $(\mathbf{h}^{(0)}_{e,t}, \mathbf{h}^{(e)}_{e,t})$。

我们进一步假设每个生成的响应都关联一个标量质量分数 $s^{(0)}_{e,t}$(中性)和 $s^{(e)}_{e,t}$(情感),由基于 LLM 的评判器生成。为确保评估鲁棒性,我们进行了验证研究,检查模型评分与人类判断的一致性(详见附录E)。

### 3.2 场景构建
为构建语义内容受控的成对情感场景,我们从 Social Chemistry(Forbes 等,2020)、NormBank(Ziems 等,2023)和 Social IQa(Sap 等,2019)中抽样简短的社交与常识*种子*。这些种子涵盖四个领域:工作与效率、亲密关系、公共与社会互动、个人感受。对于每个种子,我们使用 LLM 辅助重写流程生成完整场景、对应问题和目标情感。要求场景支持目标情感而不显式命名,同时兼容中性与情感条件响应。生成场景经人工筛选以确保语义清晰性、情感合理性和无情感泄露。我们为每种情感保留160个场景(共1280个),平均分配用于向量提取和评估。相同场景集在所有评估的 LLM 中复用,而情感向量为每个模型单独提取。

### 3.3 对比激活加法
为减少不良或畸形生成导致的噪声,我们仅保留高质量配对。形式上,令 $\tau_0, \tau_e$ 分别为中性和情感质量的阈值。我们保留索引集:$I = \{(e,t): s^{(0)}_{e,t} > \tau_0 \land s^{(e)}_{e,t} > \tau_e\}$。

相似文章

生成学习作为提升情感身体运动表达感知的工具

arXiv cs.LG

本文研究使用基于Transformer的生成模型从日本演员的动作捕捉数据中学习情感身体运动,生成基于离散情感标签的运动。评估表明,生成的运动在用于数据增强时能提升情感识别性能,并实现情感强度间的平滑过渡。