用于多元LLM对齐的溢出感知多值引导
摘要
本文提出了一种溢出感知的多值激活引导方法,以实现LLMs的多元对齐,无需微调或奖励模型即可改进对多个价值维度的控制。
arXiv:2609.05800v1 公告类型:新
摘要:激活引导通过在推理时向隐状态添加学习到的方向来控制LLM行为,但现有方法一次只处理一个概念。多元对齐要求不同利益相关者强调不同的价值,需要同时引导多个维度。我们表明朴素引导会产生显著的溢出效应:一个价值预期的效果会泄漏到其他价值。这类似于因果推断中的处理与溢出分解。我们将溢出归因于引导方向的几何纠缠,由其格拉姆矩阵捕获,并从激活范数惩罚目标推导出零成本校正,精确解耦每个方向的贡献。我们的端到端流程无需微调、无需奖励模型、无需手动提示工程:仅给定领域问题,它自动发现价值维度、提取方向、诊断纠缠并应用校正引导。在气候话语上,校正将净引导效应从+5.9%提高到+14.0%,通过100,000次成对判断验证。
查看缓存全文
缓存时间: 2026/09/10 08:43
# 面向多元价值对齐的溢出感知多值引导技术
来源:https://arxiv.org/html/2609.05800
Xander BarronJiawei Zhou & Zhenhua Liu
所属机构:石溪大学
联系方式:\{weici\.pan, xander\.barron, jiawei\.zhou\.1, zhenhua\.liu\}@stonybrook\.edu
###### 摘要
激活引导技术通过在隐藏状态中添加学习到的方向向量,在推理时控制大语言模型的行为,但现有方法一次仅处理一个概念。多元价值对齐要求不同利益相关者获得不同的价值侧重,需要同时引导多个维度。研究表明,朴素引导会产生显著的溢出效应:针对某一价值的效果会泄漏到其他维度。这与因果推断中的"处理效应-溢出效应"分解存在相似性。我们将溢出归因于引导方向的几何纠缠,这种纠缠关系可通过格拉姆矩阵捕捉,并从激活范数惩罚目标函数中推导出零成本校正方法,能精确解耦每个方向的贡献。我们的端到端流程无需微调、无需奖励模型、也无需人工提示工程:仅需领域问题,系统即可自动发现价值维度、提取引导方向、诊断纠缠程度,并应用校正后的引导。在气候议题对话中,校正使净引导效应从+5.9%提升至+14.0%,该结论通过10万次配对判断得到验证。
## 1 引言
当被问及"我们是否应该投资核能以应对气候变化?"这类问题时,不同利益相关者期望不同的讨论侧重点。经济学家希望分析建设成本与脱碳时间表的成本效益;环境正义倡导者希望讨论设施选址对边缘化社区的不均衡影响;代际伦理学家则希望关注跨越千年的废物存储责任。标准的大语言模型对齐技术会产生反映平均人类偏好的单一回应(Casper等,2023),但多元价值对齐认识到任何单一回应都无法满足所有利益相关者的需求(Sorensen等,2023;Feng等,2024)。
在我们的研究中,价值分类体系包含K个维度,每个维度在激活空间中拥有单位引导方向d_j,矩阵\mathbf{D}=[d_1,\ldots,d_K]收集所有方向向量;利益相关者偏好表现为请求强调的向量\boldsymbol{w}\in\mathbb{R}^{K},而格拉姆矩阵\mathbf{G}=\mathbf{D}^{\top}\mathbf{D}(其中G_{ij}=d_{i}^{\top}d_{j})则描述方向间的几何关系。
已有多种方法解决此挑战:
- 训练时方法(Dai等,2023;Ramé等,2023;Li等,2025)需要在偏好改变时重新训练
- 基于提示的方法(Feng等,2024;Jiang等,2025a)避免了重训练但缺乏连续控制能力:类似\boldsymbol{w}=(0.7,0.3,0,0)的偏好难以通过单一指令自然表达
- 激活引导技术(Turner等,2024;Rimsky等,2024)能以连续强度将学习到的方向添加到隐藏状态,且无需更新权重,但现有方法一次仅处理单一概念
目前尚无方法能在多元价值引导中实现对受影响维度的原则性控制。当多个引导方向同时应用时,针对某一价值的效果会泄漏到其他维度,破坏了多元价值对齐所需的维度特异性控制。若每次引导请求都产生相同的、无差别的观点倾向性增强,则偏好向量\boldsymbol{w}在实践中将毫无意义,多元价值对齐的承诺也将落空。
我们将此失效模式形式化为"净引导效应":
NSE = 目标效应 - 溢出效应
其中目标效应是指经引导的回应被判断为更强调目标维度的概率,溢出效应是非目标维度上该概率的平均值。NSE≈0意味着引导对所有维度产生同等增强,未提供特定控制;NSE>0则表明目标维度受到优先影响,这正是多元价值对齐所需的能力。现有激活引导研究仅报告目标效应,从未测量非目标维度,导致溢出问题长期隐匿。
我们发现,通过向隐藏状态添加d_j加权和的朴素方向组合会产生接近零的NSE:未校正的最佳变体仅达5.9%。增加引导强度无济于事——它会按比例放大目标效应和泄漏效应,因为其比率由格拉姆矩阵\mathbf{G}固定。这与因果推断中的"处理-溢出"分解相似,忽略干扰结构会导致处理特异性被高估。使用\mathbf{G}^{-1}校正引导系数,可确保扰动在每个方向d_j上精确投影为w_j,实现所有j维度的同时校正。
我们的主要贡献如下:
1. 我们证明现有激活引导方法缺乏维度特异性控制能力(这是多元价值对齐的先决条件),并将此缺陷形式化为净引导效应(NSE)。所有测试方法均产生接近零的NSE:它们均匀而非特异性地增强价值强调。
2. 我们开发了从领域问题到校正多元价值引导的端到端流程,无需微调、奖励模型或人工提示工程。该流程通过探测分类器自动发现价值维度,提取对比引导方向,通过格拉姆矩阵诊断几何纠缠,并仅使用标准工具应用\mathbf{G}^{-1}校正干预。
3. 我们利用引导方向间的几何结构恢复维度特异性控制,在气候议题测试平台中实现14.0% NSE(未校正方法为5.9%),并通过10万次以上配对判断验证。这实现了多元价值对齐的核心承诺:具有不同偏好向量的利益相关者将获得可测量的差异化价值强调。
## 2 相关工作
### 多元价值对齐(训练时)
训练时多元价值对齐方法表现优异,但利益相关者偏好改变时需要重新训练。RLHF(Ouyang等,2022)和DPO(Rafailov等,2023)对齐单一聚合偏好,隐式固定了价值权重。多目标扩展将其分解为独立目标:Safe RLHF(Dai等,2023)分离有用性与无害性,MODPO(Zhou等,2023)通过基于边界的DPO扩展到K个目标,Rewarded Soups(Ramé等,2023)事后插值特定奖励的权重检查点,PAL(Chen等,2025a)从异质标注者学习K个偏好原型用于奖励建模。GAPO(Li等,2025)和OrthAlign(Lin等,2026)分别通过梯度正交化和正交参数分解减少训练时目标间干扰,这与我们的\mathbf{G}^{-1}去相关在概念上相关,但作用于梯度或参数空间而非激活空间。部署后改变\boldsymbol{w}需要重新训练或维护K个独立检查点。
### 多元价值对齐(推理时)
推理时方法避免重训练,但在提示空间中难以实现对价值强调的精细连续控制。模块化多元主义(Feng等,2024)通过三种多元模式在社区特定模型间路由。PICACO(Jiang等,2025a)通过总相关性优化导航多价值的元指令,最多处理8个价值。ValueFlow(Kim等,2026)使用锚点排序评估提供校准的强度控制。这些方法选择或组合文本指令,而非干预内部表示,因此类似\boldsymbol{w}=(0.7,0.3,0,0)的偏好难以作为单一提示自然表达(附录V)。我们的方法在此设计空间中占据独特位置:与这些方法一样属于推理时方法,但在激活空间中操作并支持连续的\boldsymbol{w}。
### 激活引导(单概念)
现有激活引导方法一次仅处理单一概念,从未评估非目标行为是否受到意外影响,导致溢出问题不可见。ActAdd(Turner等,2024)建立了加性干预范式:添加对比对的平均激活差以引导行为。CAA(Rimsky等,2024)通过对多个对比数据集平均增强了此方法鲁棒性。RepE(Zou等,2023)使用对比激活的PCA,ITI(Li等,2023a)干预探测识别的注意力头以增强真实性。后续工作将范式扩展到条件激活(Lee等,2025)、输入自适应缩放(Wang等,2025b;Ferrando等,2025)和基于SAE的特征引导(Soo等,2025)。ConVA(Jin等,2025)一次训练并门控单个价值向量,推迟多价值控制。所有评估仅测量目标行为是否改变;我们的NSE指标(§3.3)正是为了揭示其遗漏。
### 多属性引导
最相关的先前研究识别了多属性干扰问题,并通过启发式方法或训练解决。Weij等(2024)表明多属性的朴素向量求和因特征纠缠而失效,建议在不同层注入不同向量——此启发式在某些情况下避免干扰,但无法扩展到2-3个以上属性且无保证。Persona Vectors(Chen等,2025b)提取每个特征的引导向量,观察到特征间相关性(在大五人格维度间余弦相似度达0.3-0.5),NeVA(Yang等,2026)在编辑价值相关神经元时观察到跨价值泄漏;两者都将此视为研究发现而非待解决的问题。MSRS(Jiang等,2025b)使用训练的引导模块分离共享和属性私有子空间,steering tokens(Radevski等,2026)在正则化下将行为蒸馏到学习输入嵌入中;两者通过训练获得解耦。
在目标上最接近的是COAST(Nguyen等,2026),它通过激活的前向二阶矩矩阵加权激活扰动来衰减引导方向的附带移动,一次处理一个方向。我们的工作通过格拉姆矩阵\mathbf{G}形式化干扰结构,使用其条件数\kappa(\mathbf{G})作为量化诊断工具,并推导出\mathbf{G}^{-1}校正——该方法能联合去相关所有K个方向,以封闭形式在推理时完成,无需训练。我们用于评估校正的NSE指标受到因果推断中"处理-溢出"分解(Hudgens和Halloran,2008)的启发。
## 3 基础知识
### 3.1 多元价值激活引导
多元价值引导需要建立从利益相关者偏好到引导系数\boldsymbol{\alpha}的映射。激活引导通过在隐藏状态中添加学习到的方向向量来修改大语言模型推理时的行为。对于单一概念,标准干预在第l层将隐藏状态h替换为h'=h+\alpha d,其中d是学习到的方向向量,\alpha是标量强度(Turner等,2024;Rimsky等,2024)。
我们遵循此既定范式采用加法形式;虽然存在乘法缩放或子空间投影等替代干预方式(Postmus和Abreu,2024),但在我们的环境中其引导效果较差(§5,附录E)。要同时引导K个价值维度,我们将方法推广为:
h' = h + \sum_{k=1}^{K}\alpha_k d_k = h + \mathbf{D}\boldsymbol{\alpha}
其中\mathbf{D}=[d_1,\ldots,d_K]\in\mathbb{R}^{n\times K}收集K个引导方向,\boldsymbol{\alpha}\in\mathbb{R}^{K}是引导系数。利益相关者表达偏好向量\boldsymbol{w}\in\mathbb{R}^{K}选择价值维度。例如,\boldsymbol{w}=e_3表示"仅强调第三个价值维度",而\boldsymbol{w}=(0.5,0,0.5,0)要求对第一和第三维度给予同等强调。
我们寻求从偏好到引导系数的映射,并将其参数化为线性形式:
\boldsymbol{\alpha}^{*} = \mathbf{H}\boldsymbol{w}
其中\mathbf{H}\in\mathbb{R}^{K\times K}是校正矩阵。我们将\mathbf{H}限制为线性:K^2=16个参数可从有限数据中估计,且精确去相关性质(§4.1)在线性\mathbf{H}下严格成立。所有现有单概念引导方法隐式设置\mathbf{H}=\mathbf{I},将偏好向量直接等同于引导系数。
### 3.2 格拉姆矩阵与几何泄漏
格拉姆矩阵\mathbf{G}量化了朴素引导向非目标维度泄漏的能量。对于K个引导方向d_1,\ldots,d_K,\mathbf{G}\in\mathbb{R}^{K\times K}捕捉其成对几何关系。相似文章
通过潜在激活引导的大语言模型文化价值对齐
一个利用基于场景的行为探测和激活引导来评估和引导大语言模型中文化价值的框架,揭示了价值维度之间的潜在纠缠。
通过定向干预实现语言模型的多属性引导
MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。
基于属性的激活引导:为LLMs实现针对特定群体的解释生成
本文提出基于属性的激活引导方法,旨在为特定群体定制LLM解释,与提示和最先进基线相比,实现了更好的具体性和事实性。
通过多层组合融合实现情境价值对齐
本文提出了MCF-CVA,一种用于大型语言模型情境价值对齐的多层组合融合框架,该框架利用多个道德智能体以及扩展-约简过程来更好地捕捉伦理多元主义,并优于单智能体基线方法。
UniSteer:文本引导的激活空间流匹配实现多功能大语言模型操控
UniSteer 提出了一种文本引导的激活流匹配方法,在激活空间中学习通用条件速度场,无需特定任务干预模块即可实现多功能的 LLM 行为控制与分类任务。