基于属性的激活引导:为LLMs实现针对特定群体的解释生成

arXiv cs.CL 论文

摘要

本文提出基于属性的激活引导方法,旨在为特定群体定制LLM解释,与提示和最先进基线相比,实现了更好的具体性和事实性。

arXiv:2608.29215v1 公告类型:新 摘要:为了有效帮助人们理解新话题,解释应根据其背景和能力进行定制。迄今为止,仅靠提示被证明不足以创建此类解释,且缺乏其他计算方法。因此,本文研究LLMs是否可以被引导以生成针对特定群体的解释。为此,我们提出一种方法,首先识别目标群体在解释风格和知识方面的群体特定属性。基于激活工程,然后计算基于属性的引导向量,并在推理过程中将其添加到LLM的内部激活中,以实现细粒度的引导。在我们的实验中,我们从生成解释的具体性和事实性方面评估了我们方法的引导效果。此外,我们在与来自不同目标群体的人类专家的研究中评估了这些解释。与提示和最先进引导基线相比,我们的方法显著更好地将解释定制到目标群体,同时在很大程度上保持了事实性。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:18

# 面向群体特定解释生成的大型语言模型基于属性的激活导向
来源:https://arxiv.org/html/2608.29215
###### 摘要
为有效帮助人们理解新主题,解释应根据其背景和能力量身定制。研究表明,仅靠提示不足以创建此类解释,目前也缺乏其他计算方法。因此,本文研究大型语言模型是否可以被导向生成针对特定人群量身定制的解释。为此,我们提出一种方法:首先从解释风格和特定目标群体的知识两个方面识别群体特定属性。基于激活工程,然后计算基于属性的导向向量,并在推理期间将其添加到大型语言模型的内部激活中,以实现细粒度的导向。在我们的实验中,我们从生成的解释的特异性和事实性方面评估导向效果。此外,我们在一项针对来自不同目标群体的人类专家的研究中评估了解释。与提示和最先进的导向基线方法相比,我们的方法在保持最佳特异性-事实性平衡的同时,显著更好地将解释量身定制给目标群体。

## 1 引言
由于在可解释人工智能[1][2][3][4]以及基于反馈的写作支持[5]等应用中的重要性,自然语言解释的计算生成最近引起了越来越多的研究兴趣。然而,为确保解释被有效理解,需要考虑被解释者(即被解释的对象)的背景和能力。也就是说,解释理想情况下应该是个性化的[6][7]。由于被解释者的特定特征并不总是可获得的,另一种选择是将解释量身定制给被解释者的目标群体[1]。为作说明,图1对比了一个通用解释和一个针对游戏开发者量身定制的解释。
图1:针对问题“DNA是如何工作的?”的两种示例解释:一种是仅基于问题通过提示方法生成的*通用解释*,另一种是通过本文提出的方法为游戏开发者生成的*群体特定解释*。
虽然可以通过简单地提示大型语言模型来生成群体特定解释[8][9],但基于提示的导向通常对提示表述高度敏感[10],并且导向效果较低[11][12]。对于微调大型语言模型,由于大多数现有的关于人类撰写解释的自然语言处理研究缺乏关于被解释者的群体特定信息[13][14][15][16],因此群体特定解释数据缺失。总之,据我们所知,目前还没有任何计算方法能生成明确针对群体特定偏好的高质量解释。

本文中,我们着手解决群体特定解释生成任务,同时避免对监督解释数据的需求。特别是,我们研究是否可以计算性地从特定目标群体撰写的解释中学习如何*为该群体*解释一个主题。不同于旨在调整风格同时保持意义的文本风格迁移[17]以及做相反事情的内容迁移[18],给定的问题需要建模目标群体的背景和能力[19]。我们的假设是,这些隐含在该群体成员使用的语言以及他们所谈论的内容中。

扩展Patel等人[20]的无监督方法,我们结合提示和聚类,不仅提取与解释风格相关的属性(例如,作者包含代码片段),还从群体成员(例如,游戏开发者)撰写的解释中提取知识相关的属性(例如,作者理解游戏开发)。我们方法的关键思想是通过基于该群体最重要属性来导向大型语言模型,生成针对特定目标群体量身定制的解释。为了实现这种细粒度的导向,我们采用激活工程[21][22][23],在推理期间将导向向量添加到大型语言模型预选层的内部激活中。与现有方法不同,我们从风格和知识属性的激活向量构建基于属性的导向向量,以专门针对目标群体调整大型语言模型的输出。

在我们的实验中,我们从十一个Stack Exchange社区(例如,哲学家或游戏开发者)的答案中提取群体特定属性,发现了高相关性,支持了属性的充分性。我们评估了我们的方法相对于提示和最先进的导向基线方法的有效性,重点关注生成的解释的特异性和事实性。此外,我们在一项针对生物学、哲学和游戏开发领域的九位专家的人工研究中,手动评估了导向的成功度、合理性和有用性。虽然结果显示特异性和事实性之间存在权衡,但我们的方法在这两个标准之间取得了最佳平衡,生成了明显更好的量身定制的解释,同时基本保持了事实性。

总结来说,我们的主要贡献如下:
1.  一种获取特定群体的风格和知识属性的无监督方法。
2.  一种无需训练的方法,可用于实现基于属性的大型语言模型激活导向,以生成群体特定解释。
3.  来自专家评估的,关于相应导向有效性的实证证据。

## 2 相关工作
图2:我们构建基于属性的导向向量$\mathbf{s}_{g}^{(i)}$(用于层$i$)的方法:从目标群体$g$的解释中,确定了$m$个最重要的风格和知识属性。每个属性提取一个激活向量。这些向量构成了$\mathbf{s}_{g}^{(i)}$,用于导向大型语言模型以生成群体特定解释。
随着人工智能可解释性需求的增加,解释在计算研究中受到了关注[24]。Miller[2]指出,解释始终受到*解释者*和*被解释者*双方的影响。因此,理想情况下,解释应该针对特定的被解释者进行个性化[6][7]。个性化解释的生成可能看似是文本风格迁移[17][25]或内容迁移[26][18]的一种实例,其目标是在保持风格的同时引入新内容。但这涉及同时调整解释以适应解释风格和被解释者的背景[7]。由于个体偏好并不总是可获得,一种替代方案是将解释适应于一群被解释者[1]。多项工作提供了人类撰写的解释[13][27][14][15][16][28],但它们都没有包含关于被解释者的个人信息。因此,最近的工作研究如何识别特定群体的偏好。Siskou和Hautli-Janisz[12]依赖于手动设计的修辞特征,但这限制了可扩展性。Cunningham等人[29]证明稀疏自编码器可以从大型语言模型的激活中恢复可解释的潜在特征。然而,这些潜在特征需要语义标注才能获得明确的自然语言属性。

与我们的方法最相关的是,Patel等人[20]提出了一种基于提示的方法,可以自动从文本中提取与风格相关的属性。基于这种方法,我们还可以提取与知识相关的属性。给定的群体特定解释生成任务在某个抽象层次上类似于基于信念的论证生成[30]的思想。作者使用“即插即用”语言模型[31]来调整论证以适应目标受众,但这仅基于指定的词汇表。细粒度的个性化通常在人格提示[32]的概念下进行研究。例如,在与我们任务密切相关的工作中,大型语言模型被提示将解释量身定制给个体用户偏好[8][9]。然而,Rooein等人[11]观察到,当相应地提示大型语言模型(例如,“为六年级学生回答这个问题,什么是重力?”)时,它们并不会适应不同的年龄水平。此外,Siskou和Hautli-Janisz[12]发现提示并不适合我们设定中的细粒度导向。

相比之下,Meng等人[33]提出通过受约束的训练目标进行属性控制微调,Lai等人[34]识别风格特定神经元以实现目标风格迁移。然而,这两种方法主要是在具有清晰词汇指标(如毒性)的属性上进行评估。最近,几种方法使用连续的用户嵌入,通过将风格、内容和偏好编码为密集表示来个性化大型语言模型的生成[35][36]。虽然这在一般情况下可能有效,但这些表示使得难以独立控制特定属性。

近期的工作采用激活导向[22][23][37],这假设导向向量可以在推理时添加到激活中以引导大型语言模型的输出。对于多属性导向,Wang等人[38]提取不同幻觉类别的导向向量,并使用训练好的探针在推理时调整导向强度。Nguyen等人[39]训练属性特定的门控函数以实现令牌级导向,而Oozeer等人[40]训练分类器来推导多属性导向向量。相比之下,我们提出了一种方法,可以在下一节中解释的*无需任何训练*的情况下实现多属性导向。

## 3 方法
在本节中,我们介绍我们的方法,该方法旨在引导大型语言模型生成针对被解释者目标群体(例如游戏开发者或哲学家)量身定制的自然语言解释。为此,它从解释风格和知识[17][25][30]两个方面建模该群体的能力和背景。接下来,我们详细阐述如图2所示的方法的三个主要步骤:(1)从该群体撰写的解释文本中提取目标群体的风格和知识属性;(2)创建属性特定的激活向量;(3)计算基于属性的导向向量,以引导大型语言模型生成群体特定解释。

### 3.1 群体特定属性
给定一组目标群体$G$,我们通过一个两阶段的提示过程,从这些群体的成员撰写的文本样本中识别出他们最重要的*风格属性*和*知识属性*。对于风格属性,我们首先重用Patel等人[20]的92个提示,让大型语言模型生成文本的风格描述(详见附录A.2)。然后,将每个这些描述重写为一组风格属性列表(例如,作者包含代码片段)。对于知识属性,我们创建了一组新的18个提示,以提取六种常见的知识类型:事实性、概念性、程序性、元认知、情境性和惯例性[41][42][43]。此外,我们创建了一个新的提示,将每个与知识相关的描述重写为一组知识属性列表(所有提示见附录A.3)。通过这些提示运行两阶段提示过程,我们获得了知识属性列表(例如,作者理解游戏开发)。

##### 属性选择
为了减少噪声,我们通过使用大型语言模型对每个提取的属性进行分类来执行基于大型语言模型的过滤。

相似文章

通过定向干预实现语言模型的多属性引导

arXiv cs.CL

MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。

基于归因引导转向的LLM谄媚行为词元级诊断

arXiv cs.CL

本文提出了一种基于积分梯度的词元归因方法,用于在词元级别诊断LLM中的谄媚行为,并提出了归因引导的对比激活转向方法,在不重新训练的情况下减少推理过程中的谄媚行为。

面向高效可控LLM推理的代理式思维链引导

Hugging Face Daily Papers

ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。

受控LLM激活的非满射性

Hugging Face Daily Papers

本文证明,LLM中的激活引导产生的内部状态无法通过任何文本提示复制,从而在白盒可控性和黑盒提示之间建立了形式上的区分。

你的LLM何时可引导?

Hugging Face Daily Papers

本文介绍了一种方法,利用梯度提升决策树(GBDT)分类器,从早期解码状态预测语言模型中激活引导的有效性,从而无需完整生成即可高效优化引导强度。