FOCUS:解耦大语言模型中的专家人格以增强领域专家能力
摘要
提出FOCUS,一种通过正交分解和专家门控模块解耦大语言模型中专家人格的微调方法,在金融、法律和医学基准上提高了特定领域任务的准确性。
arXiv:2608.05611v1 公告类型:新
摘要:大语言模型(LLMs)能够表现出多样的人格,激活专家人格已被证明能提高领域专业性和任务准确性。然而,现有的人格控制方法常常受到跨领域耦合的影响,这可能导致在高谨慎领域(如医疗)中出现过度激进的行为,或在风险敏感领域(如金融交易)中出现过度保守。为了解决这个问题,我们提出了FOCUS(\textbf{\underline{F}}ine-tuning with \textbf{\underline{O}}rthogonal \textbf{\underline{C}}ontrol for \textbf{\underline{U}}ncoupled persona\textbf{\underline{S}})。FOCUS首先自动从LLMs中提取专家人格向量,然后应用正交分解来解耦特定领域的专家人格,最后引入一个专家门控模块,根据任务上下文自适应地控制人格激活。通过两阶段训练策略和门控选择正则化器,模型学会了在单领域和跨领域任务中激活合适的人格。在金融、法律、医学和跨领域基准上的实验表明,FOCUS提高了任务准确性,并优于现有的人格控制方法。我们的代码可在\href{https://anonymous.4open.science/r/openpersona-48F4}{此链接}获取。
查看缓存全文
缓存时间: 2026/08/07 07:51
# FOCUS:解耦LLM中的专家人格以增强领域专家能力
来源:https://arxiv.org/html/2608.05611
11institutetext:北京大学,中国北京
11email:{wgy2023, chuxu}@stu.pku.edu.cn
22institutetext:悉尼大学,澳大利亚悉尼
22email:[email protected]
\*同等贡献
†通讯作者
###### 摘要
大语言模型(LLMs)能够展现出多样的人格,并且已有研究表明,激活专家人格可以提升领域专业性和任务准确率。然而,现有人格控制方法常常受到跨领域耦合的影响,这可能在高谨慎领域(如医疗健康)中导致过于激进的输出,或在风险敏感领域(如金融交易)中导致过度保守。为了解决这一问题,我们提出FOCUS(Fine-tuning with Orthogonal Control for Uncoupled personaS)。FOCUS首先从LLM中自动提取专家人格向量,接着应用正交分解来解耦领域特定的专家人格,最后引入一个专家门控模块,根据任务上下文自适应地控制人格激活。通过两阶段训练策略和门控选择正则化器,模型学会在单领域和跨领域任务中激活合适的人格。在金融、法律、医疗和跨领域基准上的实验表明,FOCUS提高了任务准确率,并优于现有人格控制方法。我们的代码可在以下网址获取:https://anonymous.4open.science/r/openpersona-48F4。
## 1 引言
大语言模型(LLMs)在生成响应中会展现出多样的人格[8](https://arxiv.org/html/2608.05611#bib.bib1)。这些人格可能表现为不良行为,例如威胁或不安全动作[26](https://arxiv.org/html/2608.05611#bib.bib2)、[42](https://arxiv.org/html/2608.05611#bib.bib4),也可能表现为有益特质,例如客观性和亲和力[2](https://arxiv.org/html/2608.05611#bib.bib5)、[25](https://arxiv.org/html/2608.05611#bib.bib6)。已有研究表明,为LLMs分配专家人格可以提升下游任务性能,包括数学推理[39](https://arxiv.org/html/2608.05611#bib.bib7)和医疗健康应用[32](https://arxiv.org/html/2608.05611#bib.bib8),如图1(a)所示。现有工作进一步表明,这种人格可通过基于提示的方法[19](https://arxiv.org/html/2608.05611#bib.bib9)和基于训练的方法[31](https://arxiv.org/html/2608.05611#bib.bib11)、[21](https://arxiv.org/html/2608.05611#bib.bib12)、[10](https://arxiv.org/html/2608.05611#bib.bib43)来激活。
然而,现有人格激活方法所诱导的人格边界往往是模糊的,这可能导致跨领域的行为冲突。这一问题源于不同领域对决策行为提出了可能相互冲突的要求。例如,医疗领域优先考虑极端谨慎[4](https://arxiv.org/html/2608.05611#bib.bib13),而金融交易通常需要平衡风险与机会[38](https://arxiv.org/html/2608.05611#bib.bib14)。因此,激活一个耦合的专家人格可能会引入不期望的跨领域干扰。例如,如图1(b)所示,一个过于激进的专家人格如果在医疗问答中被无意激活,可能会导致过度自信的回答和潜在的安全风险。因此,尽管可以显式激活领域特定的专家人格[39](https://arxiv.org/html/2608.05611#bib.bib7)、[32](https://arxiv.org/html/2608.05611#bib.bib8),其行为仍可能受到预训练和后训练数据中跨领域耦合的影响,导致领域对齐不纯和性能不稳定。
图1:提示LLMs在金融、法律和医疗任务中承担专家人格的表现。
在本文中,我们提出FOCUS(Fine-tuning with Orthogonal Control for Uncoupled personaS),一种用于解耦和控制领域特定专家人格的人格向量编辑框架。FOCUS首先通过一个自动化流水线从LLM中提取专家人格向量,然后应用正交分解来解耦金融、法律和医疗领域的特定人格向量。接下来,我们在LLM的前馈网络中引入一个轻量级专家门控模块,并训练该模块根据任务上下文激活相应的人格向量。为了在单领域任务中鼓励稀疏向量激活并引导更聚焦的专家行为,我们在训练损失中加入了门控选择正则化器。我们进一步设计了两阶段训练策略,以同时支持单领域专门化和跨领域泛化。在金融、法律、医疗和跨领域任务上的实验表明,FOCUS提高了领域任务回答的准确率,为LLM的高效领域适配提供了一条新途径。我们的贡献包括:(a) 我们指出耦合的专家人格可能因潜在冲突而在领域任务上表现不稳定;(b) 我们提出FOCUS,通过解耦并训练专家门控模块来自适应地激活专家人格;(c) FOCUS在多个领域和跨领域任务上提高了LLM的回答准确率。
## 2 相关工作
### 2.1 LLM中的表示引导与编辑
通过操纵内部表示来控制模型行为,近来已成为参数微调之外的一种有前景的替代方案[3](https://arxiv.org/html/2608.05611#bib.bib28)。此前关于激活引导和表示工程的研究表明,在不更新模型权重的情况下修改隐藏状态可以有效地影响模型输出[33](https://arxiv.org/html/2608.05611#bib.bib29)、[24](https://arxiv.org/html/2608.05611#bib.bib30)。这些方法包括推理时干预、基于线性方向的编辑和激活修补[40](https://arxiv.org/html/2608.05611#bib.bib31)。
与这一研究方向密切相关的还有基于子空间的方法,例如概念消除和零空间投影技术,它们通过将表示投影到正交子空间来去除特定属性[6](https://arxiv.org/html/2608.05611#bib.bib32)、[28](https://arxiv.org/html/2608.05611#bib.bib33)。这些方法强调,不同的语义因素可以在表示空间中被解耦[15](https://arxiv.org/html/2608.05611#bib.bib34)、[35](https://arxiv.org/html/2608.05611#bib.bib42)。
我们的方法借鉴了这些见解,但在目标和设计上有所不同。我们并非要移除不需要的属性,而是要对领域特定的行为因素进行隔离,并使其可控。
### 2.2 LLM的多领域适配
让大语言模型适应多个领域是一个长期挑战[29](https://arxiv.org/html/2608.05611#bib.bib35)、[30](https://arxiv.org/html/2608.05611#bib.bib41)、[34](https://arxiv.org/html/2608.05611#bib.bib39)、[13](https://arxiv.org/html/2608.05611#bib.bib44)。现有方法通常依赖多任务学习或指令微调,即在来自不同领域的数据上训练模型以提高泛化能力[36](https://arxiv.org/html/2608.05611#bib.bib36)、[14](https://arxiv.org/html/2608.05611#bib.bib37)。虽然这些方法能够提升整体性能,但它们依赖隐式的知识共享,无法对领域特定行为提供显式控制。
因此,当不同领域提出相互冲突的要求时,例如医疗应用中的保守决策与金融场景中的风险敏感推理,模型可能表现出不稳定或不一致的行为[5](https://arxiv.org/html/2608.05611#bib.bib38)、[12](https://arxiv.org/html/2608.05611#bib.bib40)。在需要同时考虑多个领域特定因素的跨领域设置中,这一局限更加明显。
我们的工作通过引入对领域特定表示的结构化控制,提供了一个互补的视角。
## 3 方法
图2:FOCUS算法工作流程。(a) 提取通用专家和单领域专家人格向量。(b) 将单领域专家向量从通用专家向量中解耦。(c) 进行两阶段微调以训练专家门控模块,其中第一阶段对齐单领域专家人格,第二阶段增强跨领域泛化能力。
### 3.1 专家人格向量提取
我们首先设计了一个专家人格向量提取流水线,其灵感来自[8](https://arxiv.org/html/2608.05611#bib.bib1)。该流水线以领域专家的名称、相应的专家特质简要描述以及从领域训练集中提取的问答样本作为输入。基于这些输入,我们设计了一个通用提示模板,引导最先进的LLM(Claude 3.7 Sonnet)生成两类关键组件:对比系统提示和评估提示。
具体来说,对于每个领域,我们生成5对对比系统提示。每一对包含一个旨在引发目标专家人格行为的正向提示,以及一个旨在抑制目标专家人格行为的负向提示。我们从每个领域的训练集中选择20个问题,这些问题与对比系统提示结合后,能够有效引导目标模型产生与特定专家人格相关的行为。
利用上述组件,我们构建模型响应的对比对。对于提取集中的每个问题,我们分别使用正向和负向提示驱动目标模型生成10个响应。对于每个过滤后的响应\(r\),我们提取该响应在模型第\(l\)层的残差流激活,并对所有token维度进行平均,得到平均激活向量\(\bar{\mathbf{a}}_l(r)\)。最后,如图2(a)所示,第\(l\)层的人格向量\(\mathbf{v}^{(l)}\)定义为正负响应集平均激活向量之差:
\[
\mathbf{v}^{(l)}=\frac{1}{|S_{pos}|}\sum_{r\in S_{pos}}\bar{\mathbf{a}}_l(r)-\frac{1}{|S_{neg}|}\sum_{r\in S_{neg}}\bar{\mathbf{a}}_l(r),
\tag{1}
\]
其中\(S_{pos}\)和\(S_{neg}\)分别表示由正向和负向提示生成的响应集合。为简化起见,在后续讨论中我们省略层索引\(l\),并将从特定层提取的金融、法律和医疗领域的候选专家人格向量分别表示为\(\mathbf{v}_f,\mathbf{v}_l,\mathbf{v}_m\)。同时,我们使用更通用的提示和混合领域问题,通过相同过程构建通用专家相似文章
解耦LLM生成中的任务求解与输出格式化
介绍了Deco-G,一种解码框架,将LLM中的格式遵循与问题求解相分离,通过格式估计模块在不削弱推理能力的前提下确保合规。在数学推理、事件抽取和LLM作为评判者的任务中取得了更高的准确性。
面向专业人类与大语言模型协作的能力条件化支架
介绍了能力条件化支架,一种用于大语言模型协作的框架,根据用户专业领域调整干预措施以防止专业领域漂移,并在MMLU子集上进行了试点评估。
在LLM个性化中重新以人类为中心
本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。
LLM治理的机械执行:金融决策系统中治理-任务解耦的证据
本文引入了五项治理指标,用于在受监管金融工作流程中量化LLM在决策理由层面的政策合规性。研究发现,机械执行(在模型解释循环之外操作)将无信息的延迟决策减少了73%,并揭示了治理-任务解耦:纯文本治理在压力下两个维度均退化,而机械执行即使在任务性能下降时仍能保持治理质量。
LLMs奖励专业知识
文章认为,领域专业知识是有效使用LLM的最重要技能,并以陶哲轩的ChatGPT对话作为专家级提示词的示例。