面向可信赖大语言模型推理的概率概念感知引导

arXiv cs.AI 论文

摘要

本文介绍了面向大语言模型推理的概率概念感知引导(PCS)框架,该框架利用概念驱动的引导向量检索和概率强度校准,提升了可解释性、最优性和泛化能力,在多个数据集上实现了方向准确率提高超过30%,引导准确率超过89%。

arXiv:2607.18259v1 公告类型:新 摘要:引导向量(SVs)是一种用于大语言模型(LLMs)的推理时间干预技术,通过向推理过程中的中间激活添加概念特定的方向向量来指导生成过程。然而,现有的SV方法经常产生表示不一致的行为,削弱了可解释性和细粒度控制,这主要是因为先前的工作侧重于二元正负引导评估,同时使用离散聚类指标,难以捕捉语义对齐的连续谱。在这项工作中,我们提出了面向大语言模型推理的概率概念感知引导(PCS)框架。PCS通过概念驱动的引导向量检索和概率强度校准,在保持原始任务能力的同时,提供可控的、面向安全性的语义偏差。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:20

# 概率概念感知引导实现可信赖的大语言模型推理 来源:https://arxiv.org/html/2607.18259 ###### 摘要 引导向量(SVs)是一种针对大语言模型(LLMs)的推理时干预技术,通过向推理过程中的中间激活添加特定于概念的引导向量来指导生成过程。然而,现有的SV方法经常产生表征不一致的行为,损害可解释性和细粒度控制。这主要是因为先前的工作主要关注二元正负引导评估,同时使用离散聚类指标,未能捕捉语义对齐的连续谱系。在这项工作中,我们提出了用于LLM推理的概率概念感知引导(PCS)框架。PCS在保持原始任务能力的同时,通过概念驱动的引导向量检索和概率强度校准,提供可控的、面向安全的语义偏差。具体来说,PCS(i)检测提示中的目标概念以获取其引导向量;(ii)采样并校准干预系数参数;(iii)在选定的中间Transformer层注入仿射变换。我们使用最先进的指标评估所提方法的有效性,并确定了PCS最有效的概念领域。实验结果表明,PCS具有以下优势:(i)可解释性:通过自适应引导强度校准实现,该校准利用语义相似性指导基于分布的系数采样——在最敏感且以前难以引导的concept域中产生了超过30%的方向准确率提升;(ii)最优性:揭示引导效能在中等语义对齐时达到峰值;(iii)泛化性:作为一种模型无关的干预方法,无需参数更新即可可靠地修改隐藏激活——在多个实验验证的目标数据集上,相对于先前指标实现了超过89%的引导准确率,展示了在语义多样的推理设置中鲁棒且高效的引导。参照图注图1:概率概念感知引导(PCS)框架图示。上方面板比较了干预方法:暴力分布采样(红色块)依赖固定的离散范围λ1∈[-2,2]和余弦相似度控制(步骤1)执行标准隐藏干预h'=Mh~,而PCS分布采样(绿色块)引入了一种概率方法,其中系数λ0从自适应高斯分布N(μ,σ²)中采样。PCS用上下文敏感的概率采样替代了确定性的手动调优,在多样化语义领域实现了更高的对齐精度和更低的方差。## 1 引言 随着大语言模型(LLMs)在诸多任务中日益普及(Liu等人,2025(https://arxiv.org/html/2607.18259#bib.bib20);Brachman等人,2025(https://arxiv.org/html/2607.18259#bib.bib3)),确保对其输出生成的精确控制已变得越来越具挑战性(Tan等人,2024(https://arxiv.org/html/2607.18259#bib.bib29);Wu等人,2024(https://arxiv.org/html/2607.18259#bib.bib34);Zhang等人,2024a(https://arxiv.org/html/2607.18259#bib.bib38))。现有的LLM对齐技术,例如提示工程(Wu等人,2025c(https://arxiv.org/html/2607.18259#bib.bib36))和微调,在效果和计算效率方面面临重大限制(Huang等人,2024(https://arxiv.org/html/2607.18259#bib.bib13))。微调需要大量计算资源,并且存在削弱模型原始能力的风险(Dong等人,2023(https://arxiv.org/html/2607.18259#bib.bib9);Hu等人,2022(https://arxiv.org/html/2607.18259#bib.bib12));而提示工程则受限于上下文长度和有效性,并且仍然容易受到对抗性操纵(Bosnak等人,2025(https://arxiv.org/html/2607.18259#bib.bib2);Wang等人,2025a(https://arxiv.org/html/2607.18259#bib.bib31))。随着大语言模型(LLMs)在诸多任务中日益普及(Liu等人,2025(https://arxiv.org/html/2607.18259#bib.bib20);Brachman等人,2025(https://arxiv.org/html/2607.18259#bib.bib3)),确保对其输出生成的精确控制已变得越来越具挑战性(Tan等人,2024(https://arxiv.org/html/2607.18259#bib.bib29);Wu等人,2024(https://arxiv.org/html/2607.18259#bib.bib34);Zhang等人,2024a(https://arxiv.org/html/2607.18259#bib.bib38))。提示工程(Wu等人,2025c(https://arxiv.org/html/2607.18259#bib.bib36))和微调(Pareja等人,2024(https://arxiv.org/html/2607.18259#bib.bib22))在效果和计算效率方面面临重大限制(Huang等人,2024(https://arxiv.org/html/2607.18259#bib.bib13);Krähenbühl和Koltun,2011(https://arxiv.org/html/2607.18259#bib.bib17))。微调需要大量计算资源,并且存在削弱模型原始能力的风险(Dong等人,2023(https://arxiv.org/html/2607.18259#bib.bib9);Hu等人,2022(https://arxiv.org/html/2607.18259#bib.bib12));而提示工程则受限于上下文长度和有效性,并且仍然容易受到对抗性操纵(Bosnak等人,2025(https://arxiv.org/html/2607.18259#bib.bib2);Wang等人,2025a(https://arxiv.org/html/2607.18259#bib.bib31))。因此,激活引导(也称为激活工程)作为一种有前景的轻量级替代方案应运而生,它直接操纵模型激活以指导行为,而无需参数更新(Turner等人,2023(https://arxiv.org/html/2607.18259#bib.bib30))。通过建立引导向量(SVs),可以将向量注入LLM的选定层来引导LLM输出所需的变化(Turner等人,2023(https://arxiv.org/html/2607.18259#bib.bib30))。然而,最近的研究表明,这些方法通常不可靠,因为它们难以适应动态推理设置中的多样化语义上下文(Pres等人,2024(https://arxiv.org/html/2607.18259#bib.bib26);Tan等人,2024(https://arxiv.org/html/2607.18259#bib.bib29))。特别是,引导强度的校准仍然不一致,通常需要手动调优(Zhang等人,2024b(https://arxiv.org/html/2607.18259#bib.bib39);Da Silva等人,2025(https://arxiv.org/html/2607.18259#bib.bib7))。在某些情况下,即使仅仅是提示工程也已显示出比传统引导方法更高的有效性(Wu等人,2025a(https://arxiv.org/html/2607.18259#bib.bib35))。尽管存在这些限制,SVs仍然具有巨大潜力。虽然现有研究通常仅在狭窄或受限的场景中探索SV应用,但已证明跨各种基准数据集的大多数提示确实是可引导的(Wang等人,2025b(https://arxiv.org/html/2607.18259#bib.bib32))。新的方法论,例如DIRECTER框架(Kang和Kim,2026(https://arxiv.org/html/2607.18259#bib.bib14)),强调了激活工程中动态适应的必要性,利用一次性注意力敏感性分析按影响力对层进行排序。该方法确保干预保持在模型连贯性的范围内,以解决干预幅度与模型行为之间的非线性关系。在这项工作中,我们引入了**概率概念感知引导(PCS)**,这是一个用于自动检测潜在概念并进行相应概率驱动引导干预的系统性框架。与先前采用固定引导系数(强度)的方法(Panickssery等人,2023(https://arxiv.org/html/2607.18259#bib.bib21);Wang等人,2024(https://arxiv.org/html/2607.18259#bib.bib33))不同,PCS利用概念检测器(Postmus和Abreu,2024(https://arxiv.org/html/2607.18259#bib.bib25))从现成的SV集合(Panickssery等人,2023(https://arxiv.org/html/2607.18259#bib.bib21))中选择与上下文相关的SVs。然后,它根据输入语义计算上下文敏感的干预强度,并将适当缩放的SVs注入选定层。这种自适应工作流增强了语义对齐,从而在推理过程中实现更精确、更有效的干预。总体工作流可参见图1(https://arxiv.org/html/2607.18259#S0.F1),主要贡献总结如下: - • **概率强度校准** – 我们引入了一种新算法,将引导系数 (λ) 动态建模为一个高斯分布,其参数 (μ, σ) 以提示的*概念向量*与预定义*引导方向*之间的余弦相似度为条件。该自适应方案消除了欠/过引导,提供语义对齐的干预,并且**无需额外训练**。 - • **端到端概念检测** – 一个自动化流程直接从输入提示中识别目标概念,并将其输入PCS模块。相同的机制可以无缝扩展到不同的对齐领域(例如,*协调*、*欺骗*、*奖励建模*)。 - • **以可信赖为中心的评估** – 我们提出了一个评估框架,通过logit差异测量语义对齐。PCS相对于先前的引导目标获得了超过89%的绝对提升,并改善了超过77%提示上的logit差异。此外,与动态基线相比,PCS在推理时效率上实现了300%的提升。 ## 2 相关工作 ### 2.1 引导向量 模型引导是一种低成本修改LLMs解码激活的方法(Turner等人,2023(https://arxiv.org/html/2607.18259#bib.bib30);Li等人,2023(https://arxiv.org/html/2607.18259#bib.bib19)),用于偏好优化和可靠性(Cao等人,2024(https://arxiv.org/html/2607.18259#bib.bib4))。最近,由于对安全性和可解释人工智能(Han等人,2025(https://arxiv.org/html/2607.18259#bib.bib11))的需求日益增长,该方法受到了更多关注。与低秩适应(LoRA)(Konen等人,2024(https://arxiv.org/html/2607.18259#bib.bib16))以及其他类型的参数高效微调(PEFT)技术(Hu等人,2022(https://arxiv.org/html/2607.18259#bib.bib12))不同,SVs是一种推理时干预技术。它通过向量注入到一个或多个中间Transformer层(Panickssery等人,2023(https://arxiv.org/html/2607.18259#bib.bib21)),来改变模型的隐藏激活,从而改变输出的标记化。 ### 2.2 概念感知的推理引导 现有研究表明,SVs在分布内(ID)和分布外(OOD)场景中均存在不可靠性(Tan等人,2024(https://arxiv.org/html/2607.18259#bib.bib29))。为了解决这个问题,先前的工作如上下文工程(Wang等人,2024(https://arxiv.org/html/2607.18259#bib.bib33))利用上下文示例中的差异来识别关键的修改需求;表示工程(Cao等人,2024(https://arxiv.org/html/2607.18259#bib.bib4))引入了双向性能优化(BiPO),以训练同时应用于正负引导激活的对比损失。模型引导的新进展(Sharma和Trivedi,2026(https://arxiv.org/html/2607.18259#bib.bib27);Ding等人,2026(https://arxiv.org/html/2607.18259#bib.bib8))已经出现了更高效的方法,这些方法面向环境特定的自适应、上下文感知的模型控制,能够捕捉人类偏好。现有的一步法使用梯度下降和基于能量函数的优化过程,有效地将模型引导至用户偏好的方向。最近,Panickssery等人(2023(https://arxiv.org/html/2607.18259#bib.bib21))引入了带有SVs的概念感知推理,通过在学习到的方向添加到模型推理过程中选定层的隐藏状态,创造性地引导LLM行为。为了增强语义对齐,先前的研究(Postmus和Abreu,2024(https://arxiv.org/html/2607.18259#bib.bib25);Chen等人,2024(https://arxiv.org/html/2607.18259#bib.bib6);Li等人,2023(https://arxiv.org/html/2607.18259#bib.bib19))探索了在真实输出分布和虚假输出分布的表征之间移动激活。值得注意的是,基于概念器的方法(Wang等人,2024(https://arxiv.org/html/2607.18259#bib.bib33))通过显式建模概念边界,提高了引导精度。没有这些,具有离散分类机制的轻量级自适应引导干预无法捕捉连续的谱系对齐(Wang等人,2025b(https://arxiv.org/html/2607.18259#bib.bib32);Suh等人,2025(https://arxiv.org/html/2607.18259#bib.bib28))。 ### 2.3 概率对齐方法 动态和概率干预框架的出现标志着激活引导研究的重大转变,从静态向量注入转向上下文感知、自适应控制。近期文献表明,固定系数范式——常用于早期的引导向量(SV)应用——从根本上受限于其无法解释语义方差和隐私约束。激活引导的发展近期已转向确保推理时干预的可靠性和可信赖性。该领域的一个基础性进展是Goel等人(2025(https://arxiv.org/html/2607.18259#bib.bib10))引入的用于LLM对齐的私有引导(PSA)框架。PSA是差分隐私(DP)首次严格应用于激活编辑,证明了可以使用敏感示范将LLM引导至人类价值观(例如,真实性),而不会泄露私有训练数据。 ## 3 方法 ### 3.1 问题陈述 我们基于**线性表征假说**(Park等人,2023(https://arxiv.org/html/2607.18259#bib.bib23);Turner等人,2023(https://arxiv.org/html/2607.18259#bib.bib30)),该假说认为抽象概念对应于语言模型激活空间中的线性方向。在这个框架下,可以通过添加与目标概念对齐的引导向量来修改模型行为(Wang等人,2024(https://arxiv.org/html/2607.18259#bib.bib33))。虽然现有工作通常在注入引导向量时应用固定的干预强度(Panickssery等人,2023(https://arxiv.org/html/2607.18259#bib.bib21);Wang等人,2024(https://arxiv.org/html/2607.18259#bib.bib33)),但我们提议将引导系数视为一个自适应的、概率性信息的量。领域特定的引导系数,记作λi,被公式化为一个从上下文特定数据集Di导出的自适应标量。与静态方法不同,λi从分布N(μ, σ²)中采样,其中参数以Di的局部几何形状为条件。令D = {v_concept, D_j}_{j=1}^n为预定义的概念向量集合,作为语义锚点。每个元素v_concept, D_j ∈ ℝ^d代表域D内的一个不同潜在方向,输入提示q与之比较以计算语义邻近度。通过将引导强度建模为来自相似性感知的连续分布的样本——其参数同时适应

相似文章

面向高效可控LLM推理的代理式思维链引导

Hugging Face Daily Papers

ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。

FineSteer: 大规模语言模型推理时细粒度控制的统一框架

arXiv cs.CL

FineSteer 是一个新颖的推理时控制框架,将控制分解为条件控制和细粒度向量合成两个阶段,采用子空间引导条件控制(SCS)和混合控制专家(MoSE)机制来提高安全性和真实性,同时保持模型效用。实验表明在 TruthfulQA 上相比最新方法有 7.6% 的性能提升,且效用损失最小。

流形引导注意力转向

arXiv cs.LG

提出了流形引导的注意力转向(MAGS),这是一种轨迹感知的推理时干预方法,通过将注意力输出投影回学习的正确性流形(当偏差超过阈值时)来纠正LLM中的推理错误,在数学、代码和分子基准测试中优于静态转向方法。

通过定向干预实现语言模型的多属性引导

arXiv cs.CL

MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。