引导向量中的反向检测与控制
摘要
本文识别出一种“反向检测-控制”现象,即某些具有判别性的引导向量,尽管与积极概念表征对齐,却一致地促进相反行为。作者提出了一种无需生成即可检测此类反向引导向量的方法,通过符号翻转改进了基于检测的引导流程,并在多个大语言模型和概念上取得提升。
arXiv:2608.02957v1 公告类型:新
摘要:引导向量(Steering Vectors, SVs)被广泛用于影响大语言模型输出中概念(如真实性)的表达。支撑SVs的一个关键假设是,它们相对于概念是线性可分的:具有该概念的文本表征比不具该概念的文本表征与SV的对齐程度更高,这促使沿SV正方向或负方向移动分别促进或抑制该概念。在这项工作中,我们识别出一种“反向检测-控制”现象,其中一些与正向表征对齐的高判别性SV能够一致地促进相反行为。我们将此类向量称为反向引导向量(Inverted-Steering Vectors, ISVs)。我们对ISVs的影响进行了几何刻画,发现沿这些方向进行引导会系统性地将判别性下游头中的表征推向仿佛概念不存在时的状态,甚至在解码之前就已如此。基于这一分析,我们提出了一种无需生成或相关响应评分即可区分ISVs的方法。这实现了有针对性的符号翻转,我们据此通过推理时间干预(Inference Time Intervention, ITI)改进了基础的基于检测的引导流程。我们的方法在27/30项实验中提升了结果,提升幅度从+0.9%到+138%。我们在Gemma 3 12B、Qwen 2.5 14B和Olmo 3 7B上评估了我们的发现,涵盖5个概念。
查看缓存全文
缓存时间: 2026/08/05 07:43
# 转向向量中的反向检测与控制 来源:https://arxiv.org/html/2608.02957 Max Torop Aria Mas
相似文章
完美检测,控制失效:语言模型中认知与引导的几何关系
本文研究了语言模型激活中检测行为的向量与控制行为的向量之间的几何关系,发现对于幻觉检测,它们几乎正交(余弦约0.12),而对于输出格式,它们完美对齐,这对机械可解释性中的一个常见假设提出了挑战。
面向可信赖大语言模型推理的概率概念感知引导
本文介绍了面向大语言模型推理的概率概念感知引导(PCS)框架,该框架利用概念驱动的引导向量检索和概率强度校准,提升了可解释性、最优性和泛化能力,在多个数据集上实现了方向准确率提高超过30%,引导准确率超过89%。
从 J 空间提取控制向量
本文研究探讨利用 Jacobian 空间从概念标记提取控制向量以调控大语言模型行为,基于 Qwen3-1.7B 的实验表明,该方法在简单任务中展现潜力,但在复杂场景中存在局限。
预测方向向量的有效性
本论文介绍了线性可访问性配置文件(LAP),一种使用logit lens的诊断方法,用于预测方向向量在模型各层的有效性,在5个模型的24个概念族上实现了ρ=+0.86到+0.91的相关性。该工作提供了一个系统框架来确定哪些层和概念适合用于方向干预,替代了临时性的试错方法。
MidSteer: 用于引导生成模型的最优仿射框架
介绍MidSteer,一个用于生成模型中概念引导的理论框架,通过为LLMs和视觉扩散模型中的概念引导、擦除和切换提供最优仿射变换,弥合了经验成功与理论理解之间的差距。