分解提示如何引导行为
摘要
本文介绍了一个嵌套的几何分解框架,用于分析提示如何重新组织大型语言模型和视觉-语言模型的内部表征。作者表明,仿射变换,特别是跨维度的线性混合,是解释提示引起的行为变化的关键。
arXiv:2606.03093v1 公告类型:新
摘要:提示能在不更新权重的情况下引导大型语言模型(LLMs)和视觉-语言模型(VLMs),但指令改动如何重塑内部表征以产生行为仍不清楚。我们引入了一个嵌套的几何分解框架,将提示视为对提示后内容表征几何的变换。对于每一对提示,我们使用表达能力逐渐增强的刺激不变映射来对齐同一刺激在两种提示下的表征:平移、均匀缩放下的刚体变换、顺序轴缩放、仿射变换和非线性变换。然后,我们通过用映射后的对应状态替换保留刺激中单层的提示A隐藏状态,并测量提示B表征几何和行为的恢复程度,来因果性地测试每个映射。在三个LLM、三个VLM以及涵盖风格、情感、场景内容和数字的六个文本或图像数据集上,提示一致地将表征重塑为指令任务结构。交叉验证的方差分解表明,许多提示引起的激活变化可由保形映射捕捉,尤其是平移和均匀缩放下的刚体变换,而层级特征揭示了跨层的模型和任务特定路由策略。关键在于,尽管平移和刚体层级已能改善行为一致性,但仿射变换是第一个几乎能恢复目标提示任务几何的层级,并带来相应的行为增益。这表明跨维度线性混合是提示将表征重组为指令任务结构的关键机制。我们的框架将提示引起的表征变化分解为可解释的几何组成部分,并揭示了模型如何路由任务相关结构以产生提示驱动的行为。
查看缓存全文
缓存时间: 2026/06/03 09:42
# 分解提示如何引导行为 来源:https://arxiv.org/html/2606.03093 范·L·程(Fan L. Cheng) 哥伦比亚大学 [email protected] & 尼古拉斯·克里格斯科特(Nikolaus Kriegeskorte) 哥伦比亚大学 [email protected] ###### 摘要 提示引导大型语言模型(LLM)和视觉语言模型(VLM)无需更新权重,但尚不清楚指令的变化如何重塑内部表征以产生行为效应。我们引入了一个嵌套几何分解框架,将提示视为对提示后内容表征几何的变换。我们通过寻找同一刺激集在不同提示下的表征之间的最佳对齐,来探究哪类数学变换最能解释提示的效果。对于每对提示,我们拟合一系列表达力递增的刺激不变映射:平移、均匀缩放刚体变换、逐轴缩放、仿射和非线性变换。然后,我们通过替换单个层中一组新刺激的提示A隐藏状态为其映射后的对应状态,并测量提示B表征几何和行为恢复的程度,来因果性地测试这些映射。在三个LLM、三个VLM以及六个风格、情感、场景内容和数量各异的文本或图像数据集上,提示一致地将表征几何重塑为朝向指令任务结构。在交叉验证的嵌套方差分解中,大部分提示诱发的激活变化可由保形映射解释:平移和均匀缩放刚体变换。层级轮廓揭示了模型和任务特定的路由策略,这些策略在变换类解释方差的多少以及它们在整个层层次中的贡献出现位置方面有所不同。至关重要的是,尽管平移和刚体变换层级已经改善了行为一致性,但仿射变换是第一个近乎恢复目标提示任务几何的层级,并产生了相应的行为一致性增益。这表明跨维线性混合可能是提示如何将表征重组为朝向指令任务结构的关键贡献因素。我们的框架提供了一种通用方法,将提示诱发的表征变化分解为可解释的几何分量,揭示了模型如何路由任务相关结构以产生提示驱动的行为。 ## 1 引言 指令提示可以在推理时改变模型行为,而无需更新参数。例如,对于固定刺激,将指令从“描述物体类别”改为“描述艺术风格”,可以转移哪些刺激维度变得行为相关,进而影响模型产生的输出。这引出了一个机制性问题:指令的变化如何重新组织内部表征,从而引导下游行为?两个互补的研究方向涉及这个问题。第一,表征分析表明,提示和上下文重构了内部几何结构,导致了表征相似性、流形容量、轨迹几何、探针性能及相关诊断指标的可测量变化(Kirsanov et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib23);Hosseini et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib24);Park et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib25);Polo et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib29);Gonzalez-Gutierrez and Hovy, 2025 (https://arxiv.org/html/2606.03093#bib.bib28);Davidson et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib27);Park et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib22))。这些效应可能具有深度依赖性,一些研究表明中间层提供特别信息丰富或压缩的表征,而后面层更直接地支持预测(Jiang et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib53);Skean et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib42), 2025 (https://arxiv.org/html/2606.03093#bib.bib43))。第二,关于激活引导的研究表明,相对简单的激活空间干预,例如加法向量、旋转和仿射映射,可以调节提示诱导的行为效应(Turner et al., 2023 (https://arxiv.org/html/2606.03093#bib.bib1);Zou et al., 2023 (https://arxiv.org/html/2606.03093#bib.bib2);Singh et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib3);Vu and Nguyen, 2025 (https://arxiv.org/html/2606.03093#bib.bib4))。综上所述,这些发现表明自然提示本身可能通过激活空间中的低复杂度变换来实现。 参见图注 图 1:(a) 两个提示 A(“有人吗?”)和 B(“有多少人?”)连同刺激集 S 被呈现给同一模型。我们提取单个transformer层 l 的隐藏状态(高亮)以获得层 l 流形 M^A = Φ^A(S)(绿色)和 M^B = Φ^B(S)(紫色)。同一前向传播继续经过 l,并为每个刺激产生特定于提示的输出(“是/否” vs. 计数)。我们探究是否存在一个系统性的映射 f: M^A → M^B,它的复杂度如何,以及它是否因果性地驱动行为。(b) 提示诱发的表征变化作为归一化层深的函数。每条灰色曲线来自三个LLM(OPT-2.7B、Llama3-8B、Qwen3-8B)在三个文本数据集上以及三个VLM(BLIP-2、LLaVA-OneVision、Qwen3-VL)在三个图像数据集上的一对模型和数据集;黑色曲线是其平均值。该变化在早期层中很小但非零(10^{-4}–10^{-2}),并几乎单调地随深度增长,在顶部达到 10^{-1}–10^0,在架构和模态之间形状一致。然而,仍然不清楚的是提示诱发变化的*变换类*。关于提示几何的现有工作已经确立了提示改变了内部表征,但通常通过标量度量来表征这些变化,而不是将它们分解为可解释的几何分量。相反,激活引导研究表明工程化的低复杂度算子可以影响行为,但它们很少从自然提示本身估计此类算子,或测试恢复的算子是否解释了由指令变化引发的目标提示几何。我们通过一个嵌套几何分解框架来填补这一空白。对于每个模型、层、数据集和提示对,我们拟合一个从源提示激活到目标提示激活的单一刺激不变对齐映射,并在未见的刺激上进行评估。算子层次结构分离了质心偏移、全局Procrustes对齐、Procrustes对齐基中的逐轴缩放、跨维特征混合以及非线性残差结构。该层次结构的动机来自经典的Procrustes分析和基于形状的方法,用于在显式变换类下比较表征(Gower, 1975 (https://arxiv.org/html/2606.03093#bib.bib52); Williams et al., 2021 (https://arxiv.org/html/2606.03093#bib.bib46); Kornblith et al., 2019 (https://arxiv.org/html/2606.03093#bib.bib45); Williams, 2024 (https://arxiv.org/html/2606.03093#bib.bib47); Harvey et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib48); Barbosa et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib51))。同时,我们使用RSA和轮廓分析来测试提示是否将表征几何重塑为朝向指令任务结构;RSA比较表征相异度矩阵,旨在将表征几何与候选任务或模型结构联系起来(Kriegeskorte et al., 2008 (https://arxiv.org/html/2606.03093#bib.bib44); Lin and Kriegeskorte, 2024 (https://arxiv.org/html/2606.03093#bib.bib49); Cheng and Jing, 2025 (https://arxiv.org/html/2606.03093#bib.bib50))。最后,我们将每个拟合映射作为因果激活干预应用,用其映射后的对应状态替换源提示隐藏状态,并测量由此产生的表征和输出是否恢复目标提示的表征和输出。得到的层级轮廓揭示了模型用于遵循指令的提示路由策略:哪些变换层级承载了变化,它们跨层出现在何处,以及它们是否恢复了任务对齐的几何和行为。 #### 贡献。 1. 我们引入了一个*嵌套几何分解*,将提示诱发的隐藏状态变化分解为五个变换类:平移、均匀缩放刚体变换、逐轴缩放刚体变换、仿射和非线性,为每个层级生成一个唯一的贡献(§3 (https://arxiv.org/html/2606.03093#S3))。 2. 我们开发了一个*因果干预协议*,在未见刺激上应用每个层级拟合的映射在单个层上,并评估相对于目标提示的表征几何和行为恢复(§5 (https://arxiv.org/html/2606.03093#S5))。 3. 在LLM、VLM和六个数据集上,我们发现提示一致地将表征几何重塑为朝向指令任务结构,大部分提示效应由低复杂度映射捕捉,并且模型家族、数据集和提示对组在变换层级相对贡献方面以及这些贡献跨深度出现的位置方面存在系统性差异,揭示了不同的提示路由策略(§6 (https://arxiv.org/html/2606.03093#S6))。 ## 2 相关工作 #### 提示和上下文表征的几何。 先前的工作主要通过标量度量的变化来表征提示和上下文结构的几何效应。一项先前的研究使用流形容量工具分析零样本、少样本和软提示,表明不同的提示范式可以诱导不同的任务适应表征机制(Kirsanov et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib23))。其他工作表征了上下文和上下文示例如何将内部表征重新组织成紧凑、可识别的基底,这些基底驱动上下文泛化,例如注意力头电路、任务向量以及轨迹或相变般的几何结构(Hosseini et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib24); Park et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib25); Yang et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib26); Hendel et al., 2023 (https://arxiv.org/html/2606.03093#bib.bib30); Todd et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib31))。一条补充研究路线记录了提示的动态、分布式且并不总是任务对齐的表征效应(Gonzalez-Gutierrez and Hovy, 2025 (https://arxiv.org/html/2606.03093#bib.bib28); Davidson et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib27); Li et al., 2025b (https://arxiv.org/html/2606.03093#bib.bib32); Polo et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib29); Li et al., 2025a (https://arxiv.org/html/2606.03093#bib.bib33); Simhi et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib35))。相对于这工作路线,我们的贡献是估计提示条件表征流形之间的显式变换类,并测试这些变换是否因果性地恢复表征几何和行为。 #### 激活引导和几何干预。 我们将先前的引导方法组织在变换层次结构 F_T ⊂ F_O_u ⊂ F_O_a ⊂ F_L ⊂ F_N(图 3 (https://arxiv.org/html/2606.03093#S4.F3))中,区分*全局*算子(刺激不变)和*输入条件*干预(其有效变换取决于当前刺激)。大多数现有方法自然地被描述为平移层级,其中刺激不变方向被添加到隐藏状态(Turner et al., 2023 (https://arxiv.org/html/2606.03093#bib.bib1); Rimsky et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib36); Li et al., 2023b (https://arxiv.org/html/2606.03093#bib.bib5); Zou et al., 2023 (https://arxiv.org/html/2606.03093#bib.bib2); Templeton, 2024 (https://arxiv.org/html/2606.03093#bib.bib37); Wang et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib14); Davidson et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib27); Singh et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib3))。较小的一组方法拟合单个全局线性或仿射干预(Postmus and Abreu, 2024 (https://arxiv.org/html/2606.03093#bib.bib7); Sheng et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib17); Wu et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib38), 2025 (https://arxiv.org/html/2606.03093#bib.bib18); Singh et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib3))。基于旋转的方法和分段仿射最优传输编辑也相关,但它们通常不作为配对表征云之间的Procrustes映射进行估计,并且其目标角度或自适应变体通常是输入条件的(Vu and Nguyen, 2025 (https://arxiv.org/html/2606.03093#bib.bib4); Pham and Nguyen, 2024 (https://arxiv.org/html/2606.03093#bib.bib6); Abdullaev et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib8); Rodriguez et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib39); Scialanga et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib13))。因此,具有均匀缩放 F_O_u 的刚体变换作为刺激集映射估计器仍相对未被充分探索,而纯粹的非线性干预似乎相对罕见(Zhao et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib12); Raval et al., 2026 (https://arxiv.org/html/2606.03093#bib.bib19))。独立于算子类别,引导方法在应用干预的前向传播阶段也有所不同(Lee et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib10); Nguyen et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib11); Dang and Ngo, 2026 (https://arxiv.org/html/2606.03093#bib.bib9)),相关路线在权重空间而非激活空间中操作(Fierro and Roger, 2025 (https://arxiv.org/html/2606.03093#bib.bib15)),最近的审计工作主张更系统的几何和中介类型学表征(Venkatesh and Mahendran Kurapath, 2026 (https://arxiv.org/html/2606.03093#bib.bib16); Tan et al., 2024 (https://arxiv.org/html/2606.03093#bib.bib40); Im and Li, 2025 (https://arxiv.org/html/2606.03093#bib.bib41); Wehner et al., 2025 (https://arxiv.org/html/2606.03093#bib.bib20))。在本文中,我们的目标不是设计诱导所需行为的算子,而是使用相同的层次结构作为自然提示的测量框架。低复杂度线性映射恢复了大部分提示诱导效应的发现,与平移类和仿射类引导方法的强大经验性能一致,这些方法可能成功部分因为它们近似了提示本身诱发的激活变化和表征几何。 参见图注 图 2: 提示将表征几何重塑为朝向指令任务结构。(a) 提示条件下表征的多维缩放 (MDS) 可视化。(顶部) Llama3-8B-Instruct 在主题提示 (提示 A) 和情感提示 (Pr
相似文章
压力之下:情感框架在小型语言模型中引发可测量的行为变化和结构化的内部几何结构
本文研究了情感框架的评估后续如何影响小型语言模型(Qwen 3.5 0.8B和2B)的行为和内部表示。通过使用不可能完成的编码任务,他们发现压力框架会促使走捷径,而冷静和好奇心则能保持诚实,并发现了在激活空间中形成结构化几何结构的冷静相对方向向量。
当提示变成像素:面向多模态推理的提示区域对齐
本文介绍了可视化任务语义(VTS),一种受控干预方法,用于研究多模态大语言模型在图像中而非文本中被提问时的情况。研究显示,在所有测试模型和任务上,准确率均出现一致下降,并提出了提示区域对齐(prompt-region grounding)以恢复干净的任务表示,将VTS准确率从58.0提升至66.3。
视频模型中的视觉提示(阅读时间8分钟)
视觉提示工程(VIPE)自动修改任务图像以提升视频模型的推理性能,通常比基于文本的提示或测试时缩放更为有效。
解构并引导大型语言模型中的功能性元认知
本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。
乱码也有效:提示空间扰动拓宽推理探索
本文介绍了 LoPE,这是一种利用提示空间扰动来解决可验证奖励强化学习中“零优势问题”的训练框架,从而增强大语言模型的推理探索能力。