从LLM激活中测量文本的概念内容:概念向量与线性探针的ESG证据
摘要
本文提出使用线性探针和RFM概念向量,从LLM内部激活中测量文本的概念内容,并将其应用于ESG分类。最佳线性探针在无需任务特定微调的情况下接近微调分类器的准确率,且优于模型自身输出,表明激活携带了响应之外的概念内容。
arXiv:2608.07208v1 公告类型:新
摘要:现有的衡量文本在多大程度上涉及某个概念的方法,读取的是文本的表层:词典词占比、主题比例、嵌入相似度。它们对文本使用的词语打分,而非读者对其形成的判断。近期研究表明,大型语言模型(LLM)内部所知道的内容与其在响应中表达的内容之间存在差距。本文探讨的问题是:通过监测冻结的、开箱即用的LLM的激活来读取这种内部知识,是否能在测量概念内容时替代任务特定的微调,以及哪种提取方法读取效果最好。我们通过递归特征机(RFM)算法和线性探针提取此类度量,并将它们与嵌入基线、表层基线以及同一模型对该问题的自身回答进行比较。我们在金融文本上演示了该方法,该领域被广泛研究并拥有成熟的标注资源,使用的是人工标注的环境、社会和治理(ESG)数据集。最佳线性探针在无需任何任务特定微调的情况下,与微调后的领域分类器准确率相差0.6个百分点,并且在十二次比较中有十一次优于同一模型自身对该问题的回答,因此激活携带了响应未报告的概念内容。简单的探针始终优于RFM概念向量,而后者则提供了仅靠分类无法提供的东西:一个旨在反映概念在文本中存在强度的连续分数,其验证有待分级标签。
查看缓存全文
缓存时间: 2026/08/10 08:05
# 从LLM激活中衡量文本的概念内容:来自概念向量与线性探测的ESG证据 来源:https://arxiv.org/html/2608.07208 Luc Hazenoot Zhaochun Ren Amirhossein Zohrehvand 莱顿大学高级计算机科学研究所 \(2026年8月\) ###### 摘要 现有的衡量文本在多大程度上涉及某个概念的方法,读取的是文本表面:词典词语占比、主题比例、嵌入相似度。它们对文本使用的词语打分,而非读者形成的判断。近期研究表明,大语言模型(LLM)内部所知道的内容与其在回答中所表达的内容之间存在差距。本文提出的问题是:通过监测LLM的激活来读取这种内部知识,能否在衡量概念内容时替代针对特定任务的微调,以及哪种提取方法读取效果最好?我们通过递归特征机(RFM)算法和线性探测来提取此类度量,并将其与嵌入基线、表面基线以及同一模型对同一问题的自身回答进行比较。我们在金融文本上演示该方法,该领域已有广泛研究并建有成熟的人工标注资源,我们使用了一个人工标注的环境、社会和治理(ESG)数据集。最优的线性探测在未进行任何任务特定微调的情况下,与经过微调的领域分类器的准确率相差仅0.6个百分点,并且在十二次比较中有十一次优于同一模型对同一问题的自身回答,因此激活携带了回答未报告的概念内容。简单的探测始终优于RFM概念向量,而RFM概念向量则提供了分类本身无法提供的东西:一个旨在反映概念在文本中存在强度的连续分数,其验证有待分级标签的推出。 ## 1 引言 研究文本的测量者通常想知道文本中有多少内容与某个概念相关,而不仅仅是该概念是否出现。现有度量从文本表面读取这些信息。词典统计概念词,主题模型将词语分配给主题,嵌入方法将文本与嵌入空间中的概念方向进行比较(Loughran & McDonald,2011 (https://arxiv.org/html/2608.07208#bib.bib16); Gentzkow et al.,2019 (https://arxiv.org/html/2608.07208#bib.bib9); Kozlowski et al.,2019 (https://arxiv.org/html/2608.07208#bib.bib14); Li et al.,2021 (https://arxiv.org/html/2608.07208#bib.bib15); Zohrehvand et al.,2024 (https://arxiv.org/html/2608.07208#bib.bib24))。这些度量的共同之处在于,它们对文本使用的词语打分,而非读者形成的判断。这一差距在任何概念难以枚举之处显现:一份报告涉及多少可持续性内容,一场财报电话会议涉及多少风险内容。 大语言模型(LLM)在内部形成了更接近这种判断的东西。近期研究表明,LLM在其内部激活中编码的内容比其在回答中表达的内容更多(Beaglehole, Radhakrishnan, et al.,2026 (https://arxiv.org/html/2608.07208#bib.bib4); Burns et al.,2023 (https://arxiv.org/html/2608.07208#bib.bib6); Azaria and Mitchell,2023 (https://arxiv.org/html/2608.07208#bib.bib2); Marks & Tegmark,2024 (https://arxiv.org/html/2608.07208#bib.bib17); Gurnee et al.,2026 (https://arxiv.org/html/2608.07208#bib.bib10))。简单的线性探测甚至可以直接从冻结模型的激活中读取分级量,例如地点和时间(Gurnee & Tegmark,2024 (https://arxiv.org/html/2608.07208#bib.bib11))。因此,即使模型输出将判断简化为是或否,模型也可能在内部记录文本与某个概念的关联强度。然而,金融领域的应用工作仍然基于模型输出或嵌入特征构建度量,而非基于这些内部激活:一项综合调查涵盖了金融领域NLP的十项主要应用,其中没有一项涉及监测LLM的内部激活(Du et al.,2025 (https://arxiv.org/html/2608.07208#bib.bib8))。 最近的两个研究方向最接近于将这种内部信号转化为度量。线性表示假说提出,概念可以线性地作为激活空间中的方向被访问(Park et al.,2024 (https://arxiv.org/html/2608.07208#bib.bib18); Marks & Tegmark,2024 (https://arxiv.org/html/2608.07208#bib.bib17))。在此基础上,Beaglehole, Radhakrishnan, et al. (2026 (https://arxiv.org/html/2608.07208#bib.bib4)) 使用递归特征机(RFM)算法将此类方向提取为概念向量,并将其用于跨数百个概念对模型进行引导和监测。Yang et al. (2024 (https://arxiv.org/html/2608.07208#bib.bib23)) 将冻结LLM的隐藏状态投影到学习到的概念方向上,以获得用于社会科学研究的连续文本度量。目前缺少的是在应用基准上进行受控比较:哪种提取方法能产生更好的度量,以及这些廉价的冻结模型方法距离任务特定的微调分类器有多近。 因此,我们提出以下问题:冻结LLM的内部激活能否充分衡量概念内容,从而替代任务特定的微调?哪种提取器读取它们的效果最好?我们在人工标注的环境、社会和治理(ESG)数据集(Schimanski et al.,2024 (https://arxiv.org/html/2608.07208#bib.bib20))上,将线性探测和RFM概念向量方法与嵌入基线进行比较,该数据集已发表的微调分类器提供了强有力的参考点。我们预期Beaglehole, Radhakrishnan, et al. (2026 (https://arxiv.org/html/2608.07208#bib.bib4)) 的发现成立:他们的RFM概念向量方法应当能够从其研究领域迁移到我们的领域,使RFM成为我们基于激活的方法中最强的方法。但结果并非如此:更简单的线性探测始终是最好的基于激活的方法。在未进行任何任务特定微调的情况下,它在环境、社会和治理三个支柱上的准确率分别与最佳微调模型相差0.6、1.0和2.1个百分点。该探测在十二次比较中有十一次也优于直接向同一模型提出相同问题,因此读取激活能够恢复输出未表达的概念内容。在分类之外,RFM概念向量产生了一个连续分数,旨在反映概念在句子中存在的强度。当前ESG数据集仅携带二元标签,因此验证这种分级读取有待未来工作。我们的贡献是一种廉价、现成的概念内容度量方法,适用于冻结的、开箱即用的LLM,以及一项面对面比较,表明最简单的提取器目前最强。 ## 2 背景与相关工作 从冻结模型中测量概念依赖于一个前提和两个设计选择。前提是概念在模型的激活中作为方向存在,可以从激活中读出。选择是如何将带标签的激活转化为该方向,以及如何将句子产生的众多激活向量简化为两种提取器都需要的单一向量;实验对两者进行了变化。 ### 2.1 激活与概念向量 现代仅解码器的LLM采用Vaswani et al. (2017 (https://arxiv.org/html/2608.07208#bib.bib22)) 引入的Transformer架构:一堆相同的计算块,也称为隐藏层,每个块由自注意力层和前馈层组成。这些模型中的注意力是因果的:当一个标记的表示被更新时,它可以查看自身及其前面的标记,而永远不能查看尚未出现的标记。一个令牌化的提示词通过堆栈一次,每个块为每个令牌留下一个向量,即隐藏状态或激活,位于该块的激活空间中,这是一个通常有数千维的高维空间。深度因模型而异,有些模型包含30层或更少,其他模型则有80层或更多。这些激活是模型对到目前为止所读内容的内部表示(Belinkov,2022 (https://arxiv.org/html/2608.07208#bib.bib5))。每个块都有自己的激活空间,并编码不同类型的信息。早期块倾向于捕获低层特征,而中后期层捕获更抽象的特征(Tenney et al.,2019 (https://arxiv.org/html/2608.07208#bib.bib21))。 线性表示假说认为,概念在这个空间中作为方向是可访问的(Park et al.,2024 (https://arxiv.org/html/2608.07208#bib.bib18); Marks & Tegmark,2024 (https://arxiv.org/html/2608.07208#bib.bib17))。概念向量就是单一层激活空间中的这样一个方向。如果正确找到,它应当指向对预测概念最重要的特征。概念向量有两种使用方式:通过将向量添加到新的激活中以引导模型趋向该概念,或者监测该概念在新激活中的活跃程度;本文仅进行监测。 监测是值得的,因为模型知道的内容比其在回答中表达的更多(Beaglehole, Radhakrishnan, et al.,2026 (https://arxiv.org/html/2608.07208#bib.bib4); Burns et al.,2023 (https://arxiv.org/html/2608.07208#bib.bib6); Azaria and Mitchell,2023 (https://arxiv.org/html/2608.07208#bib.bib2)),因此读取激活可以恢复输出遗漏的内容。Gurnee et al. (2026 (https://arxiv.org/html/2608.07208#bib.bib10)) 进一步明确了这一图景:激活中只有一个小子空间,集中在中间层,承载着模型可以口头报告的内容,而其余部分驱动着模型从不诉诸言语的处理过程。监测也很廉价。验证模型的真实性以前依赖于单独的模型来检查幻觉和准确性,而监测可以在单个GPU上在一分钟内运行(Beaglehole, Radhakrishnan, et al.,2026 (https://arxiv.org/html/2608.07208#bib.bib4); Zou et al.,2023 (https://arxiv.org/html/2608.07208#bib.bib25))。 ### 2.2 线性探测与RFM 两种监督方法可以在保持模型冻结的情况下将带标签的激活转化为这样的方向,它们正是本文比较的一对方法。 线性探测使用轻量级线性分类器来解释冻结LLM的激活空间,用于分类任务(Alain and Bengio,2017 (https://arxiv.org/html/2608.07208#bib.bib1); Belinkov,2022 (https://arxiv.org/html/2608.07208#bib.bib5))。分类器在带标签的激活上训练,以找到最能将所需概念与其缺失分开的方向。其预测随后被解释为该概念在该层中被表示的强度(Belinkov,2022 (https://arxiv.org/html/2608.07208#bib.bib5); Hewitt & Liang,2019 (https://arxiv.org/html/2608.07208#bib.bib12))。常用的模型包括线性岭回归(Hoerl & Kennard,1970 (https://arxiv.org/html/2608.07208#bib.bib13))和逻辑回归。此类探测可以直接从冻结模型的激活中读取诸如地点和时间等分级量(Gurnee & Tegmark,2024 (https://arxiv.org/html/2608.07208#bib.bib11))。 递归特征机(RFM)算法是由Beaglehole, Holzmüller, et al. (2026 (https://arxiv.org/html/2608.07208#bib.bib3)) 开发的一种监督模型。它旨在通过使用非线性作用于LLM的带标签激活作为输入来寻找类别之间的分离。它通过计算平均梯度外积(AGOP)矩阵来实现这一点,该矩阵衡量哪些特征对区分类别最重要。该矩阵在每次迭代结束时重新计算,随着算法重复,它不断更新矩阵以捕获哪些特征最重要。Beaglehole, Radhakrishnan, et al. (2026 (https://arxiv.org/html/2608.07208#bib.bib4)) 发现,这同一个AGOP矩阵也可以用于提取概念向量。通过应用特征分解,从矩阵中提取前n个特征向量。这些向量最能区分类别,它们就是概念向量。以这种方式找到概念向量并非RFM算法的原始目的;它是AGOP矩阵捕获用于分离类别的最重要方向这一过程的副产品。 这两种方向都已被用作度量:Beaglehole, Radhakrishnan, et al. (2026 (https://arxiv.org/html/2608.07208#bib.bib4)) 监测跨数百个概念的RFM概念向量,Yang et al. (2024 (https://arxiv.org/html/2608.07208#bib.bib23)) 将冻结LLM的隐藏状态投影到学习到的概念方向上,以获得用于社会科学研究的连续文本度量。两者均未将这两种提取器相互比较。 ### 2.3 Token池化 两种提取器通常每个层需要一个单一的固定大小向量,但在一个块处理完包含N个令牌的提示词之后,该块会输出一个由N个激活向量组成的序列,每个令牌一个。Token池化是指将该序列转换为一个向量的方法,有三种常见策略:最后一个令牌激活、均值池化和最大池化(Reimers & Gurevych,2019 (https://arxiv.org/html/2608.07208#bib.bib19))。 最后一个令牌激活使用序列中最终令牌的激活向量作为提示词的表征。由于仅解码器LLM中的令牌可以看到其前面令牌的值,最后一个令牌已经看到了整个序列,因此可以被解释为包含序列的摘要。 均值池化取N个激活向量整个序列的均值,产生一个单一向量。它平等对待每个令牌,这使信号保持可见,但会稀释仅在少数令牌中活跃的信号。 最大池化从N个令牌激活向量序列中取每个信号的最大值,产生一个单一向量。它强调每个方向上最强的激活,这增强了仅在少数令牌中活跃的信号,但也使最大池化比均值池化对异常值更敏感。 ## 3 方法 我们将两种基于激活的方法与嵌入基线、表面基线、同一模型对同一问题的自身回答以及数据集随附的微调分类器进行比较。 ### 3.1 基线与模型 作为基线,我们使用一个嵌入模型。嵌入模型是将文本转换为可用于分类的密集特征向量的标准方式(Reimers & Gurevych,2019 (https://arxiv.org/html/2608.07208#bib.bib19))。这使我们能够实际了解传统NLP方法在我们的任务上的表现,然后可以与我们基于激活的方法进行比较。 对于嵌入基线,我们使用Qwen-3-embedding-8b模型。我们选择这个模型,因为它是一个基于Qwen-3系列的最新嵌入模型,而我们也使用该系列进行基于激活的实验。我们遵循模型的推荐输入格式,为每个句子添加一个描述所分类支柱的任务指令前缀,以便基线获得与包装器提供给基于激活方法相同的任务框架。我们取所得的嵌入,并将其用作逻辑回归模型中的输入特征,以预测二元标签。我们通过对5折交叉验证的指标取均值来进行预测,这减少了数据集可能引入的划分偏差,并使评估与其他实验保持一致。 在我们的实验中,我们使用了一系列仅解码器模型,以测试不同家族和规模的表现。Llama-3.1-8b-it是一个仅解码器模型,由32层组成,共有80亿个参数。先前的研究已经表明,该模型
相似文章
它们在思考什么?大语言模型中概念的界定、探测与追踪
本文提出了一种界定概念的方法,并训练线性探测器在大语言模型的嵌入中检测这些概念,以四个示例概念在三个模型上进行验证。该工作旨在实现对LLM内部表示的可扩展监控。
Polar Probe线性解码LLM中的语义结构
本文提出了一种Polar Probe,通过在学习的子空间中用距离和方向表示实体关系,从LLM激活中线性恢复语义结构。在算术、视觉场景、家谱、地铁地图和社交互动等多个领域的测试表明,该编码出现在中间层,能泛化到新实体,并对模型预测产生因果影响。
大型语言模型的地理空间概念探测:抽象性、组合性与接地
本文引入了一个以概念为中心的基准,用于探测LLM对方向、距离和拓扑等地理空间概念的理解,测试不同模型架构和规模下的抽象性、组合性与接地性。研究结果揭示了当前LLM在概念理解上的明显局限。
接地鸿沟:大语言模型如何以不同于人类的方式锚定抽象概念的含义
本研究调查了大语言模型(LLMs)与人类在理解抽象概念时的“接地”(grounding)差异,发现存在显著的“接地鸿沟”:模型过度依赖词语联想,而较少涉及情感或内在状态。作者利用稀疏自编码器(SAEs)识别出与接地维度相关的内部特征,表明LLM虽然具备这些信息,但在自由生成文本时并未像人类一样自然地调用它们。
探究语言模型的思维失调过程
本文提出通过将LLM的失调分解为细粒度的认知过程(失调指标),并利用线性探针检测内部激活中的这些指标,从而在分布外对话记录上实现了高AUROC。