超越高频词:MonoTM用于可解释单语义特征的主题建模
摘要
MonoTM是一个可解释的主题建模框架,通过稀疏自编码器将混合估计与特征解释解耦,从而提供超越传统基于单词表示的语义有意义的主题。
arXiv:2609.09575v1 公告类型:新
摘要:主题模型对大规模文本语料库进行摘要,但高频词往往只能有限地表示主题语义。稀疏自编码器(SAEs)提供了一种通过从密集表示中提取可解释特征来超越单词级别描述的方法,但特征可解释性与主题推理质量之间的关系尚不明确。我们引入了\textbf{MonoTM},一个可解释的主题建模框架,它将这些角色解耦。在三个基准语料库上,我们表明文档-主题混合估计和语义解释倾向于不同的SAE配置和特征子集。MonoTM从完整的SAE特征袋表示中估计混合,并在固定后,基于一个单独的基于语料库的语义特征词汇表学习主题描述符。这种设计保留了全局主题结构,同时使用比单个单词更有意义的语义单元来表示主题,使它们对下游语料库分析更有用。
查看缓存全文
缓存时间: 2026/09/10 08:12
# 超越高频词:具有可解释单义特征的主题建模框架 MonoTM
来源:https://arxiv.org/html/2609.09575
作者:Bei Yu
隶属机构:信息研究学院,雪城大学
邮箱:[\{sjoh01,byu\}@syr\.edu](mailto:)
###### 摘要
主题模型可总结大规模文本语料库,但通常仅通过高频词来表征主题语义,其表现力有限。稀疏自编码器(SAEs)能够从稠密表示中提取可解释特征,从而超越词级描述的局限。然而,特征的可解释性与主题推断质量之间的关系尚不明确。我们提出了 **MonoTM**,一个可解释的主题建模框架,将这两个角色解耦。在三个基准语料库上的实验表明,文档‑主题混合比例估计与语义解释适合不同的 SAE 配置和特征子集。MonoTM 从完整的 SAE 特征袋表示中估计混合比例,并在此基础上,利用一组独立的、基于语料库语义特征的词汇来学习主题描述符。该设计在保留全局主题结构的同时,使用比单个词更具意义的语义单元来表示主题,使其在下游语料库分析中更加实用。
## 1 引言
文本是社会科学和人文学科中的主要证据来源,涵盖政治演讲、新闻报道、历史档案和文学语料库等。这些集合的规模催生了计算文本分析方法;因此,主题模型(特别是潜在狄利克雷分配(LDA)及其扩展)已成为语料库探索性映射和主题概括的常用工具(Blei 等人,2003 [https://arxiv.org/html/2609.09575#bib.bib4])。然而,其作为学术证据的作用仍存在争议(Da, 2019 [https://arxiv.org/html/2609.09575#bib.bib7];Grimmer 和 Stewart, 2013 [https://arxiv.org/html/2609.09575#bib.bib5];Shadrova, 2021 [https://arxiv.org/html/2609.09575#bib.bib6])。最近一项关于计算社会科学中主题模型验证的综述发现,验证和报告实践仍不一致,且不同研究间缺乏共识(Bernhard‑Harrer 等人,2025 [https://arxiv.org/html/2609.09575#bib.bib8])。部分原因在于,大多数主题模型将每个主题定义为词上的概率分布,用户通常根据最高概率词解释主题。然而在实践中,为推断出的主题分配简洁、人类可读的意义或标签可能具有挑战性(Chang 等人,2009 [https://arxiv.org/html/2609.09575#bib.bib9];Mei 等人,2007 [https://arxiv.org/html/2609.09575#bib.bib10])。尽管最近的神经主题模型通过结合预训练语言模型或文档嵌入来捕捉原始词数之外的语义信息,但这些模型通常仍提取高频词或短语来向用户描述每个主题(Bianchi 等人, 2021b [https://arxiv.org/html/2609.09575#bib.bib11];Dieng 等人, 2020 [https://arxiv.org/html/2609.09575#bib.bib12];Grootendorst, 2022 [https://arxiv.org/html/2609.09575#bib.bib2];Kardos 等人, 2025 [https://arxiv.org/html/2609.09575#bib.bib13])。这导致了主题模型输出(主题作为词分布)与许多分析人员需求(支持在阅读单个文档与识别粗粒度语料库主题之间的中间层次解释的语义单元)之间的差距。
除了主题表征之外,词语很少足以作为支持有意义下游语料库分析的语义单元,例如基于词重叠分析主题或文档之间的关系。机制可解释性领域的最新进展,特别是稀疏自编码器(SAEs)和自动解释性方法,为从预训练编码器生成的文档嵌入中提取人类可读的语义特征提供了途径。基于我们的实验发现,我们提出了 **MonoTM**,一个可解释的主题建模框架,它在实现有竞争力的文档‑主题混合比例估计的同时,能够生成经过验证的、人类可读的主题描述符。[^1]
## 2 背景与相关工作
### 2.1 机制可解释性与稀疏自编码器
机制可解释性旨在通过识别神经网络的内部组件及其如何组合成计算来解释神经网络。一个主要障碍是神经元通常具有多义性,对多个不相关的模式激活(Olah 等人, 2020 [https://arxiv.org/html/2609.09575#bib.bib17])。一个有影响力的解释是通过叠加实现的,即模型通过将特征编码在超完备的方向集中来表示比维度数更多的特征,这得益于底层因素的稀疏性(Elhage 等人, 2022 [https://arxiv.org/html/2609.09575#bib.bib16])。这促使研究从神经元转向学习到的特征方向。两种可扩展的策略支持这种转变。首先,Bills 等人(2023 [https://arxiv.org/html/2609.09575#bib.bib18])使用语言模型根据激活模式生成和评分内部方向的自然语言解释。其次,稀疏字典学习方法,特别是稀疏自编码器(SAEs),学习稀疏的、超完备的特征基,这些基通常能产生比神经元更具单义性的单元,并支持有意义的干预(Bricken 等人, 2023 [https://arxiv.org/html/2609.09575#bib.bib14];Huben 等人, 2024 [https://arxiv.org/html/2609.09575#bib.bib15])。最近的工作也将 SAEs 应用于稠密文本嵌入,恢复出可用于下游控制和分析的可解释语义因子(O’Neill 等人, 2024 [https://arxiv.org/html/2609.09575#bib.bib1])。基于这些思想,我们研究基于文档嵌入的 SAEs,将其作为主题建模的可复用语义单元来源,并采用“解释器–预测器”式协议来获取用于主题描述的经验证的特征标签。
### 2.2 主题模型
##### 主题模型概述。主题模型始于概率词袋(BoW)生成模型,如 LDA(Blei 等人, 2003 [https://arxiv.org/html/2609.09575#bib.bib4]),它将每个文档表示为主题的混合,每个主题表示为词上的分布。尽管 LDA 提供了清晰的概率语义和可解释的主题描述符,但其词袋假设忽略了上下文,并可能产生对频率和表面形式敏感的主题。神经主题模型使用推理网络进行摊销变分推理,而非迭代的每文档推理(ProdLDA;Srivastava 和 Sutton, 2017 [https://arxiv.org/html/2609.09575#bib.bib19])。文档‑主题混合比例的其他神经参数化包括 softmax 和断棍构造(Miao 等人, 2017 [https://arxiv.org/html/2609.09575#bib.bib20])。与此同时,嵌入感知模型(如 ETM)在词嵌入空间中表示主题,以在保持可解释性的同时提高对大型词汇表的鲁棒性(Dieng 等人, 2020 [https://arxiv.org/html/2609.09575#bib.bib12])。最近的方法引入预训练 Transformer 以注入上下文语义。一个代表性的方向是上下文化的主题建模。CombinedTM 在词袋式信号旁边使用上下文化嵌入以提高主题质量(Bianchi 等人, 2021b [https://arxiv.org/html/2609.09575#bib.bib11]),而 ZeroShotTM 通过多语言编码器扩展了这一思想,实现了跨语言、零样本主题推断(Bianchi 等人, 2021a [https://arxiv.org/html/2609.09575#bib.bib21])。除了上下文化,最近的工作还关注鲁棒性和效率。ECRTM 引入了嵌入聚类正则化以防止主题坍缩并鼓励更具区分性的主题(Wu 等人, 2023 [https://arxiv.org/html/2609.09575#bib.bib22])。FASTopic 进一步利用预训练 Transformer,同时在统一的、旨在快速、稳定且可迁移的框架中建模文档‑主题和主题‑词关系(Wu 等人, 2024b [https://arxiv.org/html/2609.09575#bib.bib23])。最后,S3 提供了一种基于分解的替代方案,它将主题视为嵌入空间中独立的语义轴,通过 ICA(而非聚类或神经解码器)发现(Kardos 等人, 2025 [https://arxiv.org/html/2609.09575#bib.bib13])。
##### 基于 SAE 的主题建模。最近的工作将稀疏自编码器与主题建模联系起来,利用机制可解释性的见解,并将 SAE 潜变量视为嵌入/激活空间中可复用的语义单元。Girrbach 和 Akata(2025 [https://arxiv.org/html/2609.09575#bib.bib24])将 SAEs 视为连续空间主题模型,通过将 SAE 目标推导为类 LDA 生成模型下的最大后验估计器。Zheng 等人(2025 [https://arxiv.org/html/2609.09575#bib.bib25])提出了机制主题模型(MTMs),该模型使用预训练的 SAE 对 LLM 激活进行特征化,并在 SAE 特征计数上拟合主题模型。虽然他们的 mLDA 最接近我们的基于特征袋的 LDA 方法,但 MTMs 依赖于预训练的 SAE 和外部特征描述。与这些先前工作不同,我们的目标不仅仅是用 SAE 潜变量替代词汇表中的词来进行主题建模。我们证明,对文档‑主题混合比例估计最有用的特征,与那些标签可以可靠解释的特征并不一定相同。这种经验上的不匹配促使了 MonoTM 的诞生,它将 SAE 特征的统计角色和解释角色解耦。尽管这种设计比重用预训练 SAE 词汇表成本更高,但它针对的是社会科学和数字人文等领域,在这些领域中,特定语料库的可解释性、可追溯性和验证通常比快速的主题发现更重要。
## 3 研究问题
我们的初始假设是,SAE 特征可以在主题建模中扮演两个不同的角色。如果一个文档嵌入可以表示为 SAE 特征的稀疏、非负线性组合,并且这些特征比原始嵌入维度更接近单义性,那么 SAE 特征既可以作为人类可读的语义单元,也可以作为估计文档‑主题混合比例的有用单元。这两个角色相关但不完全相同:易于标注的特征可能并非是最好地支持混合比例估计的特征。因此,我们首先分别研究这些角色,然后探讨如何在单个可解释的主题模型中将它们结合起来:
1. 在什么 SAE 配置下,语料库训练的特征成为可靠的可解释语义单元?
2. 在什么 SAE 配置下,SAE 特征为文档‑主题混合比例估计提供了有效的单元?
3. 我们如何使用 SAE 特征构建一个主题模型,该模型能够生成与强文档‑主题混合比例估计相对应的、可解释的语义主题描述符?
## 4 实验设置
##### 数据集。 为了最小化主观性地评估主题模型,我们将推断出的主题与标准基准提供的金标准类别标注进行比较(数据集统计见表 3 [https://arxiv.org/html/2609.09575#A1.T3])。我们使用(1)20 Newsgroups(用户生成的 Usenet 新闻组帖子;scikit‑learn 版本)(Lang, 1995 [https://arxiv.org/html/2609.09575#bib.bib27]),(2)Web of Science(WOS‑46985),使用摘要作为输入(Kowsari 等人, 2017 [https://arxiv.org/html/2609.09575#bib.bib26]),以及(3)Reuters(Reuters‑21578),使用 ModApte 划分(Lewis, 1997 [https://arxiv.org/html/2609.09575#bib.bib29]),通过 Hugging Face Datasets 获取(Lhoest 等人, 2021 [https://arxiv.org/html/2609.09575#bib.bib28])。Reuters 是一个多标签且高度不平衡的路透社新闻故事集合。对于 Reuters,我们保留出现至少 30 次的标签,最终得到 47 个主题。
##### 文档嵌入与 SAE 训练。 我们使用 NVIDIA 的 llama‑embed‑nemotron‑8b 模型(Babakhin 等人, 2025 [https://arxiv.org/html/2609.09575#bib.bib30])将每个文档 \(d\) 映射为稠密嵌入 \(x_d \in \mathbb{R}^{4096}\)。我们使用模型完整的 32,768 个 token 的上下文窗口(NVIDIA, 2025 [https://arxiv.org/html/2609.09575#bib.bib31]);更长的文档被截断到前 32,768 个 token。这仅影响 20 Newsgroups 中的 18 个文档。对于每个语料库,我们在维度标准化的文档嵌入上训练 top‑\(K\) 稀疏自编码器。每个 SAE 学习一个包含 \(m \cdot N\) 个潜特征的字典,其中 \(m=4096\) 是嵌入维度,\(N\) 是扩展因子。因此,\(N\) 控制学习到的特征字典的大小,而 \(K\) 控制每个文档的最大活跃特征数。给定一个文档嵌入,编码器产生非负的潜激活,并仅保留最大的 \(K\) 个,从而得到稀疏的文档‑特征表示。解码器从这些活跃特征重构标准化嵌入。因此,这两个 SAE 超参数具有不同的角色:\(N\) 控制字典容量,而 \(K\) 控制每文档活动度。我们扫描了 11 个 \(N\) 值(从 1/64 到 5)和 8 个 \(K\) 值(从 4 到 512),省略了 \(m \cdot N\) 超过可用文档数量的配置。对于每个语料库,我们训练 SAE 直到验证损失收敛。
##### 自动解释性协议。 为了量化每个特征的可解释性,我们采用 O’Neill 等人(2024 [https://arxiv.org/html/2609.09575#bib.bib1])提出的“解释器–预测器”协议。对于每个在文档子集 \(\mathcal{S}_f\) 上激活的特征 \(f\),我们首先使用大型语言模型(LLM)作为解释器,根据该特征的激活文档生成自然语言描述 \(\ell_f\)。然后,我们让 LLM 作为预测器,判断该描述是否能预测文档 \(d\) 是否会激活特征 \(f\):若激活则 \(h_{d,f}>0\)(特征 \(f\) 对文档 \(d\) 活跃),否则 \(h_{d,f}=0\)(不活跃)。令 \(y_{d,f} = \mathbf{1}[h_{d,f} > 0]\) 表示真实的激活指示符。我们将预测器作为独立的每文档二元分类查询运行。对于每个 \(d \in \mathcal{S}_f\),预测器 LLM 仅接收描述 \(\ell_f\) 和原始文档文本,输出一个二元预测 \(\hat{y}_{d,f} \in \{0, 1\}\),指示特征 \(f\) 是否会激活(参见图 2 [https://arxiv.org/html/2609.09575#A3.F2] 中的预测器提示)。我们将这些文档级预测聚合为特征级的可解释性分数,即 \(\{\hat{y}_{d,f}\}_{d \in \mathcal{S}_f}\) 与 \(\{y_{d,f}\}_{d \in \mathcal{S}_f}\) 之间的 F1 分数,并记该分数为 \(\mathrm{IS}(f)\)。
##### 自动解释性扫描与 LLM 设置。 运行解释器–预测器协议需要大量的 LLM 推理调用,因此由于成本限制,我们仅将其应用于预期最具信息量的 SAE 配置子集:\(N \in \{0.5, 1, 2, 3, 4, 5\}\) 和 \(K \in \{4, 8, 16, 32\}\)。所用 LLM 的详细信息见附录 D [https://arxiv.org/html/2609.09575#A4]。
## 5 结果
### 5.1 RQ1:SAE 特征何时成为可解释的语义单元?
RQ1 询问语料库训练的 SAE 特征能否作为可靠的语义单元,以及这如何依赖于 SAE 的容量和稀疏性。我们使用第 4 节 [https://arxiv.org/html/2609.09575#S4] 中描述的解释器–预测器协议来操作化可解释性:当一个特征的自然语言标签能够以高于验证阈值的可解释性分数预测其留出的激活情况时,该特征被视为可解释的。
##### 实验结果。 SAE 特征在低至中等的每文档活动水平下最一致地成为可解释的语义单元。在所有三个数据集中,具有较小 \(K\) 值的配置具有最高比例的激活特征通过验证(表 4 [https://arxiv.org/html/2609.09575#A5.T4]、表 5 [https://arxiv.org/html/2609.09575#A5.T5] 和表 6 [https://arxiv.org/html/2609.09575#A5.T6])。增加 \(K\) 会改变这一行为。在宽松的验证阈值下,较大的 \(K\) 通常会增加通过验证的特征的绝对数量,因为更多活跃的特征被暴露出来进行标注和验证。然而,当我们对评估的所有 \(N\) 值取平均时,激活特征中通过验证的比例单调下降。
[^1]: MonoTM 的官方代码库位于 https://github.com/Una-J/MonoTM相似文章
扩展单义性:从Claude 3 Sonnet中提取可解释特征
本文展示稀疏自编码器能够从生产级语言模型Claude 3 Sonnet中提取可解释特征,解决了字典学习方法在扩展性方面的担忧。这些特征具有多语言、多模态特性,并涵盖欺骗、谄媚等安全相关概念,且对模型输出具有因果影响。
基于共现词网络的不平衡短文本数据集主题模型
本文提出了CWUTM,一种基于共现词网络的主题模型,旨在检测不平衡短文本数据集中的稀有主题。该模型在社交平台上早期且准确地识别新兴主题方面优于基线方法。
结构主题模型与BERTopic在简短开放式调查回答中的比较评估
本文比较了结构主题模型(STM)和BERTopic在分析简短开放式调查回答中的表现,发现采用上下文增强的BERTopic在主题连贯性和可解释性方面表现更佳,而STM在推断性协变量分析方面提供更强支持。
CobwebTM:用于终身学习和分层主题建模的概率概念形成
CobwebTM是一种低参数的终身分层主题建模方法,将Cobweb算法应用于连续文档嵌入,实现无监督主题发现和动态分层组织,无需预定义主题数量。该方法将增量符号概念形成与预训练表示相结合,在避免灾难性遗忘的同时实现强大的主题一致性。
ConceptTS: LLM引导的概念瓶颈用于可解释的多元时间序列预测
ConceptTS 引入了一个可解释的预测框架,该框架使用大语言模型为多元时间序列预测提出人类可读的概念,通过概念瓶颈在保持透明度的同时实现了具有竞争力的准确性。