词汇变化如何误导:重新审视动态主题模型评估——传统度量与基于LLM的度量

arXiv cs.CL 论文

摘要

本文评估了动态主题模型的传统一致性度量和基于LLM的语义相似度,发现基于LLM的度量通过考虑词汇变化,更好地与人类判断对齐。它提倡使用传统度量和基于LLM的度量相结合的评估方法。

arXiv:2608.13835v1 Announce Type: new Abstract: 动态主题模型捕捉不断演变的词分布,但当词汇变化而语义意义持续存在时,传统一致性度量可能会失效。我们评估了来自 CoNTM 和 DLDA 的 120 个主题,涵盖 NYT、DBLP 和 arXiv,使用三名人类标注者以及低、中和高词汇变化类别。传统时间一致性显示与人类判断的协议高度可变($\rho$=-0.256 到 0.614)。相比之下,基于 LLM 的语义相似度与 CoNTM 在 NYT($\rho$=0.609)、DBLP($\rho$=0.721)和 arXiv($\rho$=0.502)上的语义判断强烈一致,但对 DLDA 的一致性较低。词汇变化分层揭示了在聚合评估中隐藏的变异。因此,我们提倡词汇变化感知的评估,联合报告传统一致性和基于 LLM 的语义度量,作为互补而非可互换的信号。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:47

# 当词汇变化造成误导:基于传统与LLM指标的动态主题模型评估新思考
来源:https://arxiv.org/html/2608.13835  
Charu Karakkaparambil James  
所属机构:RPTU大学凯泽斯劳滕-兰道分校  
所在地:德国凯泽斯劳滕  
邮箱:[surname@cs\.uni\-kl\.de](mailto:)

###### 摘要

动态主题模型捕捉不断演变的词分布,但当词汇变化而语义持续存在时,传统一致性指标可能失效。我们评估了CoNTM和DLDA在NYT、DBLP和arXiv数据集上的120个主题,使用三位人工标注者,并按低、中、高三类词汇变化进行分类。传统时序一致性与人工判断的一致性差异很大(ρ范围从-0.256到0.614)。相比之下,基于LLM的语义相似度在CoNTM模型上与人工语义判断高度一致:NYT数据集(ρ=0.609),DBLP数据集(ρ=0.721),arXiv数据集(ρ=0.502),但在DLDA模型上一致性较低。词汇变化分层分析揭示了总体评估所掩盖的差异。因此我们倡导采用词汇变化感知的评估方法,将传统一致性与基于LLM的语义度量作为互补而非互换的信号进行联合报告。

## 1引言

动态主题模型(DTMs)通过允许潜在主题随时间演变,扩展了传统主题建模[14]([https://arxiv.org/html/2608.13835#bib.bib9]());[6]([https://arxiv.org/html/2608.13835#bib.bib10]());[16]([https://arxiv.org/html/2608.13835#bib.bib11]());[7]([https://arxiv.org/html/2608.13835#bib.bib12]())。动态主题不再使用一组静态词汇表征,而是在不同时间点包含显著不同的词汇,同时仍描述一个连续的潜在现象。原始动态主题模型明确提出了这一场景,指出科学主题即使在数十年间,只要潜在的知识脉络保持连续,其词汇表现也可能大不相同[2]([https://arxiv.org/html/2608.13835#bib.bib1]())。

评估此类演变轨迹仍然困难。主题模型评估传统上依赖基于主题词间统计关系的自动一致性度量。然而,以人为中心的研究反复表明,似然度或自动一致性并不总能反映人类的可解释性[3]([https://arxiv.org/html/2608.13835#bib.bib2]());[11]([https://arxiv.org/html/2608.13835#bib.bib3]())。近期的分析质疑为传统主题模型开发的一致性度量是否仍然适用于新模型和不同的应用场景[4]([https://arxiv.org/html/2608.13835#bib.bib4]());[5]([https://arxiv.org/html/2608.13835#bib.bib5]())。

在时序主题建模中,这一问题更为突出。考虑一个主题:早期词汇涉及desktop、computer、software和internet,而后期则强调smartphone、app、cloud和platform。从词汇上看,该主题已发生显著变化。然而,从语义上,人类读者可能识别出数字技术的一致演变过程。因此,一个由词汇共现主导的度量所回答的问题,可能与人类在解释时序叙事时所提出的问题不同。

大语言模型提供了一种可能的互补信号,因为它们能够推理主题不同表面表述之间的语义关系。例如,[15]([https://arxiv.org/html/2608.13835#bib.bib6]())的研究表明,LLM判断在静态主题模型评估中可以与人类评估高度相关,尽管其有效性取决于评估任务。我们将这一思路扩展到时序主题演变中。

我们研究了两种模型——CoNTM[8]([https://arxiv.org/html/2608.13835#bib.bib7]())和DLDA[2]([https://arxiv.org/html/2608.13835#bib.bib1]())——在三个具有时间结构的语料库上的表现。我们的主要发现是:度量有效性是有条件的。传统一致性在某些条件下与人类判断高度相关,但在其他条件下则很弱甚至呈负相关。同样,基于LLM的语义评估在CoNTM上表现强劲,但在DLDA上则不一致。词汇变化分层分析揭示了总体评估所掩盖的模式。

**图1:** CoNTM和DLDA在NYT、arXiv和DBLP数据集上,词汇时序变化与传统NPMI一致性的关系。面板(a–b)显示词汇变化与一致性在不同数据集上存在负相关。面板(c–d)阐明即使一致性相对较低的主题,也可能展现有意义且可解释的语义演变,这促使我们超越仅基于词汇一致性的评估。

我们的主要贡献包括:
- •我们分析了传统时序一致性在两种动态主题模型和三个数据集上的表现,显示其与人类判断的一致性存在显著差异。
- •我们引入了词汇变化感知评估方法,将主题分为低、中、高词汇变化组,揭示了总体相关性所隐藏的模式。
- •我们评估了基于LLM的语义相似度与人类判断的一致性,表明它提供了互补的语义信号,但并非普遍可靠。
- •我们倡导一种结合传统一致性、基于LLM的语义相似度和词汇变化的多视角评估框架。

本文结构如下:第2节回顾相关工作,第3节描述实验设置,第4节呈现结果,第5节讨论发现,第6节总结全文。

## 2相关工作

本节回顾传统主题模型评估和近期基于LLM的语义评估方法,重点关注它们与动态主题模型的相关性。

#### 主题模型评估

传统主题模型评估通常依赖基于主题词间统计关联的一致性度量。然而,自动化指标并不总与人类可解释性一致[3]([https://arxiv.org/html/2608.13835#bib.bib2]());[11]([https://arxiv.org/html/2608.13835#bib.bib3]())。近期研究显示,这种不匹配可能在不同神经主题模型和领域中持续存在,质疑将一致性作为人类判断通用代理指标的做法[4]([https://arxiv.org/html/2608.13835#bib.bib4]());[5]([https://arxiv.org/html/2608.13835#bib.bib5]())。这一问题对动态主题模型尤为重要,因为其词汇可能随时间发生显著变化,而潜在的语义主题保持一致。

#### 基于LLM的评估

近期研究探索了LLM作为主题模型输出的语义评估者。[15]([https://arxiv.org/html/2608.13835#bib.bib6]())表明LLM判断可以与人类主题评估高度相关,但其性能取决于评估方法的设计。现有工作主要关注静态主题表征[9]([https://arxiv.org/html/2608.13835#bib.bib8]())。相比之下,我们研究时序主题演变,并探究传统度量和基于LLM的度量的可靠性是否会随低、中、高词汇变化而改变。我们不是用基于LLM的度量取代传统一致性,而是研究将传统一致性和基于LLM的语义相似度作为评估动态主题的互补信号。

## 3实验设置

本节描述实验中使用的模型和数据集、人工评估流程、传统和基于LLM的度量以及词汇变化分析方法。

### 3.1模型与数据集

我们在三个具有时间结构的数据集上评估CoNTM和DLDA:《纽约时报》(NYT)、DBLP和arXiv。对于每个模型-数据集组合,我们选择20个主题,共计120个时序主题轨迹。每个主题在三个时间点表示:NYT[13]([https://arxiv.org/html/2608.13835#bib.bib13]())为1987年、1997年和2007年;DBLP[10]([https://arxiv.org/html/2608.13835#bib.bib15]())为2010年、2015年和2020年;arXiv[1]([https://arxiv.org/html/2608.13835#bib.bib14]())为2012年、2018年和2024年。

### 3.2人工评估

三位标注者评估每个主题。为保持一致性,所有模型-数据集组合使用三个响应;DLDA-NYT文件包含五个响应,本实验使用其中前三个。

标注者使用五分制回答五个问题:
- •时序主题一致性:考虑连续时间点时,主题词是否连贯且可解释?
- •时序主题平滑性:主题在三个时间点之间的演变是否平滑?
- •起始主题准确性:生成的起始主题是否准确代表了初始主题词?
- •结束主题准确性:生成的结束主题是否准确代表了最终主题词?
- •语义相似度:起始主题和结束主题在语义上有多相似?

这产生了120×3×5=1,800个标量人类判断。我们对每个主题取三位标注者的平均值。

本分析主要关注时序主题一致性和语义相似度,因为它们直接对应下文研究的传统和基于LLM的度量。

### 3.3传统与基于LLM的评估

对于传统评估,我们使用自动计算的时序主题一致性[9]([https://arxiv.org/html/2608.13835#bib.bib8]()),它总结了主题在整个时序轨迹上的一致性。我们将此分数与从三位标注者获得的人工时序主题一致性(TTC)平均评分进行比较。

对于语义评估,我们通过OpenAI Responses API使用GPT-5.5[12]([https://arxiv.org/html/2608.13835#bib.bib16]())。对于每个时序主题对,模型接收数据集、动态主题模型、主题标识符、时间戳和相应的顶级主题词。使用固定提示,GPT-5.5生成两个主题状态的简洁语义描述,并在五分制上评估它们的语义相似度,1(语义无关)到5(语义等价)。提示明确指示模型区分真正的语义变化和词汇替换,并在潜在主题概念相似时不惩罚词汇变化。模型返回包含两个语义主题、相似度分数和理由的结构化JSON响应。我们将此分数与人工语义相似度(SS)平均评分进行比较。

重要的是,传统度量和基于LLM的度量是针对不同的人类判断进行评估的。具体而言,我们考察
\(C_{\mathrm{trad.}} \leftrightarrow H_{\mathrm{TTC}}\),(1)
和
\(S_{\mathrm{LLM}} \leftrightarrow H_{\mathrm{SS}}\),(2)
其中 \(C_{\mathrm{trad.}}\) 表示时序主题一致性,\(S_{\mathrm{LLM}}\) 表示基于LLM的语义相似度,\(H_{\mathrm{TTC}}\) 表示人工时序主题一致性判断的平均值,\(H_{\mathrm{SS}}\) 表示人工语义相似度判断的平均值。因此,我们不将两个相关系数解释为对竞争度量的直接比较。相反,我们评估每个度量与其对应的人工判断在时序主题质量相应属性上的一致程度。

### 3.4词汇变化分层

每个主题有一个主题词汇时序变化值,并关联一个低、中或高的词汇变化类别。在每个模型-数据集组合内,20个主题由七个低、七个中和六个高词汇变化主题组成。

这种分层允许我们检验总体度量-人工相关性是否掩盖了不同词汇演变水平下的不同行为。

由于人工回答是有序的李克特判断,我们使用斯皮尔曼等级相关系数(ρ)作为主要一致性统计量。类别级结果应谨慎解释,因为每个类别在每个数据集上仅包含六或七个主题。

## 4结果

本节展示自动度量与其对应的人工判断之间的总体和词汇变化分析相关性,重点说明度量可靠性在不同模型和数据集间的差异。

### 4.1传统一致性不具有普遍的人工效度

表1报告了传统时序一致性与时序主题一致性之间的关系,以及LLM分数与人工语义相似度之间的关系。

**表1:** 自动度量与对应三位标注者人工判断的斯皮尔曼ρ相关系数。\(C_{\mathrm{trad.}}\) 表示传统时序一致性,\(H_{\mathrm{TTC}}\) 表示人工时序主题一致性,\(H_{\mathrm{SS}}\) 表示人工语义相似度。粗体值表示统计显著相关(p<0.05)。

传统时序一致性在不同实验条件下表现迥异。对于DLDA-DBLP,它与人工判断高度一致(ρ=0.614,p=.004);DLDA-NYT也表现出显著的正相关一致性(ρ=0.531,p=.016)。CoNTM-arXiv产生中等一致性(ρ=0.500,p=.025)。

然而,这些结果不能推广到所有数据集。对于DLDA-arXiv,相关性几乎为零(ρ=0.007)。更显著的是,CoNTM-NYT显示负的总相关性(ρ=-0.256),尽管不具统计显著性。

因此,不能假设一个高的传统一致性分数在所有模型和语料库中都与人类时序可解释性具有相同的关系。这支持了先前关于自动主题一致性并非普遍可与人类判断互换的担忧[4]([https://arxiv.org/html/2608.13835#bib.bib4]());[5]([https://arxiv.org/html/2608.13835#bib.bib5]())。

### 4.2词汇变化揭示隐藏的度量行为

总体结果掩盖了不同词汇变化类别间的显著差异。特别值得注意的例子包括:

**表2:** 精选的词汇变化分层斯皮尔曼相关系数(ρ)。蓝色行表示传统一致性与时序主题一致性(TTC)的对比,橙色行表示LLM语义相似度与人工语义相似度(SS)的对比。绿色单元格突出显示统计显著相关(p<0.05)。类别大小:低、中、高词汇变化的N分别为7、7和6。

度量不稳定性的最强例证出现在CoNTM-NYT上。在低词汇变化条件下,传统一致性与人工一致性呈强负相关(ρ=-0.786,p=.036),而同一词汇变化组中LLM语义相似度分数与人工语义判断高度一致(ρ=0.801,p=.030)。

DLDA呈现不同模式。传统一致性在中等词汇变化时特别有效,在NYT上达到ρ=0.873,在DBLP上达到ρ=0.898。这一观察很重要,因为它避免了过于简单的结论——即词汇变化增加必然使传统一致性失效。相反,这种效应取决于词汇变化、模型行为和语料库特征之间的交互作用。

### 4.3LLM语义评估有用但非万能

在所有120个主题中,人工语义相似度与LLM语义分数的汇总相关系数为
\[\rho=0.479,\quad p<.001.\]
汇总相关性在低词汇变化主题中最强(ρ=0.556,p<.001),在中等词汇变化中仍显著(ρ=0.405,p=.008),在高词汇变化中则变弱(ρ=0.294,p=.082)。

相似文章

超越准确率:大型语言模型统计推理的多维评估

arXiv cs.CL

本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。

论词汇性在大语言模型中的持续影响

arXiv cs.CL

本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。

大语言模型中词汇对齐与偏好阶段转变的全自动识别

arXiv cs.CL

本文提出了两种自动化指标:词汇对齐分数(Lexical Alignment Score)和三角化偏好转变(Triangulated Preference Shift),用于识别大语言模型中的词汇过度使用,并将其归因于偏好学习阶段。该方法在六个模型家族上使用PubMed摘要进行测试,无需人工干预即可重复先前的研究发现。