基于Transformer的嵌入在主题连贯性中的比较研究

arXiv cs.CL 论文

摘要

本文系统性地比较了在BERTopic流程中使用七种基于Transformer的语言模型时模型大小对主题质量的影响,发现模型大小对主题连贯性影响微乎其微,表明较小的模型可以达到与较大模型相当的性能。

arXiv:2605.28832v1 公告类型: 新 摘要: 主题建模是自然语言处理(NLP)的一个分支,旨在根据词共现模式将大量文本组织成连贯的组别,其中隐含狄利克雷分配(LDA)仍是最广泛使用且可解释性最强的概率方法之一。NLP的最新进展,尤其是基于Transformer的语言模型,提供了改进的文档表示。同时,模型的大小(以参数数量计)在预定义任务中对语言模型的性能有显著影响。在本研究中,我们通过分析七种基于Transformer的语言模型(从MiniLM等小型模型到LLaMA-2等大型模型)在BERTopic流程中对多种语料库的表现,系统性地考察了模型大小对主题质量的影响。主题质量使用Röder等人(2015)提出的连贯性和发散性指标进行评估。我们的结果表明,模型大小(从2200万到130亿参数)对主题质量的影响微乎其微,表明较小的模型可以达到与较大模型相当的性能。
查看原文
查看缓存全文

缓存时间: 2026/05/29 09:12

# 基于Transformer的嵌入在主题连贯性中的比较研究
来源:https://arxiv.org/abs/2605.28832
查看PDF(https://arxiv.org/pdf/2605.28832)

> 摘要:主题建模是自然语言处理(NLP)的一个分支,旨在根据词共现模式将大量文本组织成连贯的组,其中潜在狄利克雷分配(LDA)仍然是使用最广泛、最具可解释性的概率方法之一。NLP的最新进展,特别是基于Transformer的语言模型,提供了改进的文档表示。同时,众所周知,模型的大小(以参数数量计)对语言模型在不同预定义任务上的性能有显著影响。在本研究中,我们通过分析七种基于Transformer的语言模型(从小型模型如MiniLM到大型模型如LLaMA-2)在BERTopic流水线中对多种语料库的表现,系统性地考察了模型大小对主题质量的影响。主题质量采用Röder等人(2015)提出的连贯性和散度指标进行评估。我们的结果表明,模型大小(从2200万到130亿参数)对主题质量的影响微乎其微,这表明小型模型可以达到与大型模型相当的性能。

## 提交历史

来自:Willy Rodriguez [发送邮件](https://arxiv.org/show-email/04047c1a/2605.28832) [经由CCSD代理] **\[v1\]** 2026年4月10日星期五 08:34:47 UTC (2,342 KB)

相似文章

简单变换在文本嵌入模型间的迁移能力有多强?

arXiv cs.LG

这篇arXiv论文研究了简单的线性变换是否能在九个异构文本嵌入模型之间转换表示,发现共享结构和可迁移性共同取决于架构、训练目标、池化方法和数据分布,对普遍潜在兼容性的观念提出了挑战。