基于Transformer的嵌入在主题连贯性中的比较研究
摘要
本文系统性地比较了在BERTopic流程中使用七种基于Transformer的语言模型时模型大小对主题质量的影响,发现模型大小对主题连贯性影响微乎其微,表明较小的模型可以达到与较大模型相当的性能。
arXiv:2605.28832v1 公告类型: 新
摘要: 主题建模是自然语言处理(NLP)的一个分支,旨在根据词共现模式将大量文本组织成连贯的组别,其中隐含狄利克雷分配(LDA)仍是最广泛使用且可解释性最强的概率方法之一。NLP的最新进展,尤其是基于Transformer的语言模型,提供了改进的文档表示。同时,模型的大小(以参数数量计)在预定义任务中对语言模型的性能有显著影响。在本研究中,我们通过分析七种基于Transformer的语言模型(从MiniLM等小型模型到LLaMA-2等大型模型)在BERTopic流程中对多种语料库的表现,系统性地考察了模型大小对主题质量的影响。主题质量使用Röder等人(2015)提出的连贯性和发散性指标进行评估。我们的结果表明,模型大小(从2200万到130亿参数)对主题质量的影响微乎其微,表明较小的模型可以达到与较大模型相当的性能。
查看缓存全文
缓存时间: 2026/05/29 09:12
# 基于Transformer的嵌入在主题连贯性中的比较研究 来源:https://arxiv.org/abs/2605.28832 查看PDF(https://arxiv.org/pdf/2605.28832) > 摘要:主题建模是自然语言处理(NLP)的一个分支,旨在根据词共现模式将大量文本组织成连贯的组,其中潜在狄利克雷分配(LDA)仍然是使用最广泛、最具可解释性的概率方法之一。NLP的最新进展,特别是基于Transformer的语言模型,提供了改进的文档表示。同时,众所周知,模型的大小(以参数数量计)对语言模型在不同预定义任务上的性能有显著影响。在本研究中,我们通过分析七种基于Transformer的语言模型(从小型模型如MiniLM到大型模型如LLaMA-2)在BERTopic流水线中对多种语料库的表现,系统性地考察了模型大小对主题质量的影响。主题质量采用Röder等人(2015)提出的连贯性和散度指标进行评估。我们的结果表明,模型大小(从2200万到130亿参数)对主题质量的影响微乎其微,这表明小型模型可以达到与大型模型相当的性能。 ## 提交历史 来自:Willy Rodriguez [发送邮件](https://arxiv.org/show-email/04047c1a/2605.28832) [经由CCSD代理] **\[v1\]** 2026年4月10日星期五 08:34:47 UTC (2,342 KB)
相似文章
结构主题模型与BERTopic在简短开放式调查回答中的比较评估
本文比较了结构主题模型(STM)和BERTopic在分析简短开放式调查回答中的表现,发现采用上下文增强的BERTopic在主题连贯性和可解释性方面表现更佳,而STM在推断性协变量分析方面提供更强支持。
基于Transformer的语言模型在垂直领域中的应用:架构、应用与批判性评估
对基于Transformer的语言模型的全面综述,涵盖架构、在医疗、金融、法律等垂直领域的应用,以及对计算成本、对齐和数据来源等权衡因素的批判性评估。
Transformer 可扩展性危机:现代语言模型中性能墙的首次全面实证分析
本文对 118 个 Transformer 模型进行了首次大规模实证分析,揭示了关键的性能墙,其中成功率从 512 token 时的 88.1% 下降到 2048 token 时的 0%,挑战了主流的缩放假设。
合成语义监督用于小型Transformer中的对比代码表示学习:一项实证研究
本文通过实证研究了使用合成语义监督对小型Transformer中的代码嵌入进行对比预训练,结果显示相比基线有显著提升,并且与大型模型具有竞争力。
简单变换在文本嵌入模型间的迁移能力有多强?
这篇arXiv论文研究了简单的线性变换是否能在九个异构文本嵌入模型之间转换表示,发现共享结构和可迁移性共同取决于架构、训练目标、池化方法和数据分布,对普遍潜在兼容性的观念提出了挑战。