标签
MonoTM是一个可解释的主题建模框架,通过稀疏自编码器将混合估计与特征解释解耦,从而提供超越传统基于单词表示的语义有意义的主题。
本文利用NLP技术,如NER和BERTopic,以及Neo4j,从翻译的古印度医学文本中提取、分类和可视化知识,提高可访问性和数字保存。
本文提出了一种用于分析斯里兰卡议会辩论的三语主题建模框架,该框架利用基于LLM的文本提取和多语言嵌入来处理语码混杂文本,并在聚类纯度上优于传统方法。
BERTilda是一个可解释的框架,通过构建带有相似性和流信号的时间图来跟踪纵向文本流中的主题生命周期,以检测分裂、合并和其他转变,并在标注数据集上达到高一致率。
本文评估了动态主题模型的传统一致性度量和基于LLM的语义相似度,发现基于LLM的度量通过考虑词汇变化,更好地与人类判断对齐。它提倡使用传统度量和基于LLM的度量相结合的评估方法。
Introduces TRIBE, a domain-independent pipeline that uses topic modeling and clustering on team communication to predict performance early and analyze how AI agents alter team behavioral dynamics.
本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。
本文采用结构主题建模,对1771年至1930年间150部经典小说进行分析,衡量男性气质形成的变化趋势,发现继承的地位和神圣权威在下降,而帝国/冒险和商业男性脚本在上升。
本文提出了一种用于神经主题建模的混合经典-量子变分自编码器,在推理网络中嵌入了参数化量子电路。在AgNews数据集上的实验表明,与最先进的经典模型相比,主题连贯性和多样性有所提高,显示了在NISQ时代量子设备上的可行性。
本文系统性地比较了在BERTopic流程中使用七种基于Transformer的语言模型时模型大小对主题质量的影响,发现模型大小对主题连贯性影响微乎其微,表明较小的模型可以达到与较大模型相当的性能。
一个包含299,329条关于气候变化的公开Facebook帖子的大规模数据集,附带元数据和主题与参与度分析,旨在支持气候话语研究。
本文比较了结构主题模型(STM)和BERTopic在分析简短开放式调查回答中的表现,发现采用上下文增强的BERTopic在主题连贯性和可解释性方面表现更佳,而STM在推断性协变量分析方面提供更强支持。
本文介绍了一个俄罗斯政府官方演讲的关联多模态数据集,包含文本、图像、元数据和主题标注,旨在支持社会科学研究和政治领域的大语言模型应用。
本文提出一种基于大语言模型的主题建模方法与评估框架,兼顾可解释性、主题特异性与极性立场一致性,并在利用大规模日企评论数据解释员工士气等外部结果方面表现出更强的解释力。
# 弥合社区需求与媒体内容差距的洞察 来源:[https://arxiv.org/html/2604.16651](https://arxiv.org/html/2604.16651) ## 移民之声与地方新闻:弥合社区需求与媒体内容差距的洞察 作者:Paula Dolores Rescala [paula\.rescala@epfl\.ch](https://arxiv.org/html/2604.16651v1/mailto:[email protected]),EPFL 瑞士 Victor Bros [vbros@idiap\.ch](https://arxiv.org/html/2604.16651v1/mailto:[email protected]),Idiap Research Institute 及 EPFL 瑞士 与 Daniel Gatica
CobwebTM是一种低参数的终身分层主题建模方法,将Cobweb算法应用于连续文档嵌入,实现无监督主题发现和动态分层组织,无需预定义主题数量。该方法将增量符号概念形成与预训练表示相结合,在避免灾难性遗忘的同时实现强大的主题一致性。