NLP驱动的翻译古印度医学文本的知识提取与主题分类

arXiv cs.CL 论文

摘要

本文利用NLP技术,如NER和BERTopic,以及Neo4j,从翻译的古印度医学文本中提取、分类和可视化知识,提高可访问性和数字保存。

arXiv:2608.28608v1 Announce Type: new Abstract: 古印度医学文本如Sushruta Samhita包含大量关于疾病、治疗和手术技术的信息。然而,其古老的形式和复杂的词汇使用给可访问性和系统排序带来了困难。本研究利用自然语言处理(NLP)方法,如命名实体识别(NER)、BERTopic建模和基于Neo4j的知识图谱开发,从翻译版本中提取、分类和可视化重要概念。使用BERTopic的主题分类有助于识别潜在的医学主题,而NER支持对疾病、治疗、研究人员和药用植物的结构化实体识别。基于Neo4j的图网络分析还允许对提取实体之间的关系进行语义表示,支持知识检索和数字保存。研究结果表明,图数据库、主题建模和实体识别如何促进Ayurveda的历史医学知识的计算组织,弥合传统文本与现代数据驱动研究之间的差距。所提出的方法促进了历史文本分析、医学信息学和数字人文,使古印度医学智慧更易于访问和理解。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:50

# 基于自然语言处理的古印度医学译本知识提取与主题分类
来源:https://arxiv.org/abs/2608.28608  
查看PDF (https://arxiv.org/pdf/2608.28608)

> 摘要:《妙闻集》等古印度医学文献包含大量疾病、疗法与外科技术的记载。然而其古老的文献形式与复杂的词汇体系,给信息获取与系统性整理带来了挑战。本研究运用命名实体识别、BERTopic主题建模及Neo4j知识图谱构建等自然语言处理技术,基于译本对核心概念进行提取、分类与可视化。BERTopic主题分类可识别潜在的医学主题分类,命名实体识别则支持疾病、疗法、研究者与药用植物的结构化实体识别。通过Neo4j进行的图网络分析还能实现提取实体间的语义关系表征,为知识检索与数字存档提供支持。研究结果展示了图数据库、主题建模与实体识别如何促进阿育吠陀历史医学智慧的计算化组织,弥合传统文本与当代数据驱动研究之间的鸿沟。所提方法推动了历史文本分析、医学信息学与数字人文领域的发展,使古印度医学智慧更易于获取与理解。

## 投稿历史

来自:Rajeevan M S \[查看邮件 (https://arxiv.org/show-email/e042d826/2608.28608)\] **\[版本1\]** 2026年7月8日 周三 09:46:15 UTC (1,082 KB)

相似文章

从文化遗产保护视角重新思考Indic AI

arXiv cs.AI

本文综述了印度语言自然语言处理(NLP)的挑战与演变,强调文化遗产,并提出一个名为“文化感知”的新研究方向,以解决代表性差距并确保AI输出具有文化意义。