NLP驱动的翻译古印度医学文本的知识提取与主题分类
摘要
本文利用NLP技术,如NER和BERTopic,以及Neo4j,从翻译的古印度医学文本中提取、分类和可视化知识,提高可访问性和数字保存。
arXiv:2608.28608v1 Announce Type: new
Abstract: 古印度医学文本如Sushruta Samhita包含大量关于疾病、治疗和手术技术的信息。然而,其古老的形式和复杂的词汇使用给可访问性和系统排序带来了困难。本研究利用自然语言处理(NLP)方法,如命名实体识别(NER)、BERTopic建模和基于Neo4j的知识图谱开发,从翻译版本中提取、分类和可视化重要概念。使用BERTopic的主题分类有助于识别潜在的医学主题,而NER支持对疾病、治疗、研究人员和药用植物的结构化实体识别。基于Neo4j的图网络分析还允许对提取实体之间的关系进行语义表示,支持知识检索和数字保存。研究结果表明,图数据库、主题建模和实体识别如何促进Ayurveda的历史医学知识的计算组织,弥合传统文本与现代数据驱动研究之间的差距。所提出的方法促进了历史文本分析、医学信息学和数字人文,使古印度医学智慧更易于访问和理解。
查看缓存全文
缓存时间: 2026/09/01 11:50
# 基于自然语言处理的古印度医学译本知识提取与主题分类 来源:https://arxiv.org/abs/2608.28608 查看PDF (https://arxiv.org/pdf/2608.28608) > 摘要:《妙闻集》等古印度医学文献包含大量疾病、疗法与外科技术的记载。然而其古老的文献形式与复杂的词汇体系,给信息获取与系统性整理带来了挑战。本研究运用命名实体识别、BERTopic主题建模及Neo4j知识图谱构建等自然语言处理技术,基于译本对核心概念进行提取、分类与可视化。BERTopic主题分类可识别潜在的医学主题分类,命名实体识别则支持疾病、疗法、研究者与药用植物的结构化实体识别。通过Neo4j进行的图网络分析还能实现提取实体间的语义关系表征,为知识检索与数字存档提供支持。研究结果展示了图数据库、主题建模与实体识别如何促进阿育吠陀历史医学智慧的计算化组织,弥合传统文本与当代数据驱动研究之间的鸿沟。所提方法推动了历史文本分析、医学信息学与数字人文领域的发展,使古印度医学智慧更易于获取与理解。 ## 投稿历史 来自:Rajeevan M S \[查看邮件 (https://arxiv.org/show-email/e042d826/2608.28608)\] **\[版本1\]** 2026年7月8日 周三 09:46:15 UTC (1,082 KB)
相似文章
基于大语言模型的循证智能诊断与治疗可视化系统:多轮交互与多模态治疗方案生成
本文提出了一种知识增强的中医视觉诊断系统,该系统使用Neo4j知识图谱、四阶段症状匹配流程以及信息增益驱动的主动提问策略,以提升透明度和可解释性。结果表明,该显著提高了诊断信任度并降低了认知负荷。
OntoBook:基于本体的合成教科书用于医学编码器预训练
OntoBook利用大型语言模型将医学本体图转换为合成教科书文本,然后使用生成的130万本法语教科书对ModernCamemBERT进行预训练,在医学编码基准测试上取得了显著提升。
从文化遗产保护视角重新思考Indic AI
本文综述了印度语言自然语言处理(NLP)的挑战与演变,强调文化遗产,并提出一个名为“文化感知”的新研究方向,以解决代表性差距并确保AI输出具有文化意义。
词与道:面向德国医学自然语言处理的领域特定BERT预训练策略
本文介绍了ChristBERT,一个基于RoBERTa的面向德国临床NLP的领域特定语言模型家族,并在医学命名实体识别和文本分类任务上评估了三种领域适应策略(继续预训练、从头预训练和词汇适应),取得了最先进的结果。
MiNER:针对临床文本中疟疾疾病实体识别的微调生物医学自然语言处理
本文提出了MiNER,一个微调的BioBERT模型,用于从疟疾相关临床文本中提取生物医学实体,并发布了一个人工标注的数据集以供未来研究。