HiMed:激励医学大语言模型中的印地语推理
摘要
介绍了HiMed,一个印地语推理医学语料库和基准套件,以及HiMed-8B,一个采用衰减脚手架奖励的印地语形式医学推理大语言模型,展示了印地语医学推理能力的提升和英印准确率差距的缩小。
arXiv:2605.24635v1 公告类型:新
摘要:医学大语言模型有望减少医疗保健差距,但印地语仍然严重缺乏代表性。虽然医学大语言模型在高资源语言中表现出色,但在印地语中性能急剧下降,尤其是在印度传统医学体系方面。我们认为,稳健的跨语言医学迁移需要印地语推理。为此,我们引入了HiMed,这是一个涵盖西医和印度医学的印地语推理医学语料库和基准套件。我们还进一步提出了HiMed-8B,一个通过设计衰减脚手架奖励实现的印地语形式医学推理大语言模型。大量实验表明,印地语医学推理性能得到提升,英印准确率差距缩小。消融研究验证了每个训练阶段和奖励组件的贡献。所有数据和代码已在GitHub上公开:https://github.com/FreedomIntelligence/HiMed。
查看缓存全文
缓存时间: 2026/05/26 09:04
# HiMed:激励医学大语言模型中的印地语推理 来源:https://arxiv.org/html/2605.24635 江泽峰1,\*,韩岩1,\*,马晨泽1,\*,Amit Kumar Jaiswal2,\*,李昂1,蒋云翔1,熊新磊1,梁巨浩1,肖鸿儒1,3,李翔1,4,卜凡1,5,韩佳乐1,6,Ruchir Gupta2,Prayag Tiwari7,王本友1,4,5,†\\dagger 1香港中文大学(深圳),2印度理工学院(贝拿勒斯印度教大学)瓦拉纳西,3同济大学,4深圳市大数据研究院,5深圳市环域研究院,6香港科技大学,7哈尔姆斯塔德大学 ###### 摘要 医学大语言模型有望减少医疗健康领域的不平等,但印地语仍严重未被充分覆盖。尽管医学大语言模型在高资源语言中表现出色,但在印地语中性能急剧下降,尤其是在印度传统医学体系上。我们认为,稳健的跨语言医学迁移需要印地语推理。为此,我们引入**HiMed**,一个涵盖西方医学和印度医学的印地语推理医学语料库和基准套件。我们进一步提出**HiMed-8B**,一个印地语医学推理大语言模型,通过设计**衰减支架奖励**来实现。大量实验表明,该模型在印地语医学推理性能上有所提升,并缩小了印英准确率差距。消融研究验证了每个训练阶段和奖励组件的贡献。所有数据和代码均已公开于 GitHub:\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=Englishhttps://github.com/FreedomIntelligence/HiMed (https://github.com/FreedomIntelligence/HiMed)。 \\fontspec\_if\_language:nTF ENG\\addfontfeatureLanguage=English HiMed:激励医学大语言模型中的印地语推理 江泽峰1,\*, 韩岩1,\*, 马晨泽1,\*, Amit Kumar Jaiswal2,\*, 李昂1, 蒋云翔1, 熊新磊1, 梁巨浩1, 肖鸿儒1,3, 李翔1,4, 卜凡1,5, 韩佳乐1,6, Ruchir Gupta2, Prayag Tiwari7, 王本友1,4,5,†\\dagger 1香港中文大学(深圳),2印度理工学院(贝拿勒斯印度教大学)瓦拉纳西,3同济大学,4深圳市大数据研究院,5深圳市环域研究院,6香港科技大学,7哈尔姆斯塔德大学 11footnotetext:同等贡献。22footnotetext:通讯作者。 ## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1 引言 大语言模型(LLM)革新了医学应用,在高资源语言中展现出强大性能(Citrus;patient\_education)。医疗决策本质上是以推理为中心的:关乎生命的判断需要因果分析和事实一致性(DBLP:journals/corr/abs\-2411\-14461)。最近的研究进一步表明,增强医学大语言模型的推理能力可以提升决策准确性(Huatuo\-o1;medreason),突显了推理的重要性。除了准确性,医学推理大语言模型还有潜力通过跨语言为服务不足的人群提供可扩展的专业知识,减少医疗健康不平等(oppo1;oppo2)。然而,跨越语言边界带来了额外的挑战:模型不仅要迁移推理能力,还必须与目标语言的 linguistic 结构和医学范式对齐(cultureneed1;cultureneed2)。当通用模型在没有领域特定安全保障的情况下跨语言部署时,这一挑战尤为严峻,我们的初步评估表明存在幻觉风险。 印度的医疗生态系统涵盖西方医学和印度医学体系(multineed)。后者包括印度官方认可的七大体系:阿育吠陀、瑜伽、自然疗法、尤纳尼、悉达、索瓦黎格帕和同种疗法(AYUSH\_Delhi\_Ashtanga)。由于印度医学体系中的许多核心概念在英语中没有对应词(moreno2005dichotomies;nesari2025ayush),印地语医学推理受益于直接在印地语表征中进行操作,这使得印地语推理成为一个必要的目标。 请参阅标题下方的图\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English 图1:HiMed 及训练框架概览。 在这项工作中,我们从方法和数据层面解决印地语医学推理问题。我们提出**衰减支架奖励强化学习**,它逐步将优化从引导的推理行为转向任务最优目标。为了支持这一设计和系统评估,我们引入**HiMed**,一个涵盖西方医学和印度医学体系的全面印地语医学语料库和基准套件。使用 LLaMA-3.1-8B-Instruct(llama3)进行的实验产生了**HiMed-8B**模型,该模型在医学基准上持续改进,同时消融研究验证了每个训练阶段和奖励组件。图\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1 (https://arxiv.org/html/2605.24635#S1.F1) 概述了HiMed、训练框架和性能。总体而言,这项工作将印地语推理确立为一等目标,并提供了数据基础和训练方法。通过联合解决一系列挑战,我们的研究为将通用大语言模型适应语言和文化特定的医学领域提供了一个系统且可扩展的框架。 ## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2 背景与动机 本节从三个逐渐增强的角度阐述印地语医学推理的动机。我们首先通过初步评估实证刻画印英医学推理差距。然后我们问这种差距是否可以通过基于翻译的流水线解决,并表明翻译是不够的。最后,我们进一步检查为什么印地语医学推理仍然具有挑战性,识别出数据和算法层面的两个额外瓶颈。 ### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.1 印英推理差距 ##### 评估设置。 先前工作已报告了大语言模型中显著的跨语言性能下降以及与印度医学知识的对齐不良(gap1;gap3;gap4;mixing;ayurbench)。为了实证刻画这些差距,我们在两个代表不同医学范式的典型医学基准上进行了初步评估:(i) MMLU-Pro 的医学子集代表西方医学,以及 (ii) RET,一个专注于印度医学体系的印度医学考试。我们评估了 GPT-4o(GPT\-4o)、HuatuoGPT-o1-8B(Huatuo\-o1) 和 LLaMA3-8B-UltraMedical(ultramedical) 在两个基准上的英语和印地语版本。Δ\\Deltadenotes the accuracy drop from English to Hindi. \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English 表1:跨语言性能的初步评估。 ##### 结果。 如表\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1 (https://arxiv.org/html/2605.24635#S2.T1)所示,所有评估模型都表现出显著的印英准确率下降。在 MMLU-Pro 上,下降表明即使是西方医学知识也无法从英语稳健迁移到印地语。对于印度医学体系,退化仍然严重:在 RET 上,开源模型在英语结果相对较强的情况下,印地语性能跌至接近随机水平。这些观察表明,通过以英语为中心的训练获得的医学推理能力不能一致地泛化到印地语。 \\fontspec\_if\_language:nTF ENG\\addfontfeatureLanguage=English ###### 发现 1. 大语言模型在西方和印度医学中表现出明显的印英性能差距。 \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English 表2:现有医学语料库和基准的比较。 ##### 启示。 这种性能差距可能指向一个更深层的限制:模型可能产出流利的印地语输出,但并未用印地语进行推理。先前工作进一步表明,缺乏母语推理监督会导致跨语言推理退化(xtom;DBLP:journals/corr/abs\-2508\-14828;DBLP:conf/aaai/ChaiYSGLWLBL0L25)。这些观察表明应将印地语推理视为一等目标。 ### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.2 为什么印地语翻译会失败 翻译失败可能由两个不同的原因造成。在语言层面,术语密集的医学内容容易产生语义扭曲。在概念层面,印度医学推理基于文化知识,无法通过英语推理忠实恢复。 #### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.2.1 原因一:翻译幻觉 ##### 评估设置。 在观察到印地语推理差距后,一种自然的方法是依赖基于翻译的流水线,即将印地语输入翻译成英语进行推理,再翻译回印地语输出。然而,此类方法依赖于翻译质量并引入潜在风险,尤其是在术语密集的印地语医学语境中。为了量化这一风险,我们要求 GPT-4o 将 50 个医学句子翻译成印地语,并由专家进行专业后编辑。 案例一:翻译幻觉 英语原文。一名 15 岁非洲裔美国男性,BMI 为 22,由母亲带到医生处,以解决对其饮食习惯改变的担忧。 GPT 翻译。\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiएक 15\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiवर्षीयआफ्रिकान द्रीपानोसोमा संक्रमणज रोग पुरुषजिसका BMI 22\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiहै, उसकी माता उसे उसके पथ्यसम्बन्धी आदतों में परिवर्तन के बारे में चिंता व्यक्त करने के लिए उसके काया चिकित्सक के पास लाती हैं。 (一名 15 岁非洲锥虫病传染病男性,BMI 为 22,由母亲带到其身体医生处,以表达对其饮食习惯改变的担忧。) \\fontspec\_if\_language:nTF ENG\\addfontfeatureLanguage=English ###### 发现 2. 基于大语言模型的翻译可能在术语密集的印地语医学内容中引入语义幻觉。 ##### 结果与启示。 我们发现 50 个翻译句子中有 19 个包含翻译诱导的语义幻觉。上述例子显示翻译诱导的幻觉如何悄悄破坏原始语义。因此,印地语医学大语言模型必须支持印地语推理,允许直接在目标语言中形成有效的语义结构。 #### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.2.2 原因二:文化根基 印地语推理反映了印度医疗实践的实际情况,即西方医学和印度医学体系并存(WHO2010NaturopathyBenchmarks;Woodyard2011YogaQoL)。医学推理受到语言塑造。先前工作表明,语言一致的护理能提高安全性和有效性(molina2019languageconcordance;reaume2025languageconcordance)。此外,印度医学体系中的许多核心概念在英语中没有忠实的对应词。现有的医学大语言模型主要由以英语为中心的训练数据塑造(pfohl2024equitymedqa),这限制了它们以概念上忠实的方式推理印度医学体系的能力。印地语推理不是语言偏好,而是在印度背景下进行忠实医学推理的前提条件。 \\fontspec\_if\_language:nTF ENG\\addfontfeatureLanguage=English ###### 发现 3. 印度医学体系中的医学推理依赖于语言和文化根基,这些在以英语为中心的推理下无法保留。 ### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.3 为什么印地语推理具有挑战性 除了基于翻译的方法的失败,开发有效的印地语医学推理模型还引入了两个基本瓶颈:数据瓶颈和算法瓶颈。 ##### 数据瓶颈。 如表\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2 (https://arxiv.org/html/2605.24635#S2.T2)所总结,现有的医学语料库和基准对印地语医学推理提供的支持有限。大多数资源要么仅限英语,要么缺乏对印度医学体系的覆盖。因此,模型缺乏足够的训练信号来学习印地语医学推理行为。 ##### 算法瓶颈。 在仅基于准确率的强化学习目标下,任务级别的准确率对推理形式没有监督作用:最小的答案驱动理由和详细的印地语症状到机制推理虽然差异巨大,但获得相同的奖励,如下案例所示。 案例二:推理风格 问题。\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiएक रोगी में तेज़ बुखार, गर्दन में अकड़न और प्रकाश से डर\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiपाया गया है। सबसे संभावित निदान क्या है? (A)\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiमस्तिष्क ट्यूमर (B)\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiमेनिन्जाइटिस(C)\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiमिर्गी (D)\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiमाइग्रेन 推理 A:英语答案驱动,直接陈述结论。 正确答案是 (B),因为这些症状与脑膜炎一致。 推理 B:印地语症状到机制。 \\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiतेज़ बुखार और गर्दन में अकड़न मस्तिष्कावरण की सूजन का संकेत देते हैं, जबकि प्रकाश से डर इस सूजन के कारण तंत्रिकीय संवेदनशीलता बढ़ने से होता है। इन लक्षणों का संयोजन विकल्प (B)\\fontspec\_if\_script:nTFdeva\\addfontfeatureScript=Devanagari\\fontspec\_if\_language:nTFHIN\\addfontfeatureLanguage=Hindiमेनिन्जाइटिस से मेल खाता है。 (高烧和颈部僵硬表明脑膜炎症,而畏光是由于这种炎症导致神经敏感性增加所致。这些症状的组合符合选项(B):脑膜炎。) \\fontspec\_if\_language:nTF ENG\\addfontfeatureLanguage=English ###### 发现 4. 仅基于准确率的目标无法引发印地语推理形式。 ##### 启示。 基于准确率的目标无法对答案驱动或英语理由提供梯度信号,使得模型可能收敛到目标等价但语言不对齐的推理模式。综合发现\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2 (https://arxiv.org/html/2605.24635#Thmfindings2)、\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3 (https://arxiv.org/html/2605.24635#Thmfindings3) 和\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English4 (https://arxiv.org/html/2605.24635#Thmfindings4) 表明,印地语医学推理需要额外的数据和明确塑造推理行为的训练目标。这激发了下一节介绍的衰减支架奖励和数据工程流水线。 ## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3 方法论 第\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2 (https://arxiv.org/html/2605.24635#S2)节表明,印地语医学推理不能简化为 t
相似文章
MMed-Bench-IR:一个用于多语言医学信息检索的异构基准
MMed-Bench-IR是一个跨六种语言的多语言医学信息检索异构基准,评估跨语言对齐、概念区分和证据检索。它揭示了非英语查询的严重性能下降,凸显了现有仅英语评估的不足。
对齐临床需求与AI能力:关于LLMs在医学推理中的综述
本综述考察了医学LLMs的最新进展,提出了一种连接临床实践与计算方法双重视角的方法,并引入了一个基准数据集,用于评估18个最先进模型的医学推理能力。
MedLoCoMo:面向大语言模型的长上下文多会话医疗对话基准
MedLoCoMo 是一个新基准,用于评估大语言模型在长上下文、多会话医疗对话推理上的表现,基于 MIMIC-IV 数据构建。它测试了单次入院、跨入院以及对抗性不可回答的问题,揭示出即使对于拥有长上下文窗口的模型,跨入院推理仍然具有挑战性。
IndicMedDialog:面向印度语言可及医疗的并行多轮医疗对话数据集
IndicMedDialog 是一个并行多轮医疗对话数据集,涵盖英语和九种印度语言,并包含一个微调模型,用于个性化症状询问。该数据集源自 MDDial,通过LLM生成的合成咨询和专家验证进行增强,支持多语言医疗AI。
LongMedBench:面向长时程临床决策的医疗智能体基准测试
LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。