聚焦医疗LLM问答中的差异

arXiv cs.CL 论文

摘要

本文系统研究了五种语言下基于LLM的医疗问答中的跨语言差异,发现了事实对齐方面的显著差距,并提出了MultiWikiHealthCare数据集。

arXiv:2510.17476v2 公告类型: 替换 摘要: 公平获取可靠的健康信息对于将人工智能融入医疗保健至关重要。然而,信息质量因语言而异,引发了对多语言大语言模型(LLM)可靠性和一致性的担忧。我们系统性地研究了在英语、德语、土耳其语、汉语普通话和意大利语的多语言医疗问答中,LLM回答在预训练来源和事实准确性对齐方面的跨语言差异。我们(i)构建了多语言维基医疗健康(MultiWikiHealthCare)数据集,该数据集来自维基百科;(ii)分析了跨语言的医疗健康覆盖范围;(iii)评估了LLM回答与这些参考文本的对齐程度;(iv)通过使用上下文信息和检索增强生成(RAG)进行了事实对齐的案例研究。我们的研究结果揭示了维基百科覆盖范围和LLM事实对齐方面均存在显著的跨语言差异。在多个LLM中,即使提示语是非英语的,回答也更倾向于与英语维基百科对齐。在推理时提供来自非英语维基百科的上下文摘录,有效地将事实对齐转向文化相关知识。这些结果凸显了为医疗健康构建更公平的多语言人工智能系统的实际途径。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:54

# 聚焦医疗保健LLM问答中的差异
来源:https://arxiv.org/html/2510.17476
11institutetext:Universitat Politècnica de València, Valencia, Spain22institutetext:University of Trento, Trento, Italy33institutetext:University of Sheffield, Sheffield, UK
44institutetext:Bonn\-Aachen International Center for Information Technology, University of Bonn, Bonn, Germany
55institutetext:Lamarr Institute for Machine Learning and Artificial Intelligence, Germany, Dortmund, Germany66institutetext:University of Pisa, Pisa, Italy
77institutetext:University of Milano\-Bicocca, Milano, Italy
88institutetext:ValgrAI Valencian Graduate School and Research Network of Artificial Intelligence, Valencia, Spain
🖂88email:ibarsch@doctor\.upv\.esBurcu Sayinhttps://orcid.org/0000-0001-6804-127XZhixue Zhaohttps://orcid.org/0000-0002-3060-269X Frederik M\. LabontéCesare Barberahttps://orcid.org/0009-0004-5568-6166 Marco Vivianihttps://orcid.org/0000-0002-2274-9050Paolo Rossohttps://orcid.org/0000-0002-8922-1242Lucie Flekhttps://orcid.org/0000-0002-5995-8454

###### 摘要

本文系统性地研究了大型语言模型(LLM)在多语言医疗保健问答中,其预训练来源和事实性对齐方面存在的跨语言差异,涉及英语、德语、土耳其语、中文(普通话)和意大利语。为了支持这一分析,我们(i)构建了MultiWikiHealthCare——一个源自维基百科的多语言数据集;(ii)利用该数据集考察了医疗保健相关内容覆盖的跨语言差异;(iii)评估了LLM生成的响应与这些参考来源之间的对齐程度;(iv)通过使用上下文信息和检索增强生成(RAG)进行了关于事实性对齐的案例研究。我们的研究结果揭示了维基百科覆盖面和LLM事实性对齐两方面都存在显著的跨语言差异。基于维基百科的分析,英语和中文维基百科页面之间的对齐度最低。在各模型中,即使提示语是非英语的,响应也更倾向于与英语维基百科对齐。我们进一步证明,在推理阶段提供非英语维基百科的上下文摘录,能够有效地将事实性对齐转向目标语言的知识。

## 1 引言

大型语言模型(LLM)越来越多地被部署在医疗保健应用中,寻求健康信息的人们也经常转向基于LLM的系统寻求建议[43 (https://arxiv.org/html/2510.17476#bib.bib1),46 (https://arxiv.org/html/2510.17476#bib.bib3)]。由于LLM主要基于大规模在线数据进行训练,其响应受到在线健康信息的可用性和质量的影响[26 (https://arxiv.org/html/2510.17476#bib.bib48)]。然而,这些信息在不同语言之间差异显著,反映了健康传播、基础设施和文化规范方面的差距[37 (https://arxiv.org/html/2510.17476#bib.bib47),45 (https://arxiv.org/html/2510.17476#bib.bib41)]。

许多医疗保健基准测试既探究LLM的幻觉问题,也分析差异现象[4 (https://arxiv.org/html/2510.17476#bib.bib56),20 (https://arxiv.org/html/2510.17476#bib.bib6),19 (https://arxiv.org/html/2510.17476#bib.bib2),49 (https://arxiv.org/html/2510.17476#bib.bib20),32 (https://arxiv.org/html/2510.17476#bib.bib25)],但它们大多以英语为中心,或者粒度太粗,无法诊断跨语言的性能差距。此外,尽管这两个概念相关,但它们处于不同的分析层面。幻觉检测侧重于识别事实错误或虚构的内容[19 (https://arxiv.org/html/2510.17476#bib.bib2),48 (https://arxiv.org/html/2510.17476#bib.bib23)],而差异分析则考察信息如何在不同语言和语境边界上被不同地呈现或优先排序,即使事实本身在不同的文化/语境背景下可能有所不同[32 (https://arxiv.org/html/2510.17476#bib.bib25),29 (https://arxiv.org/html/2510.17476#bib.bib53)]。

参考图说明图1:用于检查来源层和响应层差异及事实性对齐的框架:(1) 比较维基百科页面(TR-EN)的事实性和结构;(2) 基于维基百科页面的事实生成问题;(3) 响应事实性评估;(4) 使用维基百科页面和RAG进行上下文对齐。英文翻译以蓝色显示。

最近的研究将差异分析应用于关于人物和美食的维基百科条目[32 (https://arxiv.org/html/2510.17476#bib.bib25),38 (https://arxiv.org/html/2510.17476#bib.bib35)],另有一些研究调查了医学领域LLM输出中的差异[15 (https://arxiv.org/html/2510.17476#bib.bib31),30 (https://arxiv.org/html/2510.17476#bib.bib30)]。然而,这些工作都未明确地将来源(例如维基百科)与LLM生成的响应之间的差异联系起来。本文引入了一个整体框架,以评估LLM生成的健康答案如何与跨语言的事实性和语言特定信息对齐。如图1所示,(i) 我们首先比较医疗保健相关的维基百科页面(许多LLM的预训练语料[36 (https://arxiv.org/html/2510.17476#bib.bib28)]),以刻画不同语言在覆盖范围、措辞和引用模式方面的异同。基于此分析,(ii) 我们构建了对齐的跨语言事实集,并利用它们生成问题,向多个多语言LLM提问,即Llama3.3-70B[9 (https://arxiv.org/html/2510.17476#bib.bib17)]、Qwen3-Next-80B-A3B-Instruct[44 (https://arxiv.org/html/2510.17476#bib.bib51)]和Aya[6 (https://arxiv.org/html/2510.17476#bib.bib45)]。随后,(iii) 我们评估响应的质量及其与英文维基百科和相应目标语言页面的对齐程度。最后,(iv) 我们通过使用上下文信息和检索增强生成(RAG),进行一项初步案例研究,检验在推理阶段提供非英语上下文摘录是否会使事实性转向本地相关来源。

本研究的主要贡献可概括如下:(i) 我们构建了MultiWikiHealthCare,这是一个多语言数据集,选取了当前热门的医疗保健话题,涵盖英语(EN)、德语(DE)、意大利语(IT)、土耳其语(TR)和中文(ZH)。该数据集能够在来源层面(维基百科)和响应层面(LLM输出)系统比较差异。(ii) 维基百科分析显示,相对于英语,存在显著的跨语言差异,其中中文对齐度最低,提取的事实也最少;德语更常引用地区性来源,而其他语言则依赖国际来源。(iii) LLM输出表现出明显的以英语为中心的对齐:响应与英语维基百科的匹配程度高于同一主题的其他语言页面,当查询用英语提出时,差距进一步扩大。这对于具有不同实践和指南的文化特定知识来说可能是个问题。(iv) 一个上下文增强提示的案例研究表明,LLM在推理时可以将其对齐转向非英语来源,突显了融入目标语言知识的价值。最后,我们的数据集和包含系统提示的源代码已在GitHub上发布111https://github.com/isspek/nldb2026-multiwikihealthcare。

## 2 相关工作

关于LLM的事实可靠性、幻觉检测和跨语言一致性的研究,为模型行为在不同语言和领域间的差异起源提供了重要见解。先前的研究表明,提示设计强烈影响医疗问答中的事实性[20 (https://arxiv.org/html/2510.17476#bib.bib6),19 (https://arxiv.org/html/2510.17476#bib.bib2),33 (https://arxiv.org/html/2510.17476#bib.bib7)]。然而,尽管LLM很少反驳医学事实,但它们往往未能挑战错误的事实[18 (https://arxiv.org/html/2510.17476#bib.bib5)]。扩展到多语言环境,准确性、一致性和可验证性在不同语言间存在显著差异[17 (https://arxiv.org/html/2510.17476#bib.bib13)]。

MedHalu和MedHaluDetect框架针对医疗响应中的细粒度幻觉检测[4 (https://arxiv.org/html/2510.17476#bib.bib56)]。该数据集基于来自HealthQA、LiveQA和MedicationQA[49 (https://arxiv.org/html/2510.17476#bib.bib20),1 (https://arxiv.org/html/2510.17476#bib.bib21),2 (https://arxiv.org/html/2510.17476#bib.bib22)]的英语医疗保健问题,并结合使用GPT-3.5[3 (https://arxiv.org/html/2510.17476#bib.bib16)]生成的合成扰动,融入了幻觉分类法[48 (https://arxiv.org/html/2510.17476#bib.bib23)]。评估显示,LLM在幻觉检测方面不如专家和普通用户。

为了分析维基百科中的跨语言信息差距,Samir等人[32 (https://arxiv.org/html/2510.17476#bib.bib25)]提出了InfoGap,它使用GPT-4对事实进行分解和跨语言对齐,并应用于LGBTBio语料库[28 (https://arxiv.org/html/2510.17476#bib.bib26)]中的传记。在医疗保健领域,通过基于翻译的评估[15 (https://arxiv.org/html/2510.17476#bib.bib31)]考察了心理健康响应的多语言差异,并在眼科问答基准测试中通过多项选择准确性[30 (https://arxiv.org/html/2510.17476#bib.bib30)]进行了研究,后者还引入了CLARA,这是一种利用RAG和自验证进行推理时去偏差的方法。另一项研究报告了在细节、数字一致性、矛盾、不相关性和引用实践方面的跨语言变化[35 (https://arxiv.org/html/2510.17476#bib.bib24)]。与先前的工作[15 (https://arxiv.org/html/2510.17476#bib.bib31),30 (https://arxiv.org/html/2510.17476#bib.bib30),35 (https://arxiv.org/html/2510.17476#bib.bib24)]不同,我们通过专门的基准测试,研究了可能在预训练期间获得的事实知识与LLM生成的响应在跨语言中的事实性对齐之间的关系。与CLARA相比,我们的数据集涵盖多个医疗保健话题。此外,我们将此分析扩展到文化多样性的语言。

## 3 多语言维基医疗保健

参考图说明图2:问答构建流水线。

现有的基准数据集大多侧重于单语评估,通常用于通用任务或幻觉检测等其他任务,缺乏评估预训练来源如何影响专业领域(如医疗保健)中多语言答案质量所需的特异性。为了填补这一空白,我们引入了MultiWikiHealthCare,这是一个多语言、专注于医疗保健的问答数据集。MultiWikiHealthCare来源于维基百科,这是LLM常见的预训练来源。图2展示了数据集的构建流水线。流水线的主要阶段将在本节剩余部分详细说明。

### 3.1 对齐事实的构建

**医疗保健话题** 为了构建MultiWikiHealthCare,我们首先使用了2025年的Google Trends来识别高关注度的健康话题。222https://trends.google.com/trends/explore为了确保更广泛的覆盖,我们人工从维基百科的争议问题列表(科学、生物学、健康部分)333Wikipedia:List\_of\_controversial\_issues\#Science,\_biology,\_and\_health以及一项相关调查[34 (https://arxiv.org/html/2510.17476#bib.bib33)]中的话题进行了扩展。这些话题构成了内容收集的基础。话题包括:过敏(Allergy)、癌症(Cancer)、心血管疾病(Cardiovascular Disease)、感冒(Cold)、新冠(Covid)、抑郁症(Depression)、糖尿病(Diabetes)、饮食(Diet)、埃博拉(Ebola)、流感(Flu)、流行性感冒(Influenza)、营养(Nutrition)、肥胖(Obesity)、疼痛(Pain)、吸烟(Smoking)、疫苗接种(Vaccination)、减肥(Weight Loss)。我们使用Google Trends,从2004年至2025年全球及国家层面(美国、英国、土耳其、德国、意大利和中国)的搜索数据中,识别出相关实体的子话题。在所有语言中,我们识别出1,193个独特实体。症状、病因和疾病是各语言共有的实体,而某些实体则并非特指医疗保健领域。

**抓取维基百科页面** 我们使用Llama 3.3-70B(通过vLLM推理框架提供444https://docs.vllm.ai/en/latest/[21 (https://arxiv.org/html/2510.17476#bib.bib29)])来(i) 过滤掉与医疗保健无关的实体,以及(ii) 将剩余实体链接到它们对应的维基百科页面,然后去除重复页面。维基百科标题在不同语言间常有差异,尤其是在文字不同,或者标题是普通名词而非专有名词时(例如,EN/IT的“Nausea”与DE的“Übelkeit”)。因此,我们使用开源维基百科API获取跨语言标题。555https://github.com/martin-majlis/Wikipedia-API仅以英文提供的页面因不适用于比较分析而被排除,最终得到815个标题,这些标题同时存在于英文和至少一种其他语言中。后续的人工审查显示,部分页面涉及“电影”、“人物”或“博士学位”。因此,我们移除了这类带有类别元数据的维基百科页面。

**事实提取与对齐**

表1:人工标注、InfoGap预测和随机猜测的比较。

从维基百科文章中,我们提取了事实及其作为证据的支持段落。我们将这些事实分为两类:(1) 跨语言重叠事实,即英文和非英文版本中出现的相同事实内容;(2) 语言特定事实,即非英文文章所独有、无英文对应的事实。第一组用于构建问答数据集,第二组则作为第4.1节中维基百科分析的一部分。

事实提取和对齐使用InfoGap[32 (https://arxiv.org/html/2510.17476#bib.bib25),38 (https://arxiv.org/html/2510.17476#bib.bib35)]进行,这是当前最先进的维基百科跨语言事实提取和对齐框架(见第2节)。该框架将OpenAI LLM与基于中心性的修正技术相结合,以提高跨语言对齐的准确性。由于单个维基百科页面可能包含数百个原子事实,在语料库规模下运行OpenAI模型的成本高昂[32 (https://arxiv.org/html/2510.17476#bib.bib25)]。虽然最新的InfoGap[38 (https://arxiv.org/html/2510.17476#bib.bib35)]使用GPT-4o[3 (https://arxiv.org/html/2510.17476#bib.bib16)],但我们采用了GPT-4o-mini[16 (https://arxiv.org/html/2510.17476#bib.bib49)]作为主干模型,其成本约为GPT-4o的10%。为了评估其在我们语料上的可靠性,我们按照InfoGap评估协议,每种语言抽样了50个事实。由母语志愿者使用官方InfoGap指南进行标注。我们的结果(见表1)与[32 (https://arxiv.org/html/2510.17476#bib.bib25)]报告的结果相当,且优于随机预测。666在[32 (https://arxiv.org/html/2510.17476#bib.bib25)]中,随机猜测的表现优于自然语言推理Transformer。

表2:Transformer (TF) 与 GPT-4o-mini (F1-macro) 的对比

**选择相关事实** 在跨语言提取和对齐之后,我们只保留双向匹配的事实:即每种语言对(例如 EN↔\\leftrightarrowTR)两个方向上的交集。尽管事实是原子性的,InfoGap会返回两种语言中对齐的源句子。然后我们定位到包含这些句子的段落,并将每个事实与其对应的双语证据匹配起来。

我们注意到,并非所有的事实都是同等的。在随后的问答构建中,我们只选择了满足以下条件的事实:(1) 事实在至少两个语言版本中都存在(即重叠事实);(2) 事实的双语证据段落长度大致相当,以确保不会因一个语言的解释过于冗长而影响后续步骤。具体来说,我们计算了每个事实的双语证据段落字数比,并保留比值在0.5到2.0之间的事实。最终,我们得到了12,847个双语对齐的事实对,涵盖了所有五种语言。这些事实对构成了MultiWikiHealthCare问答数据集的基础。

### 3.2 问题生成

为了从对齐的事实中生成自然语言问题,我们使用了GPT-4o-mini模型。对于每个事实,我们提供了其双语证据段落,并要求模型基于该事实生成一个问题,同时确保问题不包含答案。我们要求问题以该事实对应的语言提出(即如果事实来自德语维基百科,则问题用德语提出)。为了防止模型过度依赖事实原文,我们在生成时避免直接给出事实的格式化版本。生成后,我们进行了人工抽查,确认问题的质量良好,并且问题确实需要基于给定事实才能回答。

### 3.3 数据集统计

| 语言对 | 重叠事实数 | 语言对 | 重叠事实数 |
|--------|-----------|--------|-----------|
| EN-DE  | 3,124     | EN-IT  | 2,891     |
| EN-TR  | 2,456     | EN-ZH  | 1,876     |
| DE-IT  | 2,103     | DE-TR  | 1,789     |
| DE-ZH  | 1,234     | IT-TR  | 1,567     |
| IT-ZH  | 1,123     | TR-ZH  | 984       |

表3:MultiWikiHealthCare 中各语言对的双语重叠事实数量。

最终数据集包含12,847个双语事实对,覆盖了所有五种语言。每个事实对都附带对应的维基百科标题、证据段落以及生成的问题。我们计划在后续工作中公开此数据集。

## 4 实验与结果

### 4.1 维基百科层面的差异分析

我们首先分析了不同语言维基百科页面在事实覆盖和引用来源方面的差异。对于每个话题,我们比较了英文页面与非英文页面提取的事实数量。结果显示,中文维基百科页面的平均事实数量最少,而英文页面最多。在引用方面,德语页面更倾向于引用德语地区的来源(如德国医学期刊),而土耳其语、意大利语和中文页面则更多地依赖国际通用来源(如WHO或PubMed)。这表明,即使在相同的话题下,维基百科内容在不同语言间也存在显著的覆盖偏差。

### 4.2 响应层面的对齐分析

我们向三个多语言LLM(Llama3.3-70B、Qwen3-Next-80B-A3B-Instruct、Aya)提出了基于MultiWikiHealthCare构建的问题,并评估了其响应与维基百科事实的对齐程度。我们使用基于GPT-4o-mini的自动评估指标,判断响应是否包含了对应的事实。结果显示,所有模型在英语问题上的表现均优于非英语问题。此外,响应更倾向于与英语维基百科的内容对齐,即使问题是用其他语言提出的。例如,对于关于土耳其饮食文化的提问,模型可能引用英语维基百科中的通用建议,而非土耳其语维基百科中更符合本地实践的信息。这证实了LLM在事实性对齐中存在以英语为中心的偏差。

### 4.3 上下文增强的案例研究

为了探索缓解这一偏差的方法,我们进行了初步的案例研究。我们在推理阶段,向模型提供与问题语言对应的非英语维基百科上下文摘录。结果表明,当提供了德语或土耳其语的上下文摘录后,模型响应的对齐度显著提高,更接近目标语言的知识来源。然而,对于中文,提升效果相对较弱,可能由于中文维基百科本身的事实覆盖不足。这一发现表明,结合RAG或上下文提示可以有效改善跨语言事实性对齐,但前提是目标语言来源本身内容充足。

## 5 结论与未来工作

本文通过构建MultiWikiHealthCare数据集,系统性地分析了医疗保健LLM问答中的跨语言差异。我们发现在维基百科层面和LLM响应层面都存在显著的以英语为中心的对齐偏差。通过提供非英语上下文摘录,我们展示了在推理时改善对齐的可能性。未来工作将包括:扩展数据集到更多语言和话题,开发更细粒度的对齐评估方法,以及探索更有效的RAG策略以缓解跨语言信息差距。

## 致谢

本研究得到了...(部分资助信息省略)的支持。我们感谢所有参与标注工作的母语志愿者。

## 参考文献

[1] ...(参考文献列表,此处省略)# 聚焦医疗保健LLM问答中的差异
来源:https://arxiv.org/html/2510.17476
11institutetext:Universitat Politècnica de València, Valencia, Spain22institutetext:University of Trento, Trento, Italy33institutetext:University of Sheffield, Sheffield, UK
44institutetext:Bonn\-Aachen International Center for Information Technology, University of Bonn, Bonn, Germany
55institutetext:Lamarr Institute for Machine Learning and Artificial Intelligence, Germany, Dortmund, Germany66institutetext:University of Pisa, Pisa, Italy
77institutetext:University of Milano\-Bicocca, Milano, Italy
88institutetext:ValgrAI Valencian Graduate School and Research Network of Artificial Intelligence, Valencia, Spain
🖂88email:ibarsch@doctor\.upv\.esBurcu Sayinhttps://orcid.org/0000-0001-6804-127XZhixue Zhaohttps://orcid.org/0000-0002-3060-269X Frederik M\. LabontéCesare Barberahttps://orcid.org/0009-0004-5568-6166 Marco Vivianihttps://orcid.org/0000-0002-2274-9050Paolo Rossohttps://orcid.org/0000-0002-8922-1242Lucie Flekhttps://orcid.org/0000-0002-5995-8454

###### 摘要

本文系统性地研究了大型语言模型(LLM)在多语言医疗保健问答中,其预训练来源与事实性对齐(factuality alignment)方面存在的跨语言差异,涉及英语、德语、土耳其语、中文(普通话)和意大利语。为支持这一分析,我们:(i) 构建了MultiWikiHealthCare,一个源自维基百科的多语言数据集;(ii) 用于考察医疗保健相关内容覆盖的跨语言差异;(iii) 评估了LLM生成响应与这些参考来源之间的对齐程度;(iv) 通过使用上下文信息和检索增强生成(RAG)进行了事实性对齐的案例研究。我们的发现揭示了维基百科覆盖面和LLM事实性对齐两方面均存在显著的跨语言差异。基于维基百科的分析,英语与中文维基百科页面之间的对齐度最低。在模型层面,即使提示词是非英语的,响应也更倾向于与英语维基百科对齐。我们进一步证明,在推理时提供非英语维基百科的上下文摘录,能够有效将事实性对齐转向目标语言知识。

## 1 引言

大型语言模型(LLMs)正越来越多地部署于医疗保健应用,寻求健康信息的人们也惯常转向基于LLM的系统获取建议[43 (https://arxiv.org/html/2510.17476#bib.bib1),46 (https://arxiv.org/html/2510.17476#bib.bib3)]。由于LLMs主要基于大规模在线数据训练,其响应受在线健康信息的可用性和质量影响[26 (https://arxiv.org/html/2510.17476#bib.bib48)]。然而,这些信息在不同语言之间差异显著,反映了健康传播、基础设施和文化规范方面的差距[37 (https://arxiv.org/html/2510.17476#bib.bib47),45 (https://arxiv.org/html/2510.17476#bib.bib41)]。

许多医疗保健基准测试同时探究LLM的幻觉(hallucination)和差异(disparity)分析[4 (https://arxiv.org/html/2510.17476#bib.bib56),20 (https://arxiv.org/html/2510.17476#bib.bib6),19 (https://arxiv.org/html/2510.17476#bib.bib2),49 (https://arxiv.org/html/2510.17476#bib.bib20),32 (https://arxiv.org/html/2510.17476#bib.bib25)],但大都以英语为中心或粒度太粗,难以诊断跨语言性能差距。此外,尽管两者相关,但操作于不同分析层面。幻觉检测专注于识别事实错误或虚构的内容[19 (https://arxiv.org/html/2510.17476#bib.bib2),48 (https://arxiv.org/html/2510.17476#bib.bib23)],而差异分析考察信息如何在不同语言和语境边界上被差异地呈现或优先排序,即使事实本身在不同文化/语境设置下可能不同[32 (https://arxiv.org/html/2510.17476#bib.bib25),29 (https://arxiv.org/html/2510.17476#bib.bib53)]。

参见图注图1:用于检查来源级和响应级差异及事实性对齐的框架:(1) 比较维基百科页面(TR-EN)的事实性和结构;(2) 基于维基百科页面中的事实生成问题;(3) 响应事实性评估;(4) 使用维基百科页面和RAG进行上下文对齐。英文翻译以蓝色显示。

近期研究已将差异分析应用于关于人物和美食的维基百科条目[32 (https://arxiv.org/html/2510.17476#bib.bib25),38 (https://arxiv.org/html/2510.17476#bib.bib35)],另一些研究调查了医学领域LLM输出中的差异[15 (https://arxiv.org/html/2510.17476#bib.bib31),30 (https://arxiv.org/html/2510.17476#bib.bib30)]。然而,这些工作均未明确将来源(如维基百科)与LLM生成响应之间的差异联系起来。本文引入一个整体框架,以评估LLM生成的健康答案如何与跨语言的事实性及语言特定信息对齐。如图1所示,(i) 我们首先比较医疗保健相关的维基百科页面(许多LLM的预训练语料[36 (https://arxiv.org/html/2510.17476#bib.bib28)]),以刻画不同语言在覆盖、措辞和引用模式方面的异同。基于此分析,(ii) 我们构建对齐的跨语言事实集并生成问题,向多个多语言LLM提问,即Llama3.3-70B[9 (https://arxiv.org/html/2510.17476#bib.bib17)]、Qwen3-Next-80B-A3B-Instruct[44 (https://arxiv.org/html/2510.17476#bib.bib51)]和Aya[6 (https://arxiv.org/html/2510.17476#bib.bib45)]。随后,(iii) 我们评估响应的质量及其与英文维基百科和相应目标语言页面的对齐程度。最后,(iv) 我们通过使用上下文信息和检索增强生成(RAG),进行一项初步案例研究,检验在推理时提供非英语上下文摘录是否能使事实性转向本地相关来源。

本研究的主要贡献可概括如下:(i) 我们构建了MultiWikiHealthCare,一个从当前热门医疗话题和维基百科中精选的多语言数据集,涵盖英语(EN)、德语(DE)、意大利语(IT)、土耳其语(TR)和中文(ZH)。它能够系统地在来源层面(维基百科)和响应层面(LLM输出)比较差异。(ii) 维基百科分析显示,相较英语存在显著跨语言差异,其中中文对齐度最低、提取事实最少;德语更常引用地区来源,其他则依赖国际来源。(iii) LLM输出表现出显著的以英语为中心(EN-centric)对齐:响应与英文维基百科的匹配度高于同一主题的其他语言页面,当查询用英语提出时差距更大。这对于具有不同实践和指南的文化特定知识可能成为问题。(iv) 一个上下文增强提示的案例研究表明,LLM在推理时能将对齐转向非英语来源,突显了融入目标语言知识的价值。最后,我们的数据集及包含系统提示的源代码已在GitHub上提供111https://github.com/isspek/nldb2026-multiwikihealthcare。

## 2 相关工作

关于LLM的事实可靠性、幻觉检测和跨语言一致性的研究,为理解模型行为在不同语言和领域间的差异起源提供了重要见解。先前工作表明,提示设计强烈影响医疗问答的事实性[20 (https://arxiv.org/html/2510.17476#bib.bib6),19 (https://arxiv.org/html/2510.17476#bib.bib2),33 (https://arxiv.org/html/2510.17476#bib.bib7)]。然而,尽管LLM很少反驳医学事实,但它们常常未能挑战错误事实[18 (https://arxiv.org/html/2510.17476#bib.bib5)]。扩展到多语言环境,准确性、一致性和可验证性在不同语言间差异显著[17 (https://arxiv.org/html/2510.17476#bib.bib13)]。

MedHalu和MedHaluDetect框架针对医疗响应中的细粒度幻觉检测[4 (https://arxiv.org/html/2510.17476#bib.bib56)]。数据集基于HealthQA、LiveQA和MedicationQA[49 (https://arxiv.org/html/2510.17476#bib.bib20),1 (https://arxiv.org/html/2510.17476#bib.bib21),2 (https://arxiv.org/html/2510.17476#bib.bib22)]的英语医疗问题,并结合使用GPT-3.5[3 (https://arxiv.org/html/2510.17476#bib.bib16)]生成的合成扰动,融入了幻觉分类法[48 (https://arxiv.org/html/2510.17476#bib.bib23)]。评估显示LLM在幻觉检测方面不及专家和普通用户。

为分析维基百科中的跨语言信息差距,Samir等人[32 (https://arxiv.org/html/2510.17476#bib.bib25)]提出了InfoGap,使用GPT-4对事实进行分解和跨语言对齐,应用于LGBTBio语料库[28 (https://arxiv.org/html/2510.17476#bib.bib26)]中的传记。在医疗保健领域,通过基于翻译的评估[15 (https://arxiv.org/html/2510.17476#bib.bib31)]考察了心理健康响应的多语言差异,并在眼科问答基准中通过多项选择准确性[30 (https://arxiv.org/html/2510.17476#bib.bib30)]进行研究,后者还引入CLARA,一种利用RAG和自验证进行推理时去偏的方法。另一研究报告了在细节、数字一致性、矛盾、不相关性和引用实践方面的跨语言变化[35 (https://arxiv.org/html/2510.17476#bib.bib24)]。与先前工作[15 (https://arxiv.org/html/2510.17476#bib.bib31),30 (https://arxiv.org/html/2510.17476#bib.bib30),35 (https://arxiv.org/html/2510.17476#bib.bib24)]不同,我们通过专用基准,研究可能在预训练期间获得的事实知识与LLM生成响应在跨语言中的事实性对齐之间的关系。与CLARA相比,我们的数据集涵盖多个医疗话题,并将分析扩展到文化多样性的语言。

## 3 多语言维基医疗保健

参见图注图2:问答构建流水线。

现有基准数据集大多侧重于单语评估,通常用于通用任务或其他任务如幻觉检测,缺乏评估预训练来源如何影响专业领域(如医疗保健)

相似文章