AI 聊天机器人能否找到专家所找的内容?模型、用户角色和样本大小对医学问题研究检索的影响
摘要
本研究评估了像 ChatGPT、Claude 和 Gemini 这样的 AI 聊天机器人如何为医学问题检索临床研究,发现模型和用户角色对性能有显著影响,并且对较大样本大小存在偏倚。
arXiv:2608.13786v1 公告类型:交叉
摘要:大型语言模型(LLM)聊天机器人越来越多地用于回答临床问题,并引用相关临床研究。先前的研究主要集中在引用伪造上,缺乏对检索研究质量及其选择驱动因素的评估。本研究评估了三种通用 LLM 聊天机器人:Claude Sonnet 5、Gemini 3.1 Pro 和 ChatGPT GPT-5.5。我们使用来自 2026 年 Cochrane 系统评价数据库第 6 期和第 7 期中 20 个评价问题的临床问题来提示模型,模拟患者、临床医生和证据综合研究员角色。每个聊天机器人在每个用户角色下被查询四次独立重复,共产生 720 个响应。每个聊天机器人被要求用主要临床引文支持其答案,我们将其与 Cochrane 评价的纳入和排除研究集进行基准比较。平均而言,聊天机器人响应检索到 39.2% $\pm$ 29.8% 的 Cochrane 纳入研究,同时引用 5.0% $\pm$ 9.4% 的排除研究。Cochrane 纳入研究的召回率因模型和用户角色而异。ChatGPT 的召回率高于 Claude 或 Gemini(63.1% $\pm$ 29.5% vs. 37.0% $\pm$ 23.8% vs. 17.3% $\pm$ 13.1%;$p=2.0\times10^{-5}$)。研究员角色的召回率高于临床医生或患者角色(42.8% $\pm$ 30.8% vs. 38.6% $\pm$ 28.9% vs. 36.1% $\pm$ 29.3%;$p=2.0\times10^{-5}$)。控制出版年份、每年引文数和开放获取状态后,样本大小是唯一独立显著的检索预测因子(log 样本大小每增加 1 单位,优势比为 1.80,95% CI 1.37-2.36,$p=2.34\times10^{-5}$)。这些发现表明,虽然 LLM 聊天机器人可以检索到专家评审员识别的一些研究,但其性能因模型和用户角色而异,并且对具有较大样本大小的临床试验存在偏倚。
查看缓存全文
缓存时间: 2026/08/17 10:05
# AI聊天机器人能否找到专家会找的研究?模型、用户角色和样本量对医学问题文献检索的影响
来源:https://arxiv.org/html/2608.13786
青芳刘 地址:美国国立卫生研究院国家药物滥用研究所体内研究计划,马里兰州巴尔的摩 电子邮箱:qingfang\.liu@nih\.gov
乔金 地址:美国国立卫生研究院国家医学图书馆,马里兰州贝塞斯达 电子邮箱:qiao\.jin@nih\.gov
乔·D·门克 地址:伊利诺伊大学厄巴纳-香槟分校信息科学学院,伊利诺伊州香槟市 电子邮箱:jmenke2@illinois\.edu
托尔斯滕·卡恩特 地址:美国国立卫生研究院国家药物滥用研究所体内研究计划,马里兰州巴尔的摩 电子邮箱:thorsten\.kahnt@nih\.gov
陆志勇† 地址:美国国立卫生研究院国家医学图书馆,马里兰州贝塞斯达 †电子邮箱:zhiyong\.lu@nih\.gov
###### 摘要
大型语言模型(LLM)聊天机器人越来越多地被用于回答临床问题,并引用相关临床研究。此前的研究主要集中在引用捏造问题上,但对于检索到的研究质量及其选择驱动因素的评估存在空白,特别是针对具有更强推理能力的新模型。本研究评估了三个近期推出的通用LLM聊天机器人:Claude Sonnet 5、Gemini 3\.1 Pro 和 ChatGPT GPT\-5\.5。我们使用从2026年《考克兰系统评价数据库》第6期和第7期中的20个综述问题改编的临床问题来提示这些模型,并模拟了患者、临床医生和证据综合研究人员这三种用户角色。对于每个综述问题,我们在三种用户角色下分别询问每个聊天机器人,每个聊天机器人-角色组合重复四次独立查询,总共产生720个回复(3个聊天机器人×3个用户角色×4次重复×20个综述问题)。每个聊天机器人被要求用主要临床引文支持其回答,然后我们将其与相应考克兰综述中纳入和排除的研究集进行基准比较。平均而言,单个聊天机器人回复检索到了39\.2%±29\.8%(所有720个回复的均值±标准差)的考克兰纳入研究,同时引用了5\.0%±9\.4%的考克兰排除研究。对考克兰纳入研究的召回率因模型和用户角色而有显著差异。ChatGPT的召回率高于Claude或Gemini(63\.1%±29\.5% vs\. 37\.0%±23\.8% vs\. 17\.3%±13\.1%;区组排列检验,\(p=2.0×10^{-5}\))。研究人员角色比临床医生或患者角色产生更高的召回率(42\.8%±30\.8% vs\. 38\.6%±28\.9% vs\. 36\.1%±29\.3%;\(p=2.0×10^{-5}\))。在控制了发表年份、年引用量和开放获取状态后,样本量是唯一独立显著的检索预测因子(对数样本量每增加1个单位,优势比为1\.80,95% CI 1\.37–2\.36,\(p=2.34×10^{-5}\))。这些发现表明,虽然LLM聊天机器人可以检索到部分由专家评审员确定的研究,但其表现因模型和用户角色而异,并且它们表现出对较大样本量临床试验的偏倚。收集的LLM回复和分析代码可在 https://github\.com/QingfangLiu/llm\-evidence\-retrieval\-bias 获取。
###### 关键词
大型语言模型;证据检索;检索偏倚;系统评价;考克兰综述;证据综合;医学问答
\\copyrightinfo
© 2024 作者。开放获取章节由世界科学出版公司出版,并根据知识共享署名-非商业性使用4\.0许可协议条款分发。
## 1 引言
越来越多的人咨询聊天机器人来解决医学问题,包括请求从现有文献中检索证据以更好地理解病情\[costagomes2026healthqueries,shpiner2026chatbotfirst\],这部分得益于聊天机器人在医学知识基准上的强劲表现\[singhal2023clinicalknowledge,Jin2026LLMMedicalResearch\]。然而,通用聊天机器人识别和引用相关临床研究的能力仍然缺乏充分描述\[somer2026studyidentification,chelli2024hallucination,gwon2024scientificsearches,sarker2024natural\],尤其是考虑到先前发现大型语言模型可能会捏造或幻觉引用\[walters2023fabrication,wu2025sourcecheckup,wang\-etal\-2025\-medcite,jin2026med,topaz2026fabricated\]。与此同时,系统评价和荟萃分析综合专家选定的原始研究,为医学问题产生更高质量的结论\[lefebvre2025searching\]。这就引出了一个重要问题:聊天机器人引用的研究与系统评价中纳入的研究有多接近?
一些先前的工作已开始评估通用聊天机器人检索原始研究的表现,通常通过将聊天机器人引用的研究与已发表系统评价的纳入研究列表进行比较。这些评估通常报告较低的召回率,而精确率和引用捏造率在不同系统和评估方法之间存在差异。Somer等人\[somer2026studyidentification\]在针对一项产科荟萃分析的14项研究上评估了六个公开可用的系统,表现最佳的系统Claude 3\.7识别了五项研究。Chelli等人\[chelli2024hallucination\]在11项肩袖干预系统评价中测试了三个LLM,报告精确率为0–13\.4%,幻觉率为28\.6–91\.4%。Gwon等人\[gwon2024scientificsearches\]发现ChatGPT和Bing AI分别仅从24项随机试验中识别出一项和两项基准随机试验。Sidhu等人\[sidhu2026trust\]比较了九种现代聊天机器人配置中超过1200篇参考文献的真实性、质量和地理来源。Low等人\[low2025clinicalquestions\]发现,通用LLM产生的相关、基于证据的答案非常少(仅占问题的2–10%)。然而,这些研究大多依赖于早于高级推理和智能体系统的模型,这使得现代、能力更强的模型在这些情境下的行为尚不明确。此外,许多先前工作仅关注单一医学领域\[somer2026studyidentification,chelli2024hallucination,gwon2024scientificsearches\],限制了其结论的普适性。
在生物医学之外,检索基准研究如LitSearch\[ajith2024litsearch\]表明,检索性能随查询特异性和查询构建方式变化显著。PaperAsk评估了GPT\-4o、GPT\-5和Gemini\-2\.5\-Flash在多个科学领域的表现,发现48\-98%的多参考文献查询中引用检索失败\[wu2025paperaskbenchmarkreliabilityevaluation\]。Gao等人评估了五个LLM在40篇随机选择的原始文章上的表现,发现模型在47\.8%的情况下未能检索到正确的参考文献数据\[gao2026errors\]。相关工作探讨了邻近的故障模式而非召回率本身:生成的引用是否确实支持其相关主张\[wu2025sourcecheckup\],引用被完全捏造或包含元数据错误的频率\[walters2023fabrication\],以及参考文献生成性能在不同模型、学科和文献综述语料库中的出版时效性差异\[tang2025literaturereview\]。其他工作则要求聊天机器人为PubMed和Embase等书目数据库生成搜索策略,而不是直接选择研究,但这种设置可能无法反映普通用户与聊天机器人的交互方式\[tam2026database\]。
另一个考量因素是,不同类型的用户(例如患者、临床医生、证据综合研究人员)可能为医学问答寻求获取原始临床研究\[easterlin2020child\],而这种差异是否会影响证据检索仍是一个开放性问题。任务对齐的角色扮演已被证明有助于推理基准测试\[kong2024roleplay\],而为模型分配角色并不能可靠地提高准确性,有时甚至会降低准确性\[zheng2024personas\]。角色信息更广泛地以并非总是追踪真实人类差异的方式改变模型预测\[hu2024persona\]。提示架构和框架即使在不涉及角色时也可能诱发系统性的、非中立的偏见\[brucks2025promptarchitecture\],并且仅患者问题框架就已被证明会改变模型的医学结论,即使潜在证据保持不变\[yun2026framing\]。然而,此前尚无研究测试用户的自我认同角色是否会改变聊天机器人检索到的原始研究。
在本研究中,我们评估了三个当代通用聊天机器人系统(GPT\-5\.5、Claude Sonnet 5和Gemini 3\.1 Pro,均具备网络搜索功能)在源自20个考克兰综述主题的医学问题上的表现。对于每个主题,提示分别从患者、临床医生或证据综合研究人员的角度构建,每个角色-主题组合重复四次。GPT\-5\.5在考克兰纳入研究集的召回率上表现最高,证据综合研究人员框架比临床医生或患者框架产生更高的召回率。在控制了发表年份、引用率和开放获取状态后,较大的样本量仍然是唯一显著的检索预测因子。这些发现表明,基于聊天机器人的证据检索是不完整的、依赖于上下文的,并且偏向于较大的临床试验,这对使用聊天机器人获取医学信息的患者,以及临床医生、LLM开发者、医学AI研究者和政策制定者都具有影响\[meyer2023chatgpt,weissenbacher2026enhancing,sahoo2024large\]。
## 2 方法
### 2\.1 综述选择
我们使用了发表在2026年《考克兰系统评价数据库》第6期和第7期的考克兰干预综述。这是实验时可用的两个最完整、最新的期刊,并且均在三个聊天机器人的知识截止日期之后(见下文)。20篇合格的干预综述涵盖了不同的临床领域,评估了药物或生物干预(n = 7)、程序、手术或实验室技术(n = 4)、床边护理或临床管理策略(n = 3)、营养补充剂(n = 2)、康复或保守物理治疗(n = 2)、行为干预(n = 1)以及远程医疗或服务提供干预(n = 1)。我们排除了涉及诊断、预后或其他非干预问题的方案和综述。
### 2\.2 实验
我们使用表2\.2 (https://arxiv.org/html/2608.13786#S2.SS2) 中列出的推理启用模型配置评估了三个广泛使用的通用聊天机器人。选择这些系统是为了代表主流的消费聊天机器人生态系统。为了提供模型能力的外部背景,我们还参考了“人类终极考试”(HLE),这是一个多模态、前沿水平的学术基准,包含由专家编写的跨越数十个学科的3000个问题,旨在探测超越标准基准套件的高级知识和推理能力。每个回复都在一个全新的匿名网络会话中独立生成,没有先前的对话上下文。数据于2026年7月中下旬从美国东海岸收集。
\\tbl 聊天机器人系统、配置及基准性能。\\toprule
模型 & 知识截止日期 & 发布日期 & 推理配置 & HLE(无工具) & HLE(使用工具)\\colrule
Anthropic Claude Sonnet 5 & 2026年1月 & 2026年6月30日 & 中等努力;启用思考 & 43\.2% & 57\.4% \\
Google Gemini 3\.1 Pro & 2025年1月31日 & 2026年2月19日 & 扩展思考 & 44\.4% & 51\.4% \\
OpenAI GPT\-5\.5 & 2025年12月1日 & 2026年4月23日 & 高推理 & 41\.4% & 52\.2% \\botrule\\tabnote
注:知识截止日期表示模型文档化训练知识所涵盖的最新日期。HLE(人类终极考试)是一个由专家编写的3000个问题组成的多模态基准。
对于每个综述问题,我们设计了代表不同用户角色的三个提示。除了每个提示开头陈述的用户角色外,措辞尽可能保持一致。我们还明确指示聊天机器人在回答时依赖主要证据(例如,原始研究和临床试验),而非次要证据(例如,系统评价、荟萃分析、叙述性综述、委员会意见、实践指南、社论或评论)。为考虑聊天机器人回复的变异性,每个提示运行四次。一个示例见表。
\\tbl 针对一个综述问题的三种用户角色提示变体示例。\\toprule
用户角色 & 角色特定开头\\colrule
患者 & 我患有高血压,正在考虑服用药物帮助减肥。 \\
临床医生 & 我是一名临床医生,负责照顾患有高血压并考虑服用药物帮助减肥的人。 \\
证据综合研究人员 & 我是一名证据综合研究人员,研究高血压患者的减肥药物。相似文章
研究:AI聊天机器人回答普通用户日常健康相关问题的准确率近76%
宾夕法尼亚州立大学的一项研究发现,像ChatGPT这样的AI聊天机器人回答日常健康问题的准确率接近76%,这引发了人们对它们在现实医疗应用中可信度的担忧。研究指出,AI工具可能更适合由医生使用,而非患者。
用ChatGPT解答健康疑问
OpenAI发布了关于如何使用ChatGPT处理健康相关问题的指南,阐述了用户如何在理解模型在医疗场景中的局限性的同时充分利用该模型。
ChatGPT、Gemini、Claude、Grok 未能通过选举话题准确性测试:Forum AI
Forum AI 的一项研究发现,ChatGPT、Gemini、Claude 和 Grok 等主要聊天机器人未能提供准确且无偏见的选举信息,其中 90% 的回答包含错误或偏见。
一个AI聚合器?
一位用户分享了使用ChatGPT进行复杂医疗护理的经验,并提出聚合多个AI模型的想法,通过寻求不同LLM之间的共识来提高可靠性。
提升ChatGPT的健康智能
OpenAI宣布通过使用GPT-5.5 Instant,在ChatGPT中显著提升了健康相关回答的质量,其准确性与前沿模型相当,并通过医生主导的评估将事实性问题减少了71%。