研究:AI聊天机器人回答普通用户日常健康相关问题的准确率近76%

Reddit r/singularity 论文

摘要

宾夕法尼亚州立大学的一项研究发现,像ChatGPT这样的AI聊天机器人回答日常健康问题的准确率接近76%,这引发了人们对它们在现实医疗应用中可信度的担忧。研究指出,AI工具可能更适合由医生使用,而非患者。

你们对此怎么看?
查看原文
查看缓存全文

缓存时间: 2026/05/29 11:48

# 呼叫GPT医生:AI对医疗咨询的响应准确率接近76% 来源: https://www.psu.edu/news/research/story/calling-doctor-gpt-ai-responses-healthcare-queries-are-nearly-76-accurate 研究 (https://www.psu.edu/news/research) ## 宾夕法尼亚州立大学研究人员指出,人工智能在支持医生方面显示出潜力,但患者的健康问题最好还是留给人类医生处理 像ChatGPT这样的大型语言模型对健康咨询的响应准确率接近76%,这引发了人们对其在现实应用中可信度的担忧。图片来源:fizkes/Getty Images。版权所有。 宾夕法尼亚州立大学帕克分校 — 一项由宾夕法尼亚州立大学研究人员主导的新研究(https://doi.org/10.48550/arXiv.2506.13805)表明,基于人工智能的聊天机器人对普通用户提出的日常健康相关问题响应准确率接近76%,这引发了对其在现实面向客户应用中可信度的担忧。 研究人员希望了解普通人如何使用人工智能解决健康问题,以及AI对日常医学查询的响应准确度。他们发现,在医疗保健领域,尤其是神经科和皮肤科等专业领域,AI工具最好由经过培训的医生而非患者使用。该团队将于2026年6月25日至28日在加拿大蒙特利尔举行的ACM公平、问责与透明度(FAccT)会议(https://facctconference.org/2026/acceptedpapers.html)上展示他们的研究成果。 “我们的研究重点关注普通互联网用户可能向AI提出的医疗场景,这是以往大型语言模型(LLM)与医疗相关研究未曾覆盖的视角。”研究合著者、宾夕法尼亚州立大学信息科学与技术学院(IST)信息学与智能系统副教授阿穆利亚·亚达夫(Amulya Yadav)表示,“我们想了解的是,如果人们像过去使用谷歌一样,把ChatGPT这类LLM当作症状健康检查工具,那么LLM在回答这些查询时的准确度如何,以及这些回答可能带来多大危害。” 为了了解普通互联网用户使用LLM回答健康相关问题时的准确度或潜在危害程度,研究人员在宾夕法尼亚州立大学举办了一场名为“诊断马拉松”(Diagnose-a-thon)的AI竞赛(https://www.psu.edu/news/campus-life/story/competition-highlights-generative-ais-power-pitfalls-medical-diagnoses)。共有34名参与者——包括教职员工、本科生和研究生——提交了212条提示词及AI生成的回答,这些回答既包含基于真实健康问题的内容,也包含虚构情境,且分别模拟了患者和医生的视角。参与者可以选择使用以下四种LLM之一:ChatGPT-4o、ChatGPT-3.5、Gemini-1.5 Pro和Llama3-8b。 “我们研究的优势之一在于,我们试图通过告诉参与者选择自己偏好的LLM并像平常一样使用它,来重现现实世界中的LLM使用场景。”该研究的第一作者、信息科学与技术专业博士生博南·明戈尔(Bonam Mingole)说,“这种参与式研究对于理解公众如何在日常生活中使用AI至关重要。” 随后,研究人员邀请九位委员会认证的医生评估AI生成的回答的准确度以及可能造成的危害程度,采用从极低到极高的六分量表。竞赛委员会为生成最准确医学信息的前八名提交作品颁发了奖项,并为最可能造成危害的提交作品颁发了另一个奖项。 他们发现,总体上76.2%的LLM生成回答提供了准确信息。在妇产科和耳鼻喉科(治疗影响耳、鼻、喉的疾病)等专科中,LLM的表现最佳,有效性评分高且危害评分低。而在内科、神经科和皮肤科等领域,AI表现最差,有效性评分低且危害评分高。研究人员还指出,非常具体的提示词以及长度在60到250个字符之间的提示词,能使LLM输出更准确。 然后,研究人员对每个LLM的基础模型进行训练,训练数据包括医学院课程中使用的医学教科书、临床指南和经过同行评审的研究文章,以此探究额外训练是否能提高回答有效性评分并降低危害评分。他们邀请了一个由七名医学专业人士和实习生组成的评审小组——包括一名委员会认证医生、两名第二年内科住院医师、两名第四年医学生和两名第三年医学生——来评估基础LLM的回答以及增强LLM的回答,并判断哪些在临床方面更合适。研究人员发现,该评审小组更倾向于Gemini和Llama基础模型的回答,而非增强模型;对于ChatGPT模型,则没有表现出显著偏好。 “我们正进入医疗保健的新时代,AI是其中的重要组成部分。”研究合著者、宾夕法尼亚州立大学临床与转化科学研究所(https://ctsi.psu.edu/)主任、宾夕法尼亚州立大学医学院内科学教授詹妮弗·克拉什纽斯基(Jennifer Kraschnewski)说,“医疗保健领域面临着真正的变革机遇,可以整合这些新工具,让像我这样的临床医生能够利用它们改善患者护理。” 研究人员还指出,尽管LLM的有效性评分尚可,但AI的错误率仍超过20%,大约是人类医生错误率的两倍。他们认为,这些错误可能对患者造成伤害。 “我不认为AI会取代人类医生,但我确实认为我们有一个巨大的机会,以前所未有的方式帮助提升当今医生的技能。”克拉什纽斯基表示,当前的LLM可能更适合作为医疗专业人员的工具,而不是患者工具。 总体而言,研究人员表示,这项研究凸显了AI在每个人生活的关键方面可能带来的有益和有害影响。 “无论喜欢与否,人们会继续使用AI诊断健康问题。”研究合著者、宾夕法尼亚州立大学Evan Pugh大学教授兼媒体效果James P. Jimirro教授S. 沙姆·桑达(S. Shyam Sundar)说,“通过了解他们的使用模式并测试AI表现的有效性,我们的项目有助于提高人们对AI在医疗建议方面最佳和最差用途的认识。” 宾夕法尼亚州立大学IST学院的博士生阿迪蒂亚·马朱姆达尔(Aditya Majumdar)和菲尔杜斯·艾哈迈德·乔杜里(Firdaus Ahmed Choudhury)也为这项研究做出了贡献。宾夕法尼亚州立大学社会负责任人工智能中心(https://csrai.psu.edu/)主办了这次诊断马拉松竞赛。

相似文章

提升ChatGPT的健康智能

OpenAI Blog

OpenAI宣布通过使用GPT-5.5 Instant,在ChatGPT中显著提升了健康相关回答的质量,其准确性与前沿模型相当,并通过医生主导的评估将事实性问题减少了71%。

用ChatGPT解答健康疑问

OpenAI Blog

OpenAI发布了关于如何使用ChatGPT处理健康相关问题的指南,阐述了用户如何在理解模型在医疗场景中的局限性的同时充分利用该模型。

Improving health intelligence in ChatGPT

YouTube AI Channels

OpenAI组建了一支由在职医生组成的团队,通过真实临床经验评估和改进ChatGPT在健康领域的回答,旨在提高准确性与沟通方式,最终实现医疗知识的普及化。

介绍 ChatGPT Health

OpenAI Blog

OpenAI 推出 ChatGPT Health,这是一项专为增强隐私和安全而设计的专属体验,用户可安全连接医疗记录和健康应用,获取更个性化的健康指导。该功能针对 ChatGPT 上常见的健康查询用例(每周超过 2.3 亿用户),同时严格隔离数据,并拒绝将健康对话用于模型训练。