基于RAG的跨模型多数投票工作流评估ChatGPT在生物医学关联生成与验证中的协议

arXiv cs.CL 论文

摘要

这篇arXiv论文提出了一种协议,用于评估ChatGPT在生成和验证生物医学关联方面的能力,采用基于RAG的跨模型多数投票工作流,以解决幻觉问题和本体论局限性。

arXiv:2605.30400v1 公告类型:新 摘要:我们提出了一种协议,用于评估ChatGPT生成以疾病为中心的生物医学关联的能力。该协议概述了我们如何生成这些关联、使用生物医学本体验证生物实体,以及利用文献验证关联。协议包含一个自一致性策略,用于评估跨ChatGPT模型的生成可靠性。为解决本体精确匹配的局限性,我们提供了一个用例,通过检索增强生成(RAG)驱动的开源大型语言模型(LLMs)工作流执行语义验证。这使得LLMs能够对其他LLMs生成的内容建立真实性判定并暴露幻觉现象。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:22

# 使用RAG支持的跨模型多数投票工作流评估ChatGPT在生物医学关联生成与验证中的协议
来源:https://arxiv.org/abs/2605.30400
查看PDF (https://arxiv.org/pdf/2605.30400)

> 摘要:我们提出一个协议,用于评估ChatGPT在以疾病为中心的生物医学关联生成中的能力。该协议概述了如何生成关联、使用生物医学本体验证生物实体,以及通过文献验证关联。该协议包含一个自一致性策略,用于评估跨ChatGPT模型的生成可靠性。为解决本体精确匹配的局限性,我们提供了一个用例,通过由开源大语言模型(LLMs)驱动的检索增强生成(RAG)工作流执行语义验证。这使得LLMs能够为其他LLMs生成的内容建立真实性,并暴露幻觉。

## 提交历史

来自:Ahmed Abdeen Hamed博士 [查看电子邮件 (https://arxiv.org/show-email/c942b358/2605.30400)] **\[v1\]** 2026年5月28日星期四 16:01:24 UTC (2,289 KB)

相似文章

一个AI聚合器?

Reddit r/AI_Agents

一位用户分享了使用ChatGPT进行复杂医疗护理的经验,并提出聚合多个AI模型的想法,通过寻求不同LLM之间的共识来提高可靠性。

用ChatGPT解答健康疑问

OpenAI Blog

OpenAI发布了关于如何使用ChatGPT处理健康相关问题的指南,阐述了用户如何在理解模型在医疗场景中的局限性的同时充分利用该模型。

提升ChatGPT的健康智能

OpenAI Blog

OpenAI宣布通过使用GPT-5.5 Instant,在ChatGPT中显著提升了健康相关回答的质量,其准确性与前沿模型相当,并通过医生主导的评估将事实性问题减少了71%。

C.H.A.T.G.P.T

Reddit r/singularity

关于ChatGPT的文章,这是一款著名的AI语言模型。

介绍 ChatGPT Health

OpenAI Blog

OpenAI 推出 ChatGPT Health,这是一项专为增强隐私和安全而设计的专属体验,用户可安全连接医疗记录和健康应用,获取更个性化的健康指导。该功能针对 ChatGPT 上常见的健康查询用例(每周超过 2.3 亿用户),同时严格隔离数据,并拒绝将健康对话用于模型训练。