社会思维链:一种基于医学鉴别诊断方法论的多智能体架构
摘要
这篇arXiv论文介绍了社会思维链(SCoT),一种用于医学鉴别诊断的多智能体架构,它将多轮专家对话组织成结构化流程。评估显示,它优于单智能体和整体式推理,尤其是在最困难的诊断案例上。
arXiv:2608.11420v1 公告类型:新
摘要:医学诊断推理是LLM的一个高影响用例,对用户的健康和福祉具有重大影响。当OpenAI(2026)报告称全球超过5%的ChatGPT消息与医疗相关时,这些系统的透明度就成为一个严肃的设计问题。这在复杂病例中尤其如此,因为鉴别诊断往往需要整合多种形式的专家推理。已有工作提出了医学诊断的多智能体方法,但仍不清楚何时需要此类系统、它们为何有帮助,以及它们在哪些方面优于整体式推理。我们引入了社会思维链(SCoT),这是一种用于医学鉴别诊断的多轮流水线,它将多智能体交互构建为协作式LLM推理的审议框架。通过将SCoT与单智能体基线、单智能体流水线消融以及best-of-n缩放进行评估,我们表明其召回率优势无法仅由整体式推理复现。SCoT在最困难的诊断案例中表现最佳,此时多轮专家对话有助于恢复真实诊断,并收敛到召回率更高的鉴别诊断。
查看缓存全文
缓存时间: 2026/08/13 15:26
# 社交思维链:基于医学鉴别诊断方法论的多智能体架构 来源:https://arxiv.org/abs/2608.11420 查看 PDF(https://arxiv.org/pdf/2608.11420) > 摘要:医学诊断推理是LLM的一个高影响用例,对用户的健康与福祉具有重大意义。当OpenAI(2026年)报告称全球超过5%的ChatGPT消息与医疗保健相关时,这些系统的透明度便成为一个严肃的设计问题。对于复杂病例尤其如此,因为鉴别诊断往往需要整合多种形式的专家推理。已有工作提出了面向医学诊断的多智能体方法,但目前尚不清楚这些系统何时被需要、为何有助益,以及在哪些方面优于单体内推理。我们提出了社交思维链(SCoT),一个用于医学鉴别诊断的多轮流水线,将多智能体交互组织为一种审议式框架,以实现协作式LLM推理。通过与单智能体基线、单智能体流水线消融以及best-of-n扩展的对比评估,我们表明SCoT的召回率优势无法仅通过单体内推理复现。SCoT在最困难的诊断病例中表现最为出色,多轮专家对话有助于恢复金标准诊断,并收敛到更高召回率的鉴别列表。 ## 提交历史 来自:Del Coburn [查看电子邮件(https://arxiv.org/show-email/49d391b9/2608.11420)] **[v1]** 2026年8月11日星期二 20:38:03 UTC(492 KB)
相似文章
COTCAgent:基于概率链式思维完成的预防性咨询
COTCAgent是一个用于纵向电子健康记录的分层推理框架,采用概率链式思维完成方法,在自建数据集上达到90.47%的Top-1准确率,超越了现有的医疗代理。
基础模型中的集体智能
本文提出了一种多智能体推理框架,其中多个基础模型通过结构化批评和聚合进行协作,表明模型异构性显著提高了逐步推理的准确性并减少了跨领域的方差。
MODF-SIR:面向社会智能推理的多智能体全能模态蒸馏框架
本文提出MODF-SIR,一个基于轻量级多模态大语言模型的多智能体协作框架,用于社会智能推理。它采用知识蒸馏、长尾事件提取和测试时自适应,以更少的训练数据实现了最先进的结果。
ArogyaSutra:面向印度语言中多模态医学推理的多智能体框架
ArogyaBodha数据集和ArogyaSutra框架通过多样化数据集成和actor-critic多智能体推理,增强了低资源环境下的多语言医学推理能力。
多轮多模态诊断推理在具有挑战性的真实临床案例上的评估
本文提出了一种利用具有挑战性的真实临床案例对多轮多模态诊断推理进行评估的方法,旨在衡量AI模型处理复杂医疗场景的能力。