clinical-reasoning

标签

Cards List
#clinical-reasoning

考察多智能体医疗系统在临床推理中对人为干预的脆弱性

arXiv cs.AI · 昨天 缓存

本文探讨了人为干预在多智能体医疗系统中的故障点如何影响诊断准确性,正确干预可提高准确性,错误干预则会导致性能下降。

0 人收藏 0 人点赞
#clinical-reasoning

从GenAI虚拟患者对话日志到教师可解释的过程证据:高等教育中的一项学习分析研究

arXiv cs.CL · 3天前 缓存

本研究探讨了如何通过编码的GenAI虚拟患者对话,为医学教育中的临床推理提供教师可解释的过程证据,利用学习分析来分析医学生的对话日志。

0 人收藏 0 人点赞
#clinical-reasoning

当词汇理解在临床推理中失效:评估治疗机器人对Generation Alpha的安全风险

arXiv cs.CL · 2026-08-24 缓存

本文评估了治疗机器人对Generation Alpha的安全风险,发现大型语言模型难以正确校准临床风险,导致显著的词汇理解差距,可能造成危机遗漏。

0 人收藏 0 人点赞
#clinical-reasoning

@AdinaYakup: ClinFusion 来自阿里巴巴达摩院的新开源医学多模态 LLM - 8B/32B(Apache2.0)- 统一 2D + 3D 图像理解…

X AI KOLs Following · 2026-08-05 缓存

ClinFusion 是阿里巴巴达摩院推出的新开源医学多模态 LLM,提供 8B 和 32B 两种参数规模(Apache 2.0),具备统一的 2D + 3D 图像理解能力,并在医学基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#clinical-reasoning

GuideSkill:为基于指南的临床推理进化可执行LLM智能体技能

arXiv cs.AI · 2026-07-31 缓存

介绍GuideSkill,一种外部推理层,将临床实践指南编译为可执行的诊断技能,在无需更新骨干模型的情况下提高LLM在临床推理基准上的准确性。

0 人收藏 0 人点赞
#clinical-reasoning

DeepLens诊断代理:智能体工作流设计让小推理模型能与前沿大语言模型竞争

arXiv cs.AI · 2026-07-28 缓存

DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。

0 人收藏 0 人点赞
#clinical-reasoning

标记错误症状:评估医学文本中的LLM水印

arXiv cs.AI · 2026-07-24 缓存

本文首次严格研究了LLM水印方案如何影响医学性能,在多个LLM和VLM上评估了五种水印在临床推理任务中的效果。作者发现,水印可能导致医学文本质量下降,包括幻觉和词汇损坏,而这些在通用领域的基准测试中被掩盖。

0 人收藏 0 人点赞
#clinical-reasoning

Cura 1T:面向智能体医疗的专用模型

arXiv cs.AI · 2026-07-20 缓存

Cura 1T 是一款专注于医疗领域的LLM,通过人工门控的自我进化循环进行训练,该循环在患者咨询、临床推理和智能体医疗任务上不断改进,在医学基准测试中取得了顶尖性能,同时保持了通用推理能力。

0 人收藏 0 人点赞
#clinical-reasoning

大语言模型在代理式临床推理中的信息寻求失败

arXiv cs.AI · 2026-07-14 缓存

本文为血液肿瘤学中的临床推理开发了一个代理式评估框架,发现大语言模型的主要失败原因在于系统性的信息寻求缺陷,而非知识不足,其错误模式类似于新手临床医生的认知偏差。

0 人收藏 0 人点赞
#clinical-reasoning

评估检索增强生成与长上下文输入在电子健康记录临床推理中的比较

arXiv cs.CL · 2026-07-13 缓存

本文评估了检索增强生成(RAG)与长上下文提示在电子健康记录临床推理任务中的表现,发现RAG在令牌效率上具有竞争力,尤其在影像提取和抗生素时间线重建方面表现突出。

0 人收藏 0 人点赞
#clinical-reasoning

迈向肝细胞癌精准治疗:用于风险分层和治疗指导的临床推理大语言模型

arXiv cs.AI · 2026-07-10 缓存

本文介绍HCC-STAR,一个临床对齐的大语言模型,用于肝细胞癌的风险分层和治疗指导,旨在通过利用电子病历改进精准治疗。

0 人收藏 0 人点赞
#clinical-reasoning

面向安全的假设演绎框架用于AI辅助鉴别诊断

arXiv cs.AI · 2026-07-10 缓存

AegisDx是一个面向安全的框架,它利用专门的LLM组件和验证门进行假设演绎临床推理,在医学病例报告上,将鉴别诊断准确率比单独的LLM提高了7-17个百分点。

0 人收藏 0 人点赞
#clinical-reasoning

CLExEval:一种用于定性评估LLM临床推理的人机交互框架

arXiv cs.CL · 2026-07-01 缓存

CLExEval 引入了一种人机交互框架,用于在渐进信息遮蔽条件下评估 LLM 临床推理,揭示了 GPT-4o-mini 和 HuatuoGPT-o1 等模型中存在的失败模式,如冗长偏见、隐藏知识悖论以及推理与输出不匹配。

0 人收藏 0 人点赞
#clinical-reasoning

打破故障级联:面向医学多模态推理的步骤感知强化学习

Hugging Face Daily Papers · 2026-06-30 缓存

介绍MRPO,一种利用步骤过程奖励来减轻临床多模态推理中级联错误的强化学习算法,在医学VQA基准上优于现有方法。

0 人收藏 0 人点赞
#clinical-reasoning

经验造就技能:通过自我演进的技能记忆实现可泛化的医学智能体推理

Hugging Face Daily Papers · 2026-06-08 缓存

本文介绍了SkeMex,一个自我演进的框架,通过将交互轨迹提炼为结构化技能记忆来增强医学智能体,并利用上下文相关的效用估计与治理实现更好的长期临床推理。

0 人收藏 0 人点赞
#clinical-reasoning

ChatHealthAI: 将电子健康记录表示与大型语言模型对齐以实现基于临床的推理

arXiv cs.AI · 2026-06-03 缓存

ChatHealthAI 是一个多模态推理框架,它将结构化 EHR 表示与冻结的 LLM 对齐,从而在保持预测性能的同时实现基于临床的推理。

0 人收藏 0 人点赞
#clinical-reasoning

MedGuideX:将可执行指南中的决策逻辑内化至大型语言模型用于临床推理

arXiv cs.AI · 2026-05-27 缓存

MedGuideX 将临床实践指南转化为可执行的决策逻辑,以生成事实性和反事实性的问答数据用于训练医学大语言模型,在临床推理基准测试中实现了平均准确率相对提升 10.28%。

0 人收藏 0 人点赞
#clinical-reasoning

SEMA-RAG:一种用于医学推理的自进化多智能体检索增强生成框架

arXiv cs.CL · 2026-05-19 缓存

SEMA-RAG是一种自进化多智能体RAG框架,用于医学问答,它将解读、探索和裁决解耦为三个专业智能体,在多个基准测试中相较于基线取得了显著的准确率提升。

0 人收藏 0 人点赞
#clinical-reasoning

ClinSeekAgent:自动化多模态证据寻求以实现智能体临床推理

Hugging Face Daily Papers · 2026-05-19 缓存

ClinSeekAgent是一个自动化智能体框架,使大语言模型能够主动从原始数据源获取和综合多模态临床证据,提高纯文本和多模态任务中的决策准确性。它引入了ClinSeek-Bench基准和一个蒸馏模型ClinSeek-35B-A3B,该模型在智能体临床推理上取得了强劲性能。

0 人收藏 0 人点赞
#clinical-reasoning

Checkup2Action:用于生成面向患者的行动卡片的临床体检报告多模态数据集

arXiv cs.CL · 2026-05-13 缓存

本文介绍了Checkup2Action,这是一个用于从临床体检报告生成面向患者的行动卡片的多模态数据集和基准测试,旨在解决普通患者理解医疗报告的困难。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈