clinical-ai

标签

Cards List
#clinical-ai

Auditable agentic AI for evidence-grounded thyroid ultrasound diagnosis and reporting

arXiv cs.AI ↗ · 2026-08-14 缓存

This paper presents ThyroidXAgent, a clinician-interactive agentic AI system that coordinates specialized diagnostic tools for thyroid ultrasound, storing outputs as auditable evidence records. Developed on a large multicentre dataset, it achieves strong results in nodule segmentation, benign-malignant classification, and report generation.

0 人收藏 0 人点赞
#clinical-ai

RadFusion:面向阈值可控的放射学报告生成

arXiv cs.AI ↗ · 2026-08-12 缓存

RadFusion 是一个通过将多标签分类器与基于 VQA 的生成器以及 LLM 重写步骤相融合,为放射学报告生成增加阈值可控性的框架,支持灵敏度-特异性的权衡以及基于 ROC 的验证。在 MIMIC-CXR 上的实验表明,其诊断准确性得到提升,报告行为也更适应临床需求。

0 人收藏 0 人点赞
#clinical-ai

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

arXiv cs.AI ↗ · 2026-08-11 缓存

Introduces CliniCARE-Bench, a deployment-oriented benchmark for evaluating AI agents on clinical audit tasks over longitudinal EHR data, with 25 clinician-validated scenarios and 750 patient cases. It assesses verdict accuracy, evidence grounding, policy adherence, and calibrated abstention, finding that raw accuracy overstates investigation quality.

0 人收藏 0 人点赞
#clinical-ai

显性还是隐性?多模态临床AI中逐模态失败分析的可复用框架

Hugging Face Daily Papers ↗ · 2026-08-02 缓存

本文提出了一个与模型无关的框架,用于多模态临床AI中的逐模态失败分析,以区分在丢弃某个模态时出现的显性失败与隐性失败。该框架在植入的ground truth上进行了验证,并应用于EchoJEPA和HuBERT-ECG嵌入进行LVEF预测,结果表明丢弃echo后误差几乎翻倍。

0 人收藏 0 人点赞
#clinical-ai

解码儿童步态行为

Hugging Face Daily Papers ↗ · 2026-08-01 缓存

介绍了一个新的问题领域,用于从标准RGB视频中对儿童步态行为进行细粒度分析,同时提供了一个包含超过1,100个高帧率序列的新数据集和一个统一框架,证明了当前的SOTA方法和多模态大语言模型(MLLMs)在此临床任务上表现不佳。

0 人收藏 0 人点赞
#clinical-ai

MyoCardBench:面向临床真实心血管护理场景的大型语言模型评估的真实世界数据基准

arXiv cs.CL ↗ · 2026-07-29 缓存

MyoCardBench是一个用于评估心血管护理领域大型语言模型的真实世界基准,包含13个任务共2,263个条目。GPT-5.4获得了最高总分,展现了在全周期护理和多模态解读方面的优势。

0 人收藏 0 人点赞
#clinical-ai

ClinFusion:面向全面医疗理解的以视觉为中心的多模态大语言模型系统

Hugging Face Daily Papers ↗ · 2026-07-27 缓存

ClinFusion 是一个以视觉为中心的多模态大语言模型,用于全面医疗理解,它使用级联视觉编码器统一了 2D 和 3D 医学图像分析。它在 24 个基准测试中的 20 个上达到了最先进的结果,并在 16 个基准测试中的 13 个上超越了 GPT-5.2 和 Gemini-3-Flash 等专有模型。

0 人收藏 0 人点赞
#clinical-ai

在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性

arXiv cs.AI ↗ · 2026-07-22 缓存

本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。

0 人收藏 0 人点赞
#clinical-ai

LLM4EHR:通过大型语言模型对齐临床时间序列与医疗事件序列

arXiv cs.LG ↗ · 2026-07-20 缓存

LLM4EHR 提出了一种临床基础模型,该模型通过领域自适应的大语言模型和正则化对比目标,在时间上对齐电子健康记录(EHR)时间序列与医疗事件序列,从而提升下游预测任务的性能。

0 人收藏 0 人点赞
#clinical-ai

GraphDx:一种成本感知、知识增强的序贯诊断多智能体框架

arXiv cs.AI ↗ · 2026-07-20 缓存

GraphDx是一种成本感知、知识增强的序贯诊断多智能体框架,利用LLM构建的医学知识图谱和三个协作智能体,提高诊断成功率并降低测试成本。

0 人收藏 0 人点赞
#clinical-ai

诊断之前先询问:Safe-Psych,面向精神科领域大语言模型的序贯评估基准

arXiv cs.AI ↗ · 2026-07-16 缓存

介绍了Safe-Psych,一个用于评估大语言模型如何在精神科处理诊断不确定性的序贯基准,结果显示即使是强大的模型在临床证据不完整时也常常无法放弃诊断或寻求澄清。

0 人收藏 0 人点赞
#clinical-ai

SAGEAgent: 用于多模态生存预测中成本感知模态获取的自进化智能体

arXiv cs.AI ↗ · 2026-07-13 缓存

SAGEAgent 是一种基于LLM的临床智能体,它依次决定为癌症患者获取哪些诊断模态,以平衡预测准确性与临床侵入性,在将获取负担降低55%的同时,保持具有竞争力的生存预测性能。

0 人收藏 0 人点赞
#clinical-ai

对齐临床需求与AI能力:关于LLMs在医学推理中的综述

arXiv cs.AI ↗ · 2026-07-10 缓存

本综述考察了医学LLMs的最新进展,提出了一种连接临床实践与计算方法双重视角的方法,并引入了一个基准数据集,用于评估18个最先进模型的医学推理能力。

0 人收藏 0 人点赞
#clinical-ai

在细节中查找幽门螺杆菌:基于证据的多智能体病例发现——来自胃活检报告

arXiv cs.AI ↗ · 2026-07-08 缓存

本文介绍了Nimblemind多智能体系统(nMAS),用于从胃活检报告中提取幽门螺杆菌感染证据,在216个特征病例决策中达到98.61%的准确率,并显示出相比人工审查显著节省时间。

0 人收藏 0 人点赞
#clinical-ai

强化学习用于大型语言模型的寻求证据诊断推理

arXiv cs.AI ↗ · 2026-07-07 缓存

本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。

0 人收藏 0 人点赞
#clinical-ai

面向临床智能体的世界反馈:在FHIR环境中诊断强化学习

arXiv cs.AI ↗ · 2026-07-03 缓存

本文研究了在FHIR环境中为临床协议执行任务使用来自世界反馈的强化学习,识别了诸如高静默完成上限和零梯度任务等结构性障碍,并引入了具有更低上限的MedAgentBench-v3。它表明,由于这些障碍,纯强化学习表现不如基于规则的SFT,并提出了一种结合SFT+RL的方法。

0 人收藏 0 人点赞
#clinical-ai

在代表性不足的癫痫护理中教导LLMs进行推荐与转诊

arXiv cs.LG ↗ · 2026-07-01 缓存

本文介绍了Manana,一种非参数提示学习框架,它教导LLMs在代表性不足的癫痫护理环境中推荐抗癫痫药物并转诊不确定的病例,在乌干达队列上提高了准确性,并实现了高精度的选择性预测。

0 人收藏 0 人点赞
#clinical-ai

临床AI工具在真实临床即时查询中的专家评估

arXiv cs.AI ↗ · 2026-06-30 缓存

本文报告了一项针对临床AI工具的盲评,采用医生在临床即时提出的真实查询,比较了专用模型与通用模型在五个维度上的表现。专用工具(OpenEvidence)在所有维度上均优于通用模型,作者同时发布了Real-POCQi基准测试集。

0 人收藏 0 人点赞
#clinical-ai

面向可控医疗AI技能生态系统的临床管控框架

arXiv cs.AI ↗ · 2026-06-26 缓存

本文提出了临床管控框架,一种用于注册、编排、保护和监控AI赋能临床能力的运行时治理架构,并以骨质疏松症为例进行演示。

0 人收藏 0 人点赞
#clinical-ai

LLMs 是否已准备好协助医生?PhysAssistBench:用于交互式医生-患者-EHR 辅助的基准

arXiv cs.CL ↗ · 2026-06-18 缓存

介绍了 PhysAssistBench,这是一个用于评估 LLM 在交互式医生-患者-EHR 辅助中性能的基准。实验表明,当前模型在此场景下不可靠,凸显了协调能力的需求。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈