medical-ai

标签

Cards List
#medical-ai

Guideline-as-Oracle:眼科电话分诊代理的零标注训练

arXiv cs.CL · 3天前 缓存

本文介绍了Guideline-as-Oracle(GAO),一种通过将美国眼科学会指南编译成70行规则表并用于生成3000个训练对话,从而对多轮眼科电话分诊代理进行零标注训练的方法。在此语料上微调一个9B模型,可将与操作参考的一致性从61.7%提升至74.1%,紧急病例召回率从9.5%提升至69.0%,且在推理时无需前沿模型即可超越多个通用系统。

0 人收藏 0 人点赞
#medical-ai

RESPClinBench:呼吸专科护理中多模态临床决策与纵向疾病管理的基准测试

arXiv cs.CL · 3天前 缓存

介绍了RESPClinBench,一个用于呼吸科临床决策的真实世界场景基准,评估了七个LLM在COPD和肺结节病例上的表现。发现了任务特定的局限性,包括影像幻觉和用药安全风险。

0 人收藏 0 人点赞
#medical-ai

肺科医生阐述AI为何以及如何即将接管他的工作

Reddit r/singularity · 3天前

一位肺科医生讨论了AI如何准备接管他医疗工作的各个方面,强调了AI在医疗诊断和临床实践中日益增长的影响。

0 人收藏 0 人点赞
#medical-ai

@AdinaYakup: ClinFusion 来自阿里巴巴达摩院的新开源医学多模态 LLM - 8B/32B(Apache2.0)- 统一 2D + 3D 图像理解…

X AI KOLs Following · 4天前 缓存

ClinFusion 是阿里巴巴达摩院推出的新开源医学多模态 LLM,提供 8B 和 32B 两种参数规模(Apache 2.0),具备统一的 2D + 3D 图像理解能力,并在医学基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#medical-ai

PatTree:一种用于医学分类任务的自动化构建多模态、基于图的患者表示的新方法

arXiv cs.LG · 4天前 缓存

本文介绍了PatTree,一种基于图的多模态患者表示方法,能够自动对异构临床数据进行结构化处理,以用于医学分类任务。在ADNI-1队列上,它达到了最先进的性能,阿尔茨海默病分类的平衡准确率为98.5%。

0 人收藏 0 人点赞
#medical-ai

OncoTriad-QA:面向泛癌推理的患者级放射学-病理学-基因组学基准

arXiv cs.CL · 4天前 缓存

介绍了OncoTriad-QA,一个整合放射学、病理学、基因组学和临床数据的患者级基准,用于泛癌推理;同时介绍了OncoVLM,一个参考多模态模型,在微调后性能优于现有的医学大语言模型。

0 人收藏 0 人点赞
#medical-ai

TumorBoard:基于证据的多智能体决策支持系统,用于纵向神经肿瘤学

arXiv cs.AI · 4天前 缓存

TumorBoard 是一个用于纵向神经肿瘤学的多智能体决策支持系统,它利用共享的纵向病例状态和可审计的声明-证据账本。在包含360个病例的基准测试中,它优于基线模型,并且安全治理机制减少了有害推荐。

0 人收藏 0 人点赞
#medical-ai

评估药物安全推理中对患者信息的反事实敏感性

arXiv cs.AI · 4天前 缓存

介绍了MedPIC-Bench,一个包含反事实问题的基准测试,用于评估大型语言模型在患者特定条件变化时是否正确应用药物安全规则;在28个LLM中,反事实问题的准确率显著下降,揭示了模型普遍无法修正判断的缺陷。

0 人收藏 0 人点赞
#medical-ai

医疗AI辅助的益处因用户专业水平而异

MIT News — Artificial Intelligence · 5天前 缓存

《自然医学》上一项由MIT主导的新研究发现,AI辅助和可解释性方法对皮肤病诊断准确率的影响因用户专业水平而异:非专家过度信任AI解释,而临床医生仅在模型预测(无解释)时表现最佳。结果凸显了考虑自动化偏见的以用户为中心的AI设计之必要性。

0 人收藏 0 人点赞
#medical-ai

TreeProbe:针对大语言模型中文化偏见的藏医学基准

arXiv cs.CL · 5天前 缓存

TreeProbe 是首个针对大语言模型中藏医学文化偏见的基准,包含 4,719 个专家裁决条目,覆盖 467 种疾病和 10 个子任务,揭示了当前模型中系统性的外部本体漂移。

0 人收藏 0 人点赞
#medical-ai

EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses

arXiv cs.AI · 6天前 缓存

EarlyDx is a new large-scale benchmark for evaluating LLMs on open-ended, evidence-supported diagnosis generation at emergency department admission, built from 154,834 MIMIC-IV encounters. It reveals that even frontier and medical-specialized models struggle to synthesize admission-time evidence, with post-training only partially improving inference-dependent recall.

0 人收藏 0 人点赞
#medical-ai

MyoCardBench:面向临床真实心血管护理场景的大型语言模型评估的真实世界数据基准

arXiv cs.CL · 2026-07-29 缓存

MyoCardBench是一个用于评估心血管护理领域大型语言模型的真实世界基准,包含13个任务共2,263个条目。GPT-5.4获得了最高总分,展现了在全周期护理和多模态解读方面的优势。

0 人收藏 0 人点赞
#medical-ai

基于协作元知识增强的痴呆症病因诊断

arXiv cs.LG · 2026-07-28 缓存

提出了一种用于痴呆症病因诊断的协作元知识增强(COME)框架,该框架将异质性感知嵌入注入到统一的Transformer架构中,在多个独立队列上实现了最先进的性能。

0 人收藏 0 人点赞
#medical-ai

人在回路的大语言模型框架用于皮肤免疫相关不良事件识别

arXiv cs.CL · 2026-07-24 缓存

本文提出了一种检索增强的多智能体LLM框架,结合人在回路机制,用于从临床记录中检测皮肤免疫相关不良事件。与人工审查相比,该框架实现了更高的准确率(F1=0.88 vs 0.77)、更优的评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间缩短约一半。

0 人收藏 0 人点赞
#medical-ai

贝叶斯不确定性估计提升医疗AI代理的临床决策能力

arXiv cs.LG · 2026-07-24 缓存

本文表明,蒙特卡洛丢弃法能够为胸部X光片分类器提供认知不确定性信号,当以二元错误风险标志的方式传达时,可改善临床决策支持代理的错误检测,并减少自信误诊。

0 人收藏 0 人点赞
#medical-ai

OpenAI 向所有用户推出 ChatGPT Health,并做出重大宣称

The Verge · 2026-07-23 缓存

OpenAI 正在向所有美国用户推出 ChatGPT Health,允许他们连接医疗记录和健康追踪数据,并声称具备临床医生级别的推理能力,且与 GPT-5.6 Sol 集成。

0 人收藏 0 人点赞
#medical-ai

在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性

arXiv cs.AI · 2026-07-22 缓存

本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。

0 人收藏 0 人点赞
#medical-ai

医患对话的鲁棒摘要:TalTech系统在Beyond Transcription挑战赛中的方案

arXiv cs.CL · 2026-07-21 缓存

本文描述了TalTech系统,该系统直接利用医患对话音频生成SOAP笔记,采用通过监督学习和DAPO强化学习微调的Voxtral模型。他们的提交在BeTraC挑战赛的两个赛道均排名第一,实现了高概念准确率和低幻觉率。

0 人收藏 0 人点赞
#medical-ai

Tri-Net v2:我们关于统一的皮肤病变和基于症状的猴痘检测的Scientific Reports论文的开源实现 [R]

Reddit r/MachineLearning · 2026-07-21

Tri-Net v2 是Scientific Reports论文中关于统一的皮肤病变和基于症状的猴痘检测的开源实现。

0 人收藏 0 人点赞
#medical-ai

@MaziyarPanahi:我终于让 Kimi K3 读取了一张胸片,它从未看到患者是谁——OpenMed 剥离了 23 个标识符从……

X AI KOLs Timeline · 2026-07-20 缓存

Kimi K3 人工智能模型在 OpenMed 从 DICOM 数据中移除所有 23 个患者标识符后成功读取了一张胸片,从而确保了隐私。该模型正确识别出左侧白肺(left-sided whiteout)。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈