medical-reasoning

标签

Cards List
#medical-reasoning

大型语言模型在医学推理中表现出元认知敏感性

arXiv cs.AI · 2026-08-18 缓存

一项对照研究评估了大型语言模型在医学推理中的元认知敏感性,发现部分但存在缺陷的置信度校准,其随证据强度和冲突情境而变化。

0 人收藏 0 人点赞
#medical-reasoning

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

arXiv cs.AI · 2026-08-11 缓存

Introduces CliniCARE-Bench, a deployment-oriented benchmark for evaluating AI agents on clinical audit tasks over longitudinal EHR data, with 25 clinician-validated scenarios and 750 patient cases. It assesses verdict accuracy, evidence grounding, policy adherence, and calibrated abstention, finding that raw accuracy overstates investigation quality.

0 人收藏 0 人点赞
#medical-reasoning

真实世界临床护理中的推理:为什么大语言模型尚不能安全用于自主临床决策支持

arXiv cs.AI · 2026-08-03 缓存

这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。

0 人收藏 0 人点赞
#medical-reasoning

对齐临床需求与AI能力:关于LLMs在医学推理中的综述

arXiv cs.AI · 2026-07-10 缓存

本综述考察了医学LLMs的最新进展,提出了一种连接临床实践与计算方法双重视角的方法,并引入了一个基准数据集,用于评估18个最先进模型的医学推理能力。

0 人收藏 0 人点赞
#medical-reasoning

Reasoning-Medical0.1-27B(Qwen3.5-27B 医疗微调版本,声称超越 MedGemma)

Reddit r/LocalLLaMA · 2026-07-09 缓存

EpistemeAI 发布了 Reasoning-Medical0.1-27B,这是 Qwen3.5-27B 的医疗推理微调版本,声称通过在精心策划的 10 万条记录数据集上引入链式思维推理,在多项医疗基准测试中超越了 MedGemma。

0 人收藏 0 人点赞
#medical-reasoning

ArogyaSutra:面向印度语言中多模态医学推理的多智能体框架

Hugging Face Daily Papers · 2026-06-11 缓存

ArogyaBodha数据集和ArogyaSutra框架通过多样化数据集成和actor-critic多智能体推理,增强了低资源环境下的多语言医学推理能力。

0 人收藏 0 人点赞
#medical-reasoning

SEMA-RAG:一种用于医学推理的自进化多智能体检索增强生成框架

arXiv cs.CL · 2026-05-19 缓存

SEMA-RAG是一种自进化多智能体RAG框架,用于医学问答,它将解读、探索和裁决解耦为三个专业智能体,在多个基准测试中相较于基线取得了显著的准确率提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈