medical-ai

标签

Cards List
#medical-ai

EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses

arXiv cs.AI · 2026-08-03 缓存

EarlyDx is a new large-scale benchmark for evaluating LLMs on open-ended, evidence-supported diagnosis generation at emergency department admission, built from 154,834 MIMIC-IV encounters. It reveals that even frontier and medical-specialized models struggle to synthesize admission-time evidence, with post-training only partially improving inference-dependent recall.

0 人收藏 0 人点赞
#medical-ai

MyoCardBench:面向临床真实心血管护理场景的大型语言模型评估的真实世界数据基准

arXiv cs.CL · 2026-07-29 缓存

MyoCardBench是一个用于评估心血管护理领域大型语言模型的真实世界基准,包含13个任务共2,263个条目。GPT-5.4获得了最高总分,展现了在全周期护理和多模态解读方面的优势。

0 人收藏 0 人点赞
#medical-ai

基于协作元知识增强的痴呆症病因诊断

arXiv cs.LG · 2026-07-28 缓存

提出了一种用于痴呆症病因诊断的协作元知识增强(COME)框架,该框架将异质性感知嵌入注入到统一的Transformer架构中,在多个独立队列上实现了最先进的性能。

0 人收藏 0 人点赞
#medical-ai

人在回路的大语言模型框架用于皮肤免疫相关不良事件识别

arXiv cs.CL · 2026-07-24 缓存

本文提出了一种检索增强的多智能体LLM框架,结合人在回路机制,用于从临床记录中检测皮肤免疫相关不良事件。与人工审查相比,该框架实现了更高的准确率(F1=0.88 vs 0.77)、更优的评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间缩短约一半。

0 人收藏 0 人点赞
#medical-ai

贝叶斯不确定性估计提升医疗AI代理的临床决策能力

arXiv cs.LG · 2026-07-24 缓存

本文表明,蒙特卡洛丢弃法能够为胸部X光片分类器提供认知不确定性信号,当以二元错误风险标志的方式传达时,可改善临床决策支持代理的错误检测,并减少自信误诊。

0 人收藏 0 人点赞
#medical-ai

OpenAI 向所有用户推出 ChatGPT Health,并做出重大宣称

The Verge · 2026-07-23 缓存

OpenAI 正在向所有美国用户推出 ChatGPT Health,允许他们连接医疗记录和健康追踪数据,并声称具备临床医生级别的推理能力,且与 GPT-5.6 Sol 集成。

0 人收藏 0 人点赞
#medical-ai

在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性

arXiv cs.AI · 2026-07-22 缓存

本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。

0 人收藏 0 人点赞
#medical-ai

医患对话的鲁棒摘要:TalTech系统在Beyond Transcription挑战赛中的方案

arXiv cs.CL · 2026-07-21 缓存

本文描述了TalTech系统,该系统直接利用医患对话音频生成SOAP笔记,采用通过监督学习和DAPO强化学习微调的Voxtral模型。他们的提交在BeTraC挑战赛的两个赛道均排名第一,实现了高概念准确率和低幻觉率。

0 人收藏 0 人点赞
#medical-ai

Tri-Net v2:我们关于统一的皮肤病变和基于症状的猴痘检测的Scientific Reports论文的开源实现 [R]

Reddit r/MachineLearning · 2026-07-21

Tri-Net v2 是Scientific Reports论文中关于统一的皮肤病变和基于症状的猴痘检测的开源实现。

0 人收藏 0 人点赞
#medical-ai

@MaziyarPanahi:我终于让 Kimi K3 读取了一张胸片,它从未看到患者是谁——OpenMed 剥离了 23 个标识符从……

X AI KOLs Timeline · 2026-07-20 缓存

Kimi K3 人工智能模型在 OpenMed 从 DICOM 数据中移除所有 23 个患者标识符后成功读取了一张胸片,从而确保了隐私。该模型正确识别出左侧白肺(left-sided whiteout)。

0 人收藏 0 人点赞
#medical-ai

@MaziyarPanahi:我在Mac Studio上体验了Thinking Machines的新Inkling,一个2分钟的问诊。患者因膝盖问题前来……

X AI KOLs Timeline · 2026-07-16 缓存

Thinking Machines的Inkling是一个975B参数模型,通过llama.cpp在Mac Studio上本地运行。它听取了一段问诊音频,从闲聊中的细微线索准确诊断出心力衰竭,展示了无需离开本机的先进医学推理能力。

0 人收藏 0 人点赞
#medical-ai

@MaziyarPanahi:我终于让GLM-5.2成功处理了一份整整三年的病历,这份病历之前只有Bonsai 27B有权读取其中的292条就诊记录…

X AI KOLs Timeline · 2026-07-15 缓存

@MaziyarPanahi在Mac Studio上使用llama.cpp本地运行GLM-5.2和Bonsai 27B处理一份三年的病历,发现了一个曾被标记但被忽略的危险药物相互作用。两个模型在Apache-2.0许可下完全在设备上运行,Bonsai在约2秒内回答查询,@PrismML声称一个1-bit构建可以装进iPhone。

0 人收藏 0 人点赞
#medical-ai

用于乳腺癌治疗推荐的自主系统

arXiv cs.CL · 2026-07-15 缓存

评估了利用72个临床案例生成乳腺癌治疗推荐的自主LLM系统,发现最佳系统(采用D&C+SA流程的Claude Opus 4.8)的全局得分为0.594,但由于持续存在的错误,尚不足以用于无监督临床使用。

0 人收藏 0 人点赞
#medical-ai

大语言模型在代理式临床推理中的信息寻求失败

arXiv cs.AI · 2026-07-14 缓存

本文为血液肿瘤学中的临床推理开发了一个代理式评估框架,发现大语言模型的主要失败原因在于系统性的信息寻求缺陷,而非知识不足,其错误模式类似于新手临床医生的认知偏差。

0 人收藏 0 人点赞
#medical-ai

从ML预测到基于Toulmin论证模型的知情诊断辅助

arXiv cs.AI · 2026-07-14 缓存

本文提出一个框架,利用Toulmin论证模型对基于OCT图像的ML视网膜诊断进行结构化,整合生物标志物提取、医学大语言模型推理(MedGemma)和相似度度量(MedSigLip),以实现可解释且基于证据的诊断辅助。

0 人收藏 0 人点赞
#medical-ai

@seclink: 我记得之前验证过,蚂蚁百灵好像每天会送一定量的token(好像是100万?),并且特别擅长医疗行业。 有兴趣的朋友可以试一试,大厂出品,靠谱的。 https://developer.ant-ling.com/zh-CN/docs/gett…

X AI KOLs Following · 2026-07-11 缓存

推荐蚂蚁百灵大模型API,每天赠送100万token,特别擅长医疗行业,支持OpenAI SDK兼容接入,提供快速开始文档。

0 人收藏 0 人点赞
#medical-ai

迈向肝细胞癌精准治疗:用于风险分层和治疗指导的临床推理大语言模型

arXiv cs.AI · 2026-07-10 缓存

本文介绍HCC-STAR,一个临床对齐的大语言模型,用于肝细胞癌的风险分层和治疗指导,旨在通过利用电子病历改进精准治疗。

0 人收藏 0 人点赞
#medical-ai

MentalHospital:评估精神病学临床接诊的虚拟环境

arXiv cs.AI · 2026-07-10 缓存

MentalHospital是一个虚拟环境,旨在评估AI智能体与人类专家在精神病学临床接诊中的表现,涵盖问诊、检查、诊断和治疗规划。实验通过客观与主观指标比较人类专家、受训人员及多种大语言模型。

0 人收藏 0 人点赞
#medical-ai

Reasoning-Medical0.1-27B(Qwen3.5-27B 医疗微调版本,声称超越 MedGemma)

Reddit r/LocalLLaMA · 2026-07-09 缓存

EpistemeAI 发布了 Reasoning-Medical0.1-27B,这是 Qwen3.5-27B 的医疗推理微调版本,声称通过在精心策划的 10 万条记录数据集上引入链式思维推理,在多项医疗基准测试中超越了 MedGemma。

0 人收藏 0 人点赞
#medical-ai

心电图基础模型能否迁移至罕见心脏病?来自Brugada综合征检测的证据

arXiv cs.LG · 2026-07-07 缓存

本研究评估了九种心电图基础模型在Brugada综合征检测中的表现,发现预训练提供了优化稳定性,但未提供可迁移的临床知识,这对大规模预训练对罕见疾病有益这一假设提出了挑战。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈