标签
本文介绍了一种用于分级膝关节骨关节炎严重程度的自动化诊断系统,该系统使用通过 TensorFlow Lite 部署在边缘设备上的优化 ResNet-18 模型。它集成了使用 Gemini 2.0 Flash 的大型语言模型(LLM)接口,在提供结构化解释性发现的同时,保持了在资源受限环境下的离线能力。
本文研究了大语言模型隐藏状态中线性可解码的失效信号是否可以通过残差流转向进行纠正。研究发现,虽然“过度思考”失效模式是可解码的,但由于其与任务关键计算的表示纠缠,固定的线性转向未能纠正这些失效,尽管探测探针有效地支持了选择性拒绝回答。
本文引入了 CXR-MAX,这是一个大规模基准,旨在利用来自多个多模态大语言模型(MLLM)的 X 射线数据,评估非平稳环境下的推理对齐性能。
介绍 CGM-JEPA,这是一种针对连续血糖监测数据的自监督预训练框架,通过掩码潜在预测和分布目标提升了跨模态及跨队列的性能。
研究者提出一种代理建模框架,可量化并解释黑盒大模型内部编码的医学知识,同时揭示有效关联与持续的种族偏见。
本文介绍了MedSkillAudit,这是一个领域专用审计框架,用于在部署前评估医学研究智能体技能的安全性和质量。研究表明,该系统在评估一致性方面达到可靠水平,优于或相当于人类专家审查。
EmpirischTech 发布 Chaperone-Thinking-LQ-1.0:用 4-bit GPTQ + QLoRA 微调的 DeepSeek-R1-32B,MedQA 得分 84%,体积仅 20GB,可本地部署于医疗场景。
一位用户通过要求 Hugging Face 的 ml-intern 工具在医学数据集上微调 SAM,并生成 Jupyter Notebook 教程和博客文章,对其进行了评估。
# 互惠协同训练(RCT):通过强化学习耦合基于梯度与不可微模型 来源:[https://arxiv.org/html/2604.16378](https://arxiv.org/html/2604.16378) Yunshuo Tian¹, Akayou Kitessa¹, Tanuja Chitnis², 和 Yijun Zhao¹ 1 纽约市福特汉姆大学计算机与信息科学系 2 马萨诸塞州波士顿市Mass General Brigham医院神经科 ###### 摘要 大型语言模型 \(LLMs\) 与经典机器学习方法提供互补...
MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。
MedFocusLeak 首次提出针对医学视觉语言模型的可迁移黑盒对抗攻击,通过不可察觉的背景扰动在六种成像模态上误导临床诊断。
宾夕法尼亚大学的研究人员正利用 DINO 和 SAM 等 AI 模型,对急救响应中的医疗分诊进行自动化和现代化改造。
Hulu-Med 是一个透明的医学视觉语言模型,统一了对文本、2D/3D图像和视频的理解,在30个基准测试中取得了最先进的性能,并且完全开源。
OpenAI 推出了 HealthBench,这是一个用于评估医疗保健环境中人工智能系统的新基准。该基准由来自 60 个国家的 262 名医生共同创建,包含 5,000 个逼真的健康对话和医生编写的评分标准,用于评估模型在有意义、可信和可改进的指标上的性能。
Color Health 开发了一款利用 GPT-4o 推理能力的 AI 医学助手,帮助肿瘤学家识别缺失的诊断信息并优化癌症护理工作流程。该工具使医生能够在约 5 分钟内发现 4 倍多的缺失检验和成像结果,相比之前需要数周,目前正在旧金山加州大学进行初步验证。
Lifespan 医疗系统使用 GPT-4 将手术知情同意书从三页简化为一页,阅读难度降至六年级水平,提高了患者理解度和医生采用率。该项目于 2023 年 9 月部署,获得了患者和临床医生的积极反馈。