NSIDDx:低资源环境下神经符号、从业者优先鉴别诊断的设计框架
摘要
NSIDDx 是针对低资源环境的神经符号鉴别诊断设计框架,强调临床医生协作和推理透明性,旨在通过可验证输出和可审计性弥补基于LLM系统的不足。
查看缓存全文
缓存时间: 2026/09/02 05:48
# 神经符号化、以临床医生为先的低资源环境鉴别诊断设计框架
来源:https://arxiv.org/html/2609.00256
###### 摘要
基于大语言模型的诊断系统在基准测试中实现了高语义准确率,但对临床罕见病例的开放式评估揭示了表面准确率与可验证临床可靠性之间存在系统性差距。我们在两个队列中评估了LLM+罕见病RAG流程,表明该范式产生的输出往往充满自信却难以验证,且系统性地抵抗临床医生的质询。我们提出NSIDDx(神经符号整合鉴别诊断系统),这是一个设计框架,主张低资源环境中的DDx系统必须将临床医生视为主动的推理主体。我们通过神经符号流程来实现这一点,该流程包含三元症状编码、矛盾检测、审计字符串和临床医生覆写——可在消费级硬件上离线运行。我们提炼了五项面向临床医生参与的临床NLP设计原则,并呼吁进行必要的前瞻性研究以大规模验证这一主张。
## 1 引言
鉴别诊断是临床医学中认知要求最高的任务之一。全科医生必须检索相关疾病知识、权衡已出现和未出现的症状、考虑罕见疾病,并通常在十五分钟内且无专科支持的情况下得出合理的结论。在低资源环境中,这一负担落在经常没有任何决策支持工具的单一临床医生身上。他们不需要一个百分之八十时间正确、但无法判断哪百分之二十不可信的系统。他们需要一个以临床医生为先的设计,其推理过程可被跟随、增强,其不确定性被明确揭示而非掩盖。
大型语言模型在临床基准测试中展现出强大性能(Singhal 等人,2023 (https://arxiv.org/html/2609.00256#bib.bib3); Nori 等人,2023 (https://arxiv.org/html/2609.00256#bib.bib4)),然而接收基于LLM诊断输出的临床医生得到的是一个答案,而非一个可以基于临床依据进行质询、修改或拒绝的推理过程——这一局限性在基于知识图谱的流程中依然存在(Chandak 等人,2023 (https://arxiv.org/html/2609.00256#bib.bib1); Gargano 等人,2024 (https://arxiv.org/html/2609.00256#bib.bib2); Wang 等人,2025b (https://arxiv.org/html/2609.00256#bib.bib12)),其中图谱指导生成过程,但对临床医生而言仍是不可见的。Singhal 等人(2023)(https://arxiv.org/html/2609.00256#bib.bib3)自己也指出,当模型由临床医生而非自动化指标评估时,强劲的基准数字会掩盖关键缺陷——这一发现被我们在750例CUPCase病例上的开放式评估独立复现:DDx@5的75.2%语义准确率暴跌至6.6%的精确匹配率,且83.5%的罕见病扫描器输出与真实诊断之间不存在基于词元(token,疾病名称之间词重叠)的可验证关系。临床决策支持文献一致指出自动化偏见和警报疲劳是采用的主要障碍(Goddard 等人,2012 (https://arxiv.org/html/2609.00256#bib.bib13))。这不是准确性的失败;而是设计哲学的失败。
#### 我们的立场。
我们认为,对于低资源临床环境,诊断AI最关键的设计约束并非仅仅是准确性,而是分歧的可处理性:一个推理透明、可审计且可被临床医生修改的系统,在实践中可能比一个更准确但其失败不可见的系统更有用——因为它邀请协作而非锚定。
本文提出了NSIDDx,一个围绕该哲学构建的神经符号鉴别诊断流程。NSIDDx使用大型语言模型来完成其擅长的工作——综合临床叙述、生成结构化推理链、产生可读的解释——同时通过基于HPO/MONDO(Gargano 等人,2024 (https://arxiv.org/html/2609.00256#bib.bib2))和PrimeKG(Chandak 等人,2023 (https://arxiv.org/html/2609.00256#bib.bib1))的符号层独立验证该推理。临床医生可以阅读命题逻辑审计字符串,检查图谱,并表示不同意:他们可以添加模型遗漏的症状,移除他们认为不可行的候选疾病,并重新运行评分流程。没有他们,循环就不闭合。
我们的贡献是双重的:
\(A\) 立场与设计原则。我们提炼了五项面向临床医生参与的临床NLP设计原则——揭示矛盾、结构性保留否定、低成本覆写、多层次解释、为离线部署而设计——旨在为社区提供可操作的指导。
\(B\) 系统实例化与失败表征。我们提出NSIDDx作为这些原则的具体实例化,围绕三元症状编码方案(+1表示存在,-1表示明确否认,0表示未记录)、结合矛盾敏感矩阵分数和覆盖惩罚混合分数的双公式评分引擎,以及保留否定的表型图构建,该图将阴性发现作为结构性节点呈现,而非静默丢弃。我们在无多项选择支架的开放条件下评估该流程,表征系统性失败模式——词汇不匹配、无根基的置信度以及否定反转——这些使得临床医生干预成为常规需求而非边缘情况。NSIDDx的符号透明层被提出作为架构响应。我们不声称诊断优势——我们的贡献是架构性的。
我们承认尚未进行用户研究或临床验证。关于临床医生参与的论证是理论性的,通过一个案例研究进行了演示,并明确呼吁进行前瞻性验证。
## 2 相关工作
#### 基于LLM的临床诊断。
大型语言模型在医学基准测试中展现了强大性能(Singhal 等人,2023 (https://arxiv.org/html/2609.00256#bib.bib3); Nori 等人,2023 (https://arxiv.org/html/2609.00256#bib.bib4))。Health-LLM(Yu 等人,2025 (https://arxiv.org/html/2609.00256#bib.bib5))通过两遍RAG流程和XGBoost分类器进行个性化预测扩展了此能力,但临床医生接收到的是一个标签,没有可检查的逻辑链,也没有覆写机制。
#### 人机协作诊断。
AMIE(Tu 等人,2025 (https://arxiv.org/html/2609.00256#bib.bib18))表明对话式AI在OSCE研究中可以匹配医生的准确性,但未暴露可检查的推理链或临床医生覆写机制。在低资源环境中,质询和纠正AI建议的能力可能比原始准确性更有价值。
#### 知识图谱引导的迭代诊断。
MedKGI(Wang 等人,2025a (https://arxiv.org/html/2609.00256#bib.bib6))使用基于KG子图的信息增益,将多步诊断建模为迭代对话循环。它未对缺席症状建模——阴性发现既未被引出也未被编码,临床医生无法看到哪些缺席症状与鉴别诊断相关。NSIDDx是互补的:MedKGI优化了针对阳性发现的自动化病史采集,而NSIDDx在病史采集后使否定明确且可检查。
#### 用于预后的知识图谱锚定。
Wang 等人(2025b)(https://arxiv.org/html/2609.00256#bib.bib12)在PrimeKG支架的推理路径上微调轻量级LLM以进行下次就诊预测,将就诊编码为二元ICD-9向量——结构上无法表示明确的症状否认(xi=−1x\_{i}\=\-1)。推理链不可检查,阴性发现是隐含的。我们的两队列评估量化了这种不透明性:CUPCase上DDx@5的41.6%语义命中在无审计跟踪的情况下无法通过词元验证。
#### 神经符号可解释性。
Mondal 等人(2025)(https://arxiv.org/html/2609.00256#bib.bib7)和Lu 等人(2025)(https://arxiv.org/html/2609.00256#bib.bib8)将基于LNN的方法应用于可解释的糖尿病预测,暴露了具有否定支持的可审计推理,但其操作在低维表格数据和静态定义的规则上,无法解析非结构化临床叙述。
#### 罕见病检测。
RADAR(Kim 等人,2025 (https://arxiv.org/html/2609.00256#bib.bib10))将FAISS应用于脑部MRI中的罕见病检索;Zelin 等人(2024)(https://arxiv.org/html/2609.00256#bib.bib11)探索了基于知识引导的RAG用于罕见病诊断。NSIDDx的扫描器不同:它在临床文本上运行,基于ZebraMap(Islam 等人,2026 (https://arxiv.org/html/2609.00256#bib.bib15))锚定,并通过与主要DDx相同的双源符号流程对候选疾病进行评分,离线无需API访问。
#### 白盒诊断系统。
Ada DX(Ronicke 等人,2019 (https://arxiv.org/html/2609.00256#bib.bib17))展示了接受阳性发现和阴性发现并允许临床医生完全覆写的价值,但它是一个基于结构化症状输入而非自由文本叙述的概率专家系统。
#### 特征比较。
表1 (https://arxiv.org/html/2609.00256#S2.T1)将NSIDDx置于先前系统之中。主张并非单个特征的新颖性,而是所有五个维度——否定建模、覆写接口、离线能力、非结构化文本输入和知识图谱锚定——的特定整合在神经符号临床NLP中是新颖的。
表 1:特征比较。列:否定建模、覆写接口、离线能力、非结构化文本输入、知识图谱锚定。✓完全;❜部分(功能存在但有重大限制,例如,否定需要手动输入,覆写是单向的,或离线模式排除某些功能);✗无。
## 3 系统架构
NSIDDx是一个包含五个核心阶段的模块化流程。
#### 数据源。
知识库文件来源于HPO(hp.obo, phenotype.hpoa)、MONDO(mondo.owl)和PrimeKG(kg.feather)。HPO术语被提取到症状目录中;未注释的修饰符和遗传术语被排除。MONDO交叉引用统一了OMIM和ORPHA标识符;移除了具有零个存在症状注释的条目,产生约10,800个疾病概况。对于PrimeKG,疾病-表型边被桥接到HPO ID;疾病-疾病边被排除。超过9,000个带有表型的实体进入评分流程。NSIDDx流程,包括所有预处理脚本和过滤器阈值,在https://github.com/joetheguide2/NSIDDX-公开提供。
### 3.1 阶段1:临床病史采集与总结
临床病史通过LLM驱动的对话代理收集,并浓缩为保留阳性发现和阴性发现的结构化摘要。
### 3.2 阶段2:症状提取与HPO解析
症状提取通过两步流程处理临床摘要。首先,LLM将摘要重新格式化为带有“存在:”和“否认:”前缀的结构化格式。其次,表面形式通过MedSpaCy TargetRule(字面)或Abhinand/MedEmbed-large-v0.1(语义)匹配解析为HPO ID;每个都标记其解析方法。结果是两个类型化的集合:patient\_hpo\_ids(存在)和absent\_hpo\_ids(明确否认)。
疾病名称解析使用精确匹配然后子串匹配,优先选择具有症状概况的疾病而非“综合征”等上位词。
### 3.3 阶段3:LLM鉴别诊断与PL生成
LLM鉴别诊断阶段将临床摘要与已确认存在和明确否认的症状列表一起,在结构化DDx提示下发送给LLM。提示强制每个条目采用固定的证据→推理→诊断格式,并为否认的症状标记“缺席:”。
命题逻辑字符串——特定病例的症状命题合取式,蕴含一个诊断——为每个诊断生成,要么是符号化的(来自HPO匹配的症状),要么通过LLM生成。命题陈述使用缺席症状作为否定命题(例如,¬(Raynaud现象))。这些字符串作为每个诊断候选的临床医生可读审计跟踪。
### 3.4 阶段4:三元混合评分引擎
评分引擎运行两个评分公式——矩阵分数和混合分数——独立地针对每个知识源(HPO/MONDO,PrimeKG),为每个候选疾病产生独立分数。两个公式都应用于所有来源。
#### 评分公式1:矩阵分数。
构建患者症状向量Vp∈\{−1,0,+1\}N\mathbf{V}\_{p}\in\{-1,0,+1\}^{N},根据提取的HPO ID:+1表示确认存在,-1表示明确否认,0表示未记录。疾病概况向量Aj∈\{−1,0,+1\}N\mathbf{A}\_{j}\in\{-1,0,+1\}^{N}编码预期表型。分数是归一化的点积:
Sjmatrix=Vp⋅Aj\|Aj\|∈\[−1,+1\]S\_{j}^{\text{matrix}}=\frac{\mathbf{V}\_{p}\cdot\mathbf{A}\_{j}}{\|\mathbf{A}\_{j}\|}\in[-1,\,+1]其中\|Aj\|\|\mathbf{A}\_{j}\|是疾病概况的大小。负分表示矛盾——患者否认了所需症状或呈现了疾病期望缺席的症状。两个公式使用标准度量(点积,Jaccard);它们的特定等权重组合是新颖的。
#### 评分公式2:混合分数。
混合分数衡量疾病解释患者阳性发现的程度:
Sjhybrid=0.5×\|A∩B\|\|A\|+0.5×\|A∩B\|\|A∪B\|∈\[0,+1\]S\_{j}^{\text{hybrid}}=0.5\times\frac{\|A\cap B\|}{\|A\|}+0.5\times\frac{\|A\cap B\|}{\|A\cup B\|}\in[0,\,+1]包含项(\|A∩B\|/\|A\|\|A\cap B\|/\|A\|)奖励覆盖患者大部分症状;Jaccard项(\|A∩B\|/\|A∪B\|\|A\cap B\|/\|A\cup B\|)惩罚仅偶然症状重叠的大型概况。
### 3.5 阶段5:保留否定的表型图与罕见病RAG扫描器
否定图阶段构建一个保留否定的表型图——使用NetworkX从当前患者负载和上次评分输出构建的有向多重图。图包含五种节点类型:存在症状(HPO解析)、缺席症状(明确否认)、既往病史、家族史和DDx候选。缺席症状节点在图中保持结构性存在——在视觉上与确认症状区分开来——让临床医生直接查看相关阴性发现与阳性发现并列。
#### 边类型。
图呈现四种来自PrimeKG的边类型:解释(疾病→症状);呈现(症状→疾病);关联(症状共现);和表型修饰符修饰(修饰符→基础)。解释边带有源自PrimeKG的特异性权重w=log10(总疾病数/症状数)+1w=\log\_{10}(\text{总疾病数}/\text{症状数})+1,其中较高权重表示更高的诊断特异性。评分层将修饰符术语视为独立表型——一个已知的局限性(第局限性节 (https://arxiv.org/html/2609.00256#Sx1))。
罕见病RAG扫描器提供一个基于ZebraMap(Islam 等人,2026 (https://arxiv.org/html/2609.00256#bib.bib15))的可选安全网,使用MedEmbed编码并索引在FAISS向量存储中。检索到的候选项从UMLS映射到MONDO ID,从而通过与主要DDx相同的双源符号流程进行评分。该模块旨在用于呈现时...相似文章
SymDiag:基于神经符号验证的LLM推理可解释诊断
SymDiag 是一种神经符号框架,将思维链推理转化为符号约束,并执行步骤级可满足性检查,以定位 LLM 推理中的失败,从而区分翻译错误与推理错误。
面向安全的假设演绎框架用于AI辅助鉴别诊断
AegisDx是一个面向安全的框架,它利用专门的LLM组件和验证门进行假设演绎临床推理,在医学病例报告上,将鉴别诊断准确率比单独的LLM提高了7-17个百分点。
Aletheia:面向低资源医疗环境的离线优先临床决策支持系统,用于鉴别诊断
Aletheia 是一个离线优先的临床决策支持系统,基于 Qwen2.5-3B-Instruct 模型,使用 QLoRA 在 27,000 个临床推理样本上进行微调,旨在服务于撒哈拉以南非洲的低资源医疗环境,达到了 80% 的 Top-1 准确率,且符合内存限制。
EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses
EarlyDx is a new large-scale benchmark for evaluating LLMs on open-ended, evidence-supported diagnosis generation at emergency department admission, built from 154,834 MIMIC-IV encounters. It reveals that even frontier and medical-specialized models struggle to synthesize admission-time evidence, with post-training only partially improving inference-dependent recall.
从临床叙述构建规划领域模型的神经符号方法
本文介绍了NSPIN,一个神经符号框架,它使用预训练的大型语言模型从临床叙述中提取结构化事件序列,并为手术过程诱导概率规划领域模型。通过在腹腔镜阑尾切除术记录上的评估,展示了其泛化能力和与外科实践的一致性。