评估LLM生成的规则用于心脏病预测
摘要
本文评估了传统机器学习模型与LLM生成的基于规则的系统在心脏病预测方面的应用,结果显示传统模型具有更高的准确性,但LLM规则在临床使用中提供了更好的可解释性。
arXiv:2609.13192v1 Announce Type: new
摘要:本研究使用UCI心脏病数据集比较了传统机器学习模型与大型语言模型(LLM)生成的基于规则的系统在心脏病预测方面的表现。评估了多个分类器,包括逻辑回归、K近邻(KNN)、支持向量机(SVM)、朴素贝叶斯、决策树和随机森林,以及使用GPT-4o和Claude Sonnet 4.6生成的基于规则的系统。模型性能使用准确率、精确率、召回率和F1分数指标进行评估。实验结果表明,传统机器学习模型在预测性能上始终优于LLM生成的基于规则的系统。随机森林取得了最佳的整体性能,准确率为90.2%,精确率为0.829,召回率为完美的1.0,F1分数为0.906。朴素贝叶斯紧随其后,准确率为88.5%,F1分数为0.881。相比之下,LLM生成的规则模型性能较低,Claude Sonnet 4.6达到80.3%的准确率(F1分数:0.833),GPT-4o达到70.5%的准确率(F1分数:0.690)。尽管存在性能差距,LLM生成的规则提供了可解释的IF-THEN诊断逻辑,增强了临床决策中的可解释性和透明度。这些发现突显了医学人工智能系统中预测性能与可解释性之间的权衡。所有实验的完整实现,包括机器学习模型和LLM衍生的规则分类器,可在GitHub仓库 https://github.com/FeisalAlaswad/LLM-Rule-ML-Heart-Disease-Prediction 公开获取。
查看缓存全文
缓存时间: 2026/09/15 08:33
# 评估用于心脏病预测的大语言模型生成规则 来源:https://arxiv.org/html/2609.13192 \\old@ps@headings 1Feisal Alaswad\*,1Batoul Aljaddouh,2Maher Alrahhal,3Wafaa Al Nassan,3Talal Bonny **单位:** 1印度金奈卡坦库拉图尔SRM科学技术学院计算技术系,[email protected],[email protected] 2阿联酋迪拜阿米提大学计算机科学系,[email protected] 3阿联酋沙迦沙迦大学计算与信息学院,[email protected],[email protected] ###### 摘要 本研究比较了传统机器学习模型与大语言模型生成的基于规则的系统在心脏病预测上的性能,使用的是UCI心脏病数据集。评估了包括逻辑回归、K近邻、支持向量机、朴素贝叶斯、决策树和随机森林在内的多种分类器,以及使用GPT-4o和Claude Sonnet 4.6生成的基于规则的系统。模型性能通过准确率、精确率、召回率和F1分数等指标进行评估。实验结果表明,传统机器学习模型在预测性能上始终优于大语言模型生成的基于规则的系统。随机森林取得了最佳的整体性能,准确率为90.2%,精确率为0.829,完美的召回率1.0,F1分数为0.906。朴素贝叶斯紧随其后,准确率为88.5%,F1分数为0.881。相比之下,大语言模型生成的规则模型性能较低,其中Claude Sonnet 4.6的准确率为80.3%(F1分数:0.833),GPT-4o的准确率为70.5%(F1分数:0.690)。尽管存在性能差距,大语言模型生成的规则提供了可解释的IF-THEN诊断逻辑,增强了临床决策中的可解释性和透明度。这些发现突显了医疗人工智能系统中预测性能与可解释性之间的权衡。所有实验的完整实现,包括机器学习模型和大语言模型衍生的规则分类器,已公开发布在GitHub仓库中:https://github.com/FeisalAlaswad/LLM-Rule-ML-Heart-Disease-Prediction。 ###### 索引术语: 心脏病预测,机器学习,大语言模型,规则提取,可解释人工智能,临床决策支持,随机森林,医疗数据分析 \\old@ps@headings ## 一、 引言 人工智能作为一种补充传统心血管风险评估的方法,正受到越来越多的关注,因为机器学习模型能够整合多种异构的临床变量,并识别出使用传统统计方法可能难以捕捉的复杂关联\[51 (https://arxiv.org/html/2609.13192#bib.bib50), 36 (https://arxiv.org/html/2609.13192#bib.bib51)\]。然而,仅有预测性能的提升不足以满足临床采用的要求,透明度、可靠性以及适当的人为监督也是重要的考量因素\[51 (https://arxiv.org/html/2609.13192#bib.bib50), 46 (https://arxiv.org/html/2609.13192#bib.bib52)\]。 心脏病是全球主要的死亡原因之一,仍然是一个重大的公共卫生挑战\[52 (https://arxiv.org/html/2609.13192#bib.bib1)\]。心血管疾病的早期预测和诊断对于降低死亡率和改善患者预后至关重要\[23 (https://arxiv.org/html/2609.13192#bib.bib2), 17 (https://arxiv.org/html/2609.13192#bib.bib27)\]。临床诊断通常依赖于多个生理和医疗因素,如血压、胆固醇水平、胸痛特征、心电图测量和运动相关症状\[31 (https://arxiv.org/html/2609.13192#bib.bib3), 24 (https://arxiv.org/html/2609.13192#bib.bib28)\]。然而,手动分析这些复杂关系可能既困难又耗时\[42 (https://arxiv.org/html/2609.13192#bib.bib4)\]。 机器学习和深度学习技术因其能够从临床数据集中学习模式并生成准确的预测模型,已在医学诊断中得到广泛应用\[15 (https://arxiv.org/html/2609.13192#bib.bib25), 9 (https://arxiv.org/html/2609.13192#bib.bib23), 12 (https://arxiv.org/html/2609.13192#bib.bib24), 3 (https://arxiv.org/html/2609.13192#bib.bib26), 10 (https://arxiv.org/html/2609.13192#bib.bib39), 8 (https://arxiv.org/html/2609.13192#bib.bib40)\]。传统的监督学习算法,如逻辑回归、K近邻、支持向量机、朴素贝叶斯、决策树和随机森林,已表现出强大的性能\[30 (https://arxiv.org/html/2609.13192#bib.bib6), 4 (https://arxiv.org/html/2609.13192#bib.bib5), 20 (https://arxiv.org/html/2609.13192#bib.bib7), 40 (https://arxiv.org/html/2609.13192#bib.bib8)\]。这些模型能够识别患者属性之间的非线性关系,并为疾病检测提供可靠的预测\[22 (https://arxiv.org/html/2609.13192#bib.bib9), 50 (https://arxiv.org/html/2609.13192#bib.bib45), 53 (https://arxiv.org/html/2609.13192#bib.bib46)\]。比较研究报告指出,机器学习算法的相对性能可能因心血管数据集、患者群体和评估设置的不同而有很大差异,表明没有单一分类器能在所有临床预测任务中始终提供最佳性能\[36 (https://arxiv.org/html/2609.13192#bib.bib51)\]。这种变异性强调了在开发数据驱动的心血管决策支持系统时,评估多种学习算法的重要性,而不是依赖单一的预测模型。 尽管具有预测有效性,许多机器学习模型作为黑箱系统运行,可解释性有限\[19 (https://arxiv.org/html/2609.13192#bib.bib29), 25 (https://arxiv.org/html/2609.13192#bib.bib30)\]。在医疗应用中,可解释性尤为重要,因为临床医生需要理解自动化预测背后的推理过程\[13 (https://arxiv.org/html/2609.13192#bib.bib10), 26 (https://arxiv.org/html/2609.13192#bib.bib12), 14 (https://arxiv.org/html/2609.13192#bib.bib11), 11 (https://arxiv.org/html/2609.13192#bib.bib13)\]。基于规则的系统和决策树通常通过使用人类可读的IF-THEN决策规则表示预测来提高透明度\[34 (https://arxiv.org/html/2609.13192#bib.bib15), 5 (https://arxiv.org/html/2609.13192#bib.bib14)\]。 最近,大语言模型作为一种强大的人工智能系统出现,能够处理结构化和非结构化信息进行推理\[35 (https://arxiv.org/html/2609.13192#bib.bib16), 6 (https://arxiv.org/html/2609.13192#bib.bib17), 33 (https://arxiv.org/html/2609.13192#bib.bib31), 29 (https://arxiv.org/html/2609.13192#bib.bib41), 7 (https://arxiv.org/html/2609.13192#bib.bib42)\]。除了自然语言生成外,大语言模型还展示了从数据集或提示中生成可解释的诊断规则和临床决策逻辑的能力\[49 (https://arxiv.org/html/2609.13192#bib.bib18), 48 (https://arxiv.org/html/2609.13192#bib.bib32)\]。这引入了使用大语言模型生成的规则作为传统机器学习方法的可解释替代方案的可能性\[16 (https://arxiv.org/html/2609.13192#bib.bib33), 37 (https://arxiv.org/html/2609.13192#bib.bib43), 32 (https://arxiv.org/html/2609.13192#bib.bib44)\]。 本研究比较了传统机器学习分类器与使用大语言模型生成的基于规则的系统在心脏病预测上的性能。评估了几种机器学习模型以及大语言模型提取的规则。实验结果表明,传统机器学习模型在预测性能上优于大语言模型生成的规则系统,而大语言模型的规则提供了更具可解释性和人类可读性的诊断逻辑。 本文其余部分组织如下。第二节 (https://arxiv.org/html/2609.13192#S2) 回顾了基于机器学习的心脏病预测、可解释的基于规则的方法以及大语言模型在临床决策支持中新兴应用的相关研究。第三节 (https://arxiv.org/html/2609.13192#S3) 描述了数据集、预处理过程、机器学习模型、基于大语言模型的规则提取过程和实验工作流程。第四节 (https://arxiv.org/html/2609.13192#S4) 呈现并讨论了实验结果,包括传统机器学习模型和大语言模型生成的基于规则的分类器的比较性能。最后,第五节 (https://arxiv.org/html/2609.13192#S5) 通过总结主要发现、讨论预测性能与可解释性之间的权衡以及概述未来研究方向来结束本文。 ## 二、 相关工作 由于临床数据集的日益普及和对早期诊断支持系统的需求,心脏病预测已使用传统机器学习技术进行了广泛研究\[38 (https://arxiv.org/html/2609.13192#bib.bib34), 2 (https://arxiv.org/html/2609.13192#bib.bib35)\]。传统的机器学习模型,如逻辑回归、K近邻、支持向量机、决策树、随机森林和朴素贝叶斯,在预测心血管疾病方面表现出了强大的性能,这些模型基于结构化的临床属性,如胸痛类型、胆固醇水平、血压、年龄和心电图测量值\[44 (https://arxiv.org/html/2609.13192#bib.bib36), 1 (https://arxiv.org/html/2609.13192#bib.bib37), 27 (https://arxiv.org/html/2609.13192#bib.bib53), 41 (https://arxiv.org/html/2609.13192#bib.bib54)\]。在这些方法中,集成方法如随机森林通常能达到较高的预测准确率,因为它们能够捕捉非线性关系和特征交互作用\[45 (https://arxiv.org/html/2609.13192#bib.bib19), 54 (https://arxiv.org/html/2609.13192#bib.bib20)\]。 除了预测性能,可解释性已成为医疗人工智能的重要研究方向。决策树和基于规则的系统经常被使用,因为它们提供了人类可读的IF-THEN规则,可以支持临床理解和透明度。几项研究专注于从训练好的机器学习模型中提取可解释的规则,以提高医疗应用中的可信度和可解释性\[21 (https://arxiv.org/html/2609.13192#bib.bib21), 55 (https://arxiv.org/html/2609.13192#bib.bib22)\]。 除了文本生成,大语言模型还展示了从数据集或提示中生成诊断规则、临床解释和决策支持逻辑的潜力\[35 (https://arxiv.org/html/2609.13192#bib.bib16), 47 (https://arxiv.org/html/2609.13192#bib.bib55)\]。像GPT-4o和Claude Sonnet这样的模型可以综合出类似于专家推理的可解释的IF-THEN决策规则。这激发了人们日益增长的兴趣,去评估大语言模型生成的规则是否可以作为传统机器学习方法的轻量级和可解释的替代方案。 然而,尽管大语言模型在医疗推理任务中的应用越来越多\[18 (https://arxiv.org/html/2609.13192#bib.bib47), 39 (https://arxiv.org/html/2609.13192#bib.bib48), 43 (https://arxiv.org/html/2609.13192#bib.bib49)\],但直接比较人工提示的大语言模型提取规则与传统监督学习模型在结构化心脏病数据集上的表现的研究仍然有限。此外,在比较由大语言模型生成的符号规则与数据驱动的分类器时,关于可解释性与预测性能之间权衡的分析仍然不足。 ## 三、 方法 本研究调查了大语言模型生成的临床规则在心脏病预测中的有效性,并将其性能与传统机器学习分类器进行了比较。整体工作流程包括数据集预处理、模型训练、使用大语言模型进行规则提取和性能评估。整体实验工作流程如图1 (https://arxiv.org/html/2609.13192#S3.F1) 所示。该流程首先预处理UCI心脏病数据集并执行分层训练测试划分,随后采用两种并行的建模方法:传统的机器学习分类器和使用GPT-4o和Claude Sonnet 4.6的基于大语言模型的规则提取。生成的规则随后被转换成可执行的基于规则的分类器,并在相同的留出测试集上使用标准分类指标进行评估,最后比较两种方法的预测性能。 参考标题图1:用于比较传统机器学习分类器与大语言模型生成的基于规则的分类器在心脏病预测上的整体实验工作流程。 ### 三、 A 数据集描述 实验使用公开可用的UCI心脏病数据集进行,该数据集包含从303名患者收集的临床记录。数据集包括人口统计信息、生理测量、运动测试结果以及通常与冠状动脉疾病相关的心脏检查属性\[28 (https://arxiv.org/html/2609.13192#bib.bib38)\]。 每条患者记录使用多个临床特征表示,包括年龄、性别、胸痛类型、空腹血糖、静息心电图结果、运动诱发的心绞痛、ST段斜率、地中海贫血测试结果、通过透视观察到的主要血管数量、静息血压、血清胆固醇、达到的最大心率和运动诱发的ST段压低。 目标变量表示是否存在心脏病。在本研究中,问题被表述为一个二元分类任务,其中0表示没有心脏病,1表示存在心脏病。 ### 三、 B 数据预处理 在训练之前,数据集经过清理和准备以进行机器学习分析。目标属性从输入特征中分离出来,所有数值属性都使用Min-Max缩放进行了归一化,以确保特征值被映射到\[0,1\]范围内。应用特征缩放以提高基于距离和基于梯度的分类器的收敛性和稳定性。 数据集使用80:20的比例划分为训练子集和测试子集。采用分层抽样以保持两个子集中的原始类别分布。 ### 三、 C 机器学习模型 实现了几种监督机器学习分类器以建立基线预测性能,包括逻辑回归、K近邻、支持向量机、高斯朴素贝叶斯、决策树和随机森林。每个分类器都在训练子集上进行训练,并在未见过的测试子集上进行评估。所有模型均使用Python的Scikit-learn库实现。 ### 三、 D 基于大语言模型的规则提取 除了传统的机器学习模型外,本研究还探索了大语言模型为心脏病预测生成可解释的临床决策规则的能力。具体而言,使用了两种大语言模型系统——GPT-4o和Claude Sonnet 4.6——来推导基于规则的分类器。 只有UCI心脏病数据集的训练子集可供语言模型进行规则生成。在规则生成的任何阶段,留出的测试实例及其相应的目标标签均未提供给GPT-4o或Claude Sonnet 4.6。因此,模型完全从训练数据上下文生成IF-THEN规则,而独立的测试集仅保留用于最终评估。
相似文章
从结构化临床数据预测心血管风险的大语言模型
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。
通过先进机器学习技术变革心脏病预测
本研究论文比较了各种机器学习分类器用于心脏病预测,发现支持向量机 (SVM) 和 Simple Cart 分别在 UCI 和 Kaggle 数据集上表现最佳,突显了机器学习在早期临床诊断中的潜力。
一个分数,两个决策:在罕见疾病尾部的选择性预测
本文分析了用于罕见疾病诊断的选择性预测系统,表明小型开源权重LLMs在超罕见疾病上召回率较低,并探讨了使用分数边际进行决策的局限性。
代理建模:解读黑盒大模型在医学预测中的隐含知识
研究者提出一种代理建模框架,可量化并解释黑盒大模型内部编码的医学知识,同时揭示有效关联与持续的种族偏见。
语言模型作为接口,而非预言机:用于儿童阑尾炎的混合LLM-ML系统
本文介绍了ClaMPAPP,一种混合架构,使用LLM作为接口从临床叙述中提取特征,然后将这些特征传递给XGBoost分类器进行儿童阑尾炎诊断,展示了相比端到端LLM基线更高的鲁棒性和安全性。