知识增强型智能体AI用于心理健康药物信息查询

arXiv cs.AI 论文

摘要

本文提出了一种具有来源感知能力、基于知识图谱的多智能体框架,该框架整合了来自Reddit和WebMD的患者叙事以及FDA针对九种抗抑郁药的药物不良事件报告,利用大语言模型(LLM)实体识别流水线实现了高准确率,并能够提供可追踪的精神科药物安全信息。

arXiv:2606.26205v1 公告类型:新 摘要:患者越来越多地在网上搜索药物信息,然而精神科药物的安全知识被分割为两个部分:监管机构的不良事件记录(权威但抽象)和患者叙事(贴近体验但未经证实)。在精神病学领域,将两者整合而不混淆证据与轶事尤为重要,因为信息缺乏上下文可能会放大恐惧、反安慰剂效应和不依从性。本文开发了一种具有来源感知能力、基于知识图谱的多智能体框架,统一了466,525条Reddit帖子、60,782条WebMD评论以及美国FDA不良事件报告系统二十年来针对九种抗抑郁药的记录。一个以医生标注为基准的大语言模型实体识别流水线在药物识别上达到了0.969的最高F1分数,在疾病状况识别上达到了0.973。两个社区平台之间的重叠度(最高Jaccard相似度0.905)远高于它们与监管报告的重叠,表明患者生成的数据形成了部分独立的安全信号。对于舍曲林,许多不良事件在社区来源中出现的时间比对应的FDA日期早几百天。一个基于ATC-N、ICD-10和MedDRA词汇表的Neo4j知识图谱保留了来源信息,使每条声明都可追溯,并将监管事实与患者体验区分开来。这些结果确立了来源感知整合作为实现更可审计的精神科药物信息的途径,其有效性和患者获益将有待前瞻性检验。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:11

# 引言 来源:https://arxiv.org/html/2606.26205 面向心理健康药物信息查询的知识增强型自主AI系统 Huizi Yu1†, Jian Liu2†, Wenkong Wang3†, Lingyao Li4, Jiayan Zhou5, Zhaoqian Xue6, Xiang Li2, Xinxin Lin2, Zhiying Liang2, Zhuoru Wu2, Siyuan Ma7, Xin Ma3, and Lizhou Fan2,8* 1香港中文大学内科及药物治疗学系,香港沙田 2香港中文大学精神科学系,香港沙田 3山东大学控制科学与工程学院,中国山东济南 4亚利桑那大学信息科学学院,美国亚利桑那州图森 5斯坦福大学医学院医学系,美国加利福尼亚州帕洛阿尔托 6宾夕法尼亚大学佩雷尔曼医学院,美国宾夕法尼亚州费城 7范德比尔特大学生物统计学系,美国田纳西州纳什维尔 8香港中文大学医学院李嘉诚健康科学研究所,香港新界沙田 †这些作者贡献相同。 *通讯作者:Lizhou Fan ([email protected])

## 摘要

患者越来越倾向于在线获取药物信息,然而精神科药物的安全知识分散在两个来源:监管不良事件记录(权威但抽象)和患者叙述(贴近经验但未经验证)。在不混淆证据与轶事的前提下整合二者,对精神科尤为重要——因为缺乏语境化的信息可能加剧恐惧、反安慰剂效应和用药不依从。本研究开发了一个基于知识图谱、具有溯源意识的多代理框架,整合了来自Reddit的466,525篇帖子、WebMD的60,782条评论以及美国FDA不良事件报告系统(FAERS)二十年来针对九种抗抑郁药的数据。一个以医生标注为基准的大型语言模型实体识别管线,在药物识别上达到最高F1分数0.969,在病症识别上达到0.973。两个社区平台之间的一致性远高于它们与监管报告的一致性(Jaccard相似度最高达0.905),表明患者生成数据形成了部分独立的安全信号。对于舍曲林,许多不良事件在社区来源中出现的时间比相应的FDA日期早数百天。一个基于ATC-N、ICD-10和MedDRA词汇表的Neo4j知识图谱保留了数据溯源,确保每项声明可追溯,监管事实与患者体验相互区分。这些结果确立了以来源感知整合作为实现更可审计的精神科药物信息的一条路径,其有用性和患者收益有待前瞻性测试。

精神科药物治疗通常长期、个体化且随病程动态调整,这使得患者了解药物益处、不良反应和不确定性尤为重要。然而在常规诊疗中,药物咨询常常被压缩在短暂的临床接触中,导致许多患者在就诊后仍有未解答的疑问。这一缺口在数字环境中尤为突出:跨区域在线搜索健康信息已成为常态——2020年欧洲16-74岁人群中55%曾在线搜索健康相关信息[1](https://arxiv.org/html/2606.26205#bib.bib1);美国成年人最近一次健康信息搜索首选互联网的比例从2008年的61.2%上升至2017年的74.4%[2](https://arxiv.org/html/2606.26205#bib.bib2);亚洲一项覆盖10个国家的调查发现,71.6%的智能手机用户每月至少数次通过手机搜索健康信息[3](https://arxiv.org/html/2606.26205#bib.bib3)。先前的综合研究提示,在线健康信息搜索与药物相关决策密切相关,尽管其与依从性的关系因环境而异且复杂[4](https://arxiv.org/html/2606.26205#bib.bib4), [5](https://arxiv.org/html/2606.26205#bib.bib5)。与此同时,近期研究表明患者对新处方的药物知识仍不完整,尤其是关于用法和副作用等实际细节,凸显了对更清晰、更易获取的药物教育工具的需求[6](https://arxiv.org/html/2606.26205#bib.bib6)。

这一问题在精神科护理中可能尤为突出。服用抗抑郁药、抗精神病药、心境稳定剂或抗焦虑药的患者,不仅寻求正式的不良反应列表的解释,还想了解药物相关体验在日常生活中如何展现:睡眠、食欲、注意力、情绪、体重、动力或停药症状的变化。同伴论坛和在线社区可以提供认同感、实用语言以及不再孤单的感觉;近期在心理健康论坛中开展的混合方法研究表明,用户常常从这些空间中获得情感支持、正常化和实际益处[7](https://arxiv.org/html/2606.26205#bib.bib7)。然而,同伴叙述在准确性和代表性上高度异质。在药物情境中,期望本身会影响副作用的体验,负面或缺乏良好语境化的信息可能加剧焦虑和反安慰剂效应[8](https://arxiv.org/html/2606.26205#bib.bib8), [9](https://arxiv.org/html/2606.26205#bib.bib9)。对于精神科药物——其依从性本已易受恐惧、污名和不确定性的影响——这造成了一个沟通问题:患者需要可理解且贴近经验的信息,但也需要这些信息是相称的、有证据意识的、安全的。

现有信息渠道各自只满足部分需求。监管和专业来源提供标准化的、基于证据的适应症、警告和报告不良事件描述,但患者往往觉得这些信息抽象、脱离语境或难以映射到生活体验。例如,FAERS是一个主要上市后安全资源,专门设计用于支持FDA对已上市药物和生物制品的上市后监测[10](https://arxiv.org/html/2606.26205#bib.bib10)。与此同时,社交媒体和消费者生成的叙述可以揭示正式渠道中可能缺失、延迟或不被重视的患者报告体验。近期的一项范围综述得出结论,社交媒体分析可作为不良事件检测和药物警戒的有用补充来源,同时也强调了仔细验证和来源感知解读的必要性[11](https://arxiv.org/html/2606.26205#bib.bib11)。因此,核心问题不在于权威数据或患者叙述哪个“更好”,而在于如何整合它们,使得官方证据保持事实骨干地位,同时真实世界体验提供上下文而非扭曲。

大型语言模型为此整合提供了一个潜在强大的接口,因为它们能够将复杂的医学信息转化为流畅的用户面向解释,并支持对话式查询。然而,使LLM易于访问的相同属性也使其在健康环境中具有风险。系统综述显示LLM在患者护理和基于聊天机器人的健康建议中的应用快速增长,但也记录了关于事实可靠性、透明度、评估质量和治理的持续关切[12](https://arxiv.org/html/2606.26205#bib.bib12), [13](https://arxiv.org/html/2606.26205#bib.bib13), [14](https://arxiv.org/html/2606.26205#bib.bib14)。更尖锐的是,临床决策基准测试表明,当前LLM尚未准备好用于自主临床使用[15](https://arxiv.org/html/2606.26205#bib.bib15),工作流层面的评估进一步表明,临床准备程度取决于模型在多轮咨询过程中如何收集、解释和传达信息,而不仅仅是最终答案的准确性[16](https://arxiv.org/html/2606.26205#bib.bib16)。近期以安全为中心的研究呼吁采用以临床医生为中心的框架来评估幻觉和临床伤害,而非仅依赖表面合理性[17](https://arxiv.org/html/2606.26205#bib.bib17),同时也有研究提出证据引导的对齐框架,以改善更轻量级LLM中的结构化精神科临床推理[18](https://arxiv.org/html/2606.26205#bib.bib18)。

这些关切在精神科尤为突出,因为关于不良反应、自杀倾向、停药或弱势群体等问题的措辞不当的回答可能增加恐惧、破坏依从性或损害信任。因此,任何用于精神科药物教育的AI系统都应受到明确约束、基于来源,并作为辅助教育工具而非专业判断的替代进行评估[19](https://arxiv.org/html/2606.26205#bib.bib19)。实现这一目标的一个有前景的方法是将LLM与知识图谱和多代理编排相结合。知识图谱提供了跨异构信息来源的实体、关系和溯源的结构化表示,提高了可解释性并支持具有证据意识的检索[20](https://arxiv.org/html/2606.26205#bib.bib20)。在医疗保健中,检索增强和图谱基础的LLM工作流越来越多地用于通过分离证据检索与答案生成来减少幻觉并提高事实一致性[17](https://arxiv.org/html/2606.26205#bib.bib17)。对于当前应用,这种架构特别有吸引力,因为它可以在同一系统内编码不同的证据角色:监管或专业来源可以锚定事实声明,而社区叙述可以作为情境化的次要经验信号被呈现。多代理设计可以分配查询理解、来源选择、检索、综合和验证等功能,从而加强内部检查并更清晰地划定安全边界[17](https://arxiv.org/html/2606.26205#bib.bib17), [19](https://arxiv.org/html/2606.26205#bib.bib19), [21](https://arxiv.org/html/2606.26205#bib.bib21), [22](https://arxiv.org/html/2606.26205#bib.bib22), [23](https://arxiv.org/html/2606.26205#bib.bib23), [24](https://arxiv.org/html/2606.26205#bib.bib24)。

在此背景下,本研究构建并描述了使用多源健康数据的精神科药物不良事件知识图谱驱动的多代理AI系统。该系统将来自Reddit、WebMD和FDA/FAERS的社区与监管信息整合到一个统一的知识框架中,旨在支持关于用药、副作用、停药和风险沟通的教育性问答,而非诊断或治疗建议。本工作的核心贡献包括:(i) 一个可扩展的基于LLM的NER管线,在医生标注数据上对九个最先进模型进行了基准测试;(ii) 对监管和社区派生数据流中不良事件概况的多源比较分析,包括跨源重叠、频率结构和时间领先分析,涵盖九种抗抑郁药;(iii) 一个Neo4j知识图谱和多代理聊天机器人架构,提供具有溯源意识、安全性约束的精神科药物信息检索。

## 方法

### 药物列表构建 (ATC-N)

我们从WHO解剖治疗化学分类系统(ATC)构建了药物词典,该分类系统按解剖系统、治疗/药理类别和通用名称(即化学物质)对药品进行层级分类。我们从ATC索引中以编程方式检索层级结构,并筛选至N(神经系统)分支,该分支包含626个通用药物名称。为提高后续文本挖掘的召回率,我们使用一个受限的LLM提示将通用名称扩展为品牌同义词,该提示以简单结构化格式返回品牌名称(见附录A)。由此产生的ATC-N词典——包含ATC代码、通用药物名称和整理后的品牌名称——作为数据收集中的关键词生成基础以及跨社区和机构来源的药物标准化基础。

### 数据收集(社区与机构)

我们使用Academic Torrents公共数据集收集了基于社区的Reddit讨论帖子,分析窗口限定为2005年6月至2025年4月。Reddit是一个大型、按主题组织的社会平台,用户可在公共论坛中发布带时间戳的叙述。我们纳入了标题或正文中包含任何ATC-N通用名称或整理后品牌关键词的帖子。为提升文本质量和特异性,我们移除了内容缺失的条目,连接了标题和正文文本,排除了少于10个单词的记录,并对精确匹配的(标题、正文)对进行去重。仅因模糊关键词匹配(如“锂”、“可卡因”)触发的帖子也被排除。最后,我们应用自动语言检测,仅保留英文帖子。该过程产生了1,138,331条独特的、英文的、包含关键词的Reddit帖子。进一步检查发现,经关键词和规则筛选后保留的大量Reddit帖子仍缺乏有意义的临床信息。为进一步提升整体数据质量,我们引入了一个二次筛选阶段,以区分信息丰富与信息贫乏的内容(见附录B)。最终的Reddit帖子集合包含466,525条帖子。

对于第二个基于社区的讨论来源,我们从WebMD收集了结构化药物评价。WebMD是一个消费者健康平台,患者和护理人员可提交带评分和时间戳的关于处方药的叙述。对于每个ATC-N通用名称,我们找到对应的评价页面并抓取所有可用条目,捕获用户的年龄组、性别、用药时长、评论者角色(患者或护理人员)、总体评分以及自由文本评价。与Reddit相比,WebMD在叙述文本之外提供了半结构化的人口统计学和使用字段,支持互补的基于社区的信号特征描述和分层分析。我们完成了与Reddit数据相同的基于规则和基于模型的筛选,剩余的WebMD语料包含60,782条评价。

我们分析了美国FDA的不良事件报告系统(FAERS),这是一个大型、长期的全国性药物警戒数据库,包含数百万份上市后报告,具有广泛的监管声誉。我们将分析窗口对齐为2005年第二季度至2025年第一季度,以与社区数据对应。使用开源faers-toolkit(GitHub),我们将季度发布文件解析到SQLite中。然后通过将每份报告的药物名称与我们的ATC-N词典匹配,将FAERS筛选到ATC-N药物集。最后,我们根据FDA接收日期限制记录,并应用轻度标准化(修剪空白、将空字段转换为null)。保留了所有报告者类型(制造商、临床医生、消费者)以最大化覆盖范围。

### 基于LLM的命名实体识别 (NER)

为从非结构化的Reddit和WebMD帖子中提取结构化临床信息,我们采用了基于大型语言模型(LLM)的NER管线。每个帖子使用一次通过的结构化提取提示(见附录D)进行处理,指示模型识别并返回一个包含以下内容的JSON对象:(i) 药物

相似文章

WiseMind:一个知识引导的多智能体框架,用于准确且富有同理心的精神疾病诊断

arXiv cs.CL

WiseMind是一个知识引导的多智能体框架,利用大语言模型进行精神疾病诊断,通过结合用于循证逻辑的“理性思维”智能体和用于共情沟通的“情感思维”智能体,在模拟和真实患者交互中实现了85.6%的诊断准确率。该框架利用DSM-5结构化知识图谱减少幻觉,并在保持临床合理性和心理支持的同时,比单智能体基线高出15-54个百分点。