PATHFinder Agent:用于定制化产前护理的智能系统

arXiv cs.AI 论文

摘要

本文介绍了PATHFinder Agent,一个端到端的对话式AI系统,该系统根据ACOG的PATH指南生成个性化产前护理计划,整合了患者信息采集、动态对话、计划合成及临床医生监督。对包括GPT-5.2在内的前沿大语言模型的评估显示出有希望但不完全的性能,凸显了产前检测建议方面的不足。

arXiv:2607.24768v1 Announce Type: new 摘要:产前护理是一项重要的预防性服务,旨在改善妊娠个体的结局。美国妇产科医师学会(ACOG)最近推出了倡导定制化产前护理的指南,称为PATH(定制化医疗计划)。我们提出了PATHFinder Agent(适当的定制化医疗规划者),一个端到端的对话式智能系统,通过结构化对话收集患者的健康和社会背景,整理符合PATH指南的个性化产前护理计划,并呈现来自Michigan 211的社区资源。该系统具有四个阶段的工作流程:患者信息采集、动态交互、计划合成和临床医生监督。我们在专家制定的评分标准上,横跨五个临床维度评估了前沿大语言模型(LLM),发现GPT-5.2取得了最高平均分(77.6%),同时识别出产前检测建议方面的关键缺口。我们讨论了通过人体参与研究和随机对照试验进行的未来验证。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:51

# PATHFinder Agent:个性化产前护理的智能体系统
来源:https://arxiv.org/html/2607.24768
,Carissa Samuel密歇根大学安娜堡分校美国,Samia Abdelnabi密歇根大学安娜堡分校美国,Alex Peahl密歇根大学安娜堡分校美国,Elizabeth Bondi\-Kelly密歇根大学安娜堡分校美国ecbk@umich\.edu (https://arxiv.org/html/2607.24768v1/mailto:[email protected])

\(2026\)

###### 摘要.

产前保健是一项重要的预防性医疗服务,旨在改善妊娠个体的健康结局。美国妇产科医师学会(ACOG)近期发布了倡导个性化产前护理的新指南,称为PATH(个性化适当医疗保健计划)。我们提出**PATHFinder Agent**(个性化适当医疗保健计划制定器),这是一个端到端的对话式智能体系统,通过结构化对话收集患者的健康与社会背景信息,依据PATH指南制定个性化产前护理计划,并呈现来自密歇根211的社区资源。该系统采用四阶段工作流程,涵盖患者信息录入、动态交互、计划合成与临床医生审核。我们依据专家制定的评估准则,在五个临床维度上对前沿大语言模型(LLM)进行评估,发现GPT-5.2获得了最高平均分(77.6%),同时识别出产前检测建议中的关键缺口。我们讨论了未来通过人类参与者研究和随机对照试验进行的验证。

大语言模型,大语言模型智能体,健康,生殖健康,孕产妇健康,医疗智能体,LLM参与循环

††版权声明:acmlicensed††期刊年份:2026††版权:cc††会议:交互健康会议;2026年7月05-08日;葡萄牙波尔图††会议录:交互健康会议(IH ’26),2026年7月05-08日,葡萄牙波尔图††doi:10\.1145/3786579\.3804996††isbn:979\-8\-4007\-2422\-0/2026/07††ccs:计算方法 自然语言处理††ccs:人机交互 自然语言界面††ccs:应用计算 消费者健康

## 1. 引言

产前保健是一项关键的预防性医疗服务,能够改善母亲及其子女的妊娠结局(Peahlet al\.,2020c (https://arxiv.org/html/2607.24768#bib.bib13)),美国每年有近400万妊娠患者接受产前保健。产前保健是多方面的,涉及规划并提供医疗护理、筛查检测、解答问题以及将人们与适当的社会和社区资源联系起来。

美国妇产科医师学会(ACOG)是一个由美国妇产科专业医生组成的专业协会,近期提议对现有指南进行变革,旨在开始“精心定制产前护理”(Peahlet al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib1))。这些指南称为PATH(个性化适当医疗保健计划),主要针对(a)解决未满足的社会需求以及(b)纳入替代护理模式,以帮助为患者定制计划,并为更多分娩者提供产前保健。PATH是在对110名患者、临床医生和政策制定者(代表25个组织和超过75个诊所)进行访谈后精心设计的。

采用PATH对患者和临床医生来说都是一项复杂任务(图1(a) (https://arxiv.org/html/2607.24768#S1.F1.sf1))。对于有未满足社会需求的患者,增加与孕产保健专业人员的产前就诊次数不太可能解决根本需求,反而可能造成额外负担(Peahlet al\.,2021b (https://arxiv.org/html/2607.24768#bib.bib7))。此外,要求医生和其他医疗专业人员利用不足的资源来解决患者未满足的社会需求,这已与职业倦怠相关(Tabata\-Kellyet al\.,2024 (https://arxiv.org/html/2607.24768#bib.bib14))。

我们建议通过创建一个基于对话式AI智能体的界面——**PATHFinder Agent**来帮助缓解这些挑战,该界面能够(a)提出需要医学和对话知识的追问与澄清问题,(b)通过工具调用执行操作(搜索资源、生成报告等),以及(c)遵循指令提供全面的计划。我们进一步努力避免意外行为,确保监督与基础依据,并测试部署可行性,正如最先进的医疗系统如g-AMIE所呼吁的那样(Vedadiet al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib20))。我们预计**PATHFinder Agent**有潜力支持PATH指南的广泛部署,从而改善妊娠和分娩个体的健康与福祉。

参见标题(a)当前实践涉及与患者进行复杂、不连贯的对话以提供产前护理。
参见标题(b)通过配备最新指南和基础资源的**PATHFinder Agent**进行集中、可扩展的对话。

图1. 当前实践(左)与我们提出的解决方案(右)的示意图

## 2. 背景

我们从文献中确定了三个特别有助于我们塑造系统的关键领域。

#### 产前保健

超过80%的不良妊娠结局可以通过基本的产前护理和管理未满足的社会需求来预防(Troset al\.,2022 (https://arxiv.org/html/2607.24768#bib.bib2))。然而,传统的12-14次面对面就诊模式(Kilpatricket al\.,2017 (https://arxiv.org/html/2607.24768#bib.bib3))常常因健康的社会驱动因素——如住房不稳定和灵活的工作时间安排(Semegaet al\.,2021 (https://arxiv.org/html/2607.24768#bib.bib4); National Academies of Sciences, Engineering, and Medicine,2019 (https://arxiv.org/html/2607.24768#bib.bib5))——而难以实现,导致许多患者服务不足,甚至感到不被倾听(Belleroseet al\.,2022 (https://arxiv.org/html/2607.24768#bib.bib6); Betronet al\.,2018 (https://arxiv.org/html/2607.24768#bib.bib33); Mohamoudet al\.,2023 (https://arxiv.org/html/2607.24768#bib.bib34))。作为回应,ACOG制定了妊娠期个性化适当医疗保健计划(PATH)(Peahlet al\.,2021b (https://arxiv.org/html/2607.24768#bib.bib7)),该计划利用共同决策,通过灵活的就诊频率(Peahlet al\.,2020a (https://arxiv.org/html/2607.24768#bib.bib35); Turrentine,2023 (https://arxiv.org/html/2607.24768#bib.bib36); Balket al\.,2023a (https://arxiv.org/html/2607.24768#bib.bib37))和远程医疗模式(Balket al\.,2023b (https://arxiv.org/html/2607.24768#bib.bib38))等来定制护理。尽管有潜力,但在复杂的医疗保健系统中有效实施PATH仍存在差距(Nijagalet al\.,2021 (https://arxiv.org/html/2607.24768#bib.bib39)),而考虑患者偏好将至关重要(Peahlet al\.,2021a (https://arxiv.org/html/2607.24768#bib.bib40),2020b (https://arxiv.org/html/2607.24768#bib.bib41))。

#### 医疗智能体

Gemini、AMIE(Saabet al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib21); Palepuet al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib22); Vedadiet al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib20); Johriet al\.,2024 (https://arxiv.org/html/2607.24768#bib.bib28))和MedAgentBench(Jianget al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib27))专注于电子健康记录,而MedAgentGym则专注于医学中以编程为中心的智能体任务(Xuet al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib19))。这些系统并不关注整合领域特定需求(如产前护理)和领域无关需求(如安全措施)。

#### 工具使用与对话系统

为了利用此类医疗智能体支持患者和提供者实施PATH,我们借鉴了智能体必须提出澄清性问题并遵循指令以实现用户目标的工作,以及智能体需要调用外部工具的工作。诸如(Qinet al\.,2023 (https://arxiv.org/html/2607.24768#bib.bib23); Patilet al\.,2023 (https://arxiv.org/html/2607.24768#bib.bib29))等研究探讨了LLM在数学推理、程序合成和通用任务中调用特定“工具”来解决问题的能力。LLM可以通过生成预期格式的令牌来决定调用工具,这使它们能够通过递归调用工具来自主导航。结合ReACT(推理与行动)(Yaoet al\.,2022 (https://arxiv.org/html/2607.24768#bib.bib30))等策略的指令调优LLM已经展现出近乎完美的准确调用工具的能力。另一方面,研究人员也研究了人与自动评估对话模型(Güret al\.,2018 (https://arxiv.org/html/2607.24768#bib.bib24))之间的任务导向对话(Budzianowskiet al\.,2018 (https://arxiv.org/html/2607.24768#bib.bib25); Chenet al\.,2021 (https://arxiv.org/html/2607.24768#bib.bib26))。后续工作(Yaoet al\.,2024 (https://arxiv.org/html/2607.24768#bib.bib15); Luet al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib18); Barreset al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib16); Patilet al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib17))通过人与智能体之间的多轮交互,更接近实际应用。

## 3. PATHFinder Agent:系统设计

参见标题图2. PATHFinder界面。PATHFinder Agent具有四阶段流程:1) 患者信息录入(标准化表单),2) LLM生成的UI用于结构化、开放式对话,3) 草稿报告审查和患者澄清,以及4) 提供护理过程中的临床医生审查。

### 3.1. 问题陈述

给定患者的医疗特征和社会背景,**PATHFinder Agent**必须:(i) 通过结构化、开放式对话收集相关信息,(ii) 依据指定指南制定个性化产前护理计划,以及 (iii) 呈现与识别出的社会需求相匹配的密歇根211社区资源——同时实现持续的临床医生审查与监督(图3 (https://arxiv.org/html/2607.24768#S3.F3) 展示了工作流程)。

### 3.2. 目标与要求

核心设计要求包括:界面和问题流程应模拟现有的临床录入过程;具有针对性的、非冗余的追问问题,以及一种交互模式,可在高效捕获数据的同时防止患者在长时间会话中感到疲劳。

### 3.3. 设计

#### 团队。

PATHFinder由一名获得委员会认证的妇产科医生兼认证助产护士(CNM)与两名计算机科学家共同设计,确保临床和技术需求得到联合验证。

表1. 智能体工具集(4个类别共13个工具)。

#### 工具与编排。

该智能体配备了4个类别的13个工具(表1 (https://arxiv.org/html/2607.24768#S3.T1))。医疗工具包括TOLAC(剖宫产后试产)计算器和一个结构化的转诊至临床医生操作。资源工具实现了一个层级化的密歇根211查询接口。个性化工具会咨询一个辅助LLM以生成上下文感知的后续问题。报告工具逐步构建面向患者和临床医生的摘要。系统指令约包含14,000个令牌,包括领域知识(来自ACOG指南(Peahlet al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib1)))、工具使用说明、工作流程和安全策略,智能体通过检索这些知识和指令来编排对话。

#### 社会需求资源数据。

我们使用密歇根211[^1]的数据,这些数据按类别(食品、住房、交通、公用事业、衣物)组织,并可通过专用的工具调用按子类别和邮政编码进行查询。

[^1]: https://mi211.org

#### 界面设计。

PATHFinder Agent支持通过“表单+聊天界面”进行交互,患者首先完成一个模拟当前临床流程的标准化信息录入表单;然后智能体过渡到自适应对话阶段,提出个性化的后续问题,期间另一个LLM会审查这些问题并生成一个基于表单的界面供用户交互,该界面支持按钮、复选框和开关,以减少用户输入的文本(见图4(b) (https://arxiv.org/html/2607.24768#S3.F4.sf2))。基于所有可用的用户信息和指南(Peahlet al\.,2025 (https://arxiv.org/html/2607.24768#bib.bib1)),会生成适当的报告和时间表供临床医生审查,患者也可以查看并澄清内容。同样,智能体可供临床医生根据需要编辑报告。

参见标题图3. 系统架构。React前端与FastAPI后端通信,后端路由到PATHFinder Agent智能体(LLM + 工具执行器)、监督分类器、FHIR服务和报告生成器。对话状态持久化存储在关系型数据库中。

#### 工作流程。

端到端工作流程包含四个阶段。**阶段1(信息录入)**:患者填写标准化表单,包括人口统计学信息、病史、孕龄和社会因素(图4(a) (https://arxiv.org/html/2607.24768#S3.F4.sf1))。**阶段2(动态交互)**:根据回答和指南,智能体提出个性化的后续问题以引出未满足的社会需求、偏好和障碍,并使用表1 (https://arxiv.org/html/2607.24768#S3.T1) 中的工具来制定计划(图4(b) (https://arxiv.org/html/2607.24768#S3.F4.sf2))。**阶段3(计划合成)**:智能体调用报告工具生成面向患者的摘要、临床摘要、就诊时间表建议以及精心挑选的密歇根211资源(图4(c) (https://arxiv.org/html/2607.24768#S3.F4.sf3))。**阶段4(临床医生审核)**:临床医生审查计划,能够批准或编辑(图4(d) (https://arxiv.org/html/2607.24768#S3.F4.sf4))。

参见标题(a)患者信息录入表单(阶段1)。
参见标题(b)LLM生成中间UI进行动态交互。
参见标题(c)患者草稿报告审查与澄清(阶段3)。
参见标题(d)临床医生监督与审查(阶段4)。

图4. PATHFinder Agent界面。(a) 结构化患者信息录入表单;(b) PATHFinder Agent询问用户以了解额外的病史细节和社会健康决定因素;(c) 患者审查草稿报告以确保透明度和澄清;(d) 临床医生监督仪表板,显示对话阶段、风险标志和上报控制。

### 3.4. 临床医生监督

一旦生成草稿计划,临床医生将审查患者摘要、报告和时间表,以进行验证,并根据额外的对话和关注点进行更改。我们强调,这一工作流程可能使临床医生能够更好地解决关注问题,并在参与产前护理规划和计划验证的同时为患者提供护理。

### 3.5. 评估

我们在涵盖多种医疗史(例如,高危妊娠、TOLAC候选者)的合成患者档案上评估PATHFinder Agent。每个档案都配有专家制定的评估准则,详细说明了以下维度的期望:1) 正确的就诊频率,2) 正确的服务(检测、建议等),3) 产前检测的时间安排,4) 生长超声检查的时间安排,以及5) 护理模式(必须面对面、面对面与团体健康相结合等)。

我们采用LLM作为评判的评分方式,以衡量前沿模型在五个维度上的建议表现,最终每个条件的分数归一化为1。表5 (https://arxiv.org/html/2607.24768#S3.T5) ...

相似文章

与 Penda Health 一起开创医疗 AI 副驾驶

OpenAI Blog

OpenAI 与肯尼亚 Penda Health 合作研究了一个由大语言模型驱动的临床助手 AI Consult,在 39,849 次患者就诊中诊断错误相对降低 16%,治疗错误相对降低 13%。该研究突出了 AI 在初级保健中的成功真实应用,并为 LLM 安全有效地部署以支持临床医生提供了模板。