生成上下文与受控状态:可问责纵向临床推理的功能条件
摘要
本文在临床AI中区分了生成上下文与受控状态,论证了可问责的纵向推理需要一个受控的患者状态表示,并提出了一个分层治理标准和成熟度框架。
arXiv:2608.14804v1 公告类型:新
摘要:大型语言模型(LLMs)已成为临床人工智能的主导接口,但它们暴露的接口(文本输入,文本输出,一次一个上下文窗口)没有维护一个明确的、持久的、受控的关于患者当前真实状态的表示。本文论证了纵向临床推理是一个在部分可观察性下的状态估计问题,并且临床AI成功或失败的关键不是模型读取记录的流畅性,而是它推理所依据的患者状态的治理。我们区分了生成上下文与受控状态;分离了临床AI习惯性混淆的五个对象(真实状态、观测、证据、信念和模拟状态);定义了一个分层治理标准,任何临床AI系统都可以根据此标准进行审计;并展示了问责制的操作定义分解为四个信息需求:一个具有意识时间版本控制的不可变证据账本、一个与累积证据不同的信念状态、一个观测过程模型,以及主张级别的因果类型化。我们明确指出,这种分解是分析性的,而非必然性定理,其价值在于概念卫生:它将‘可问责的临床AI’从口号转变为审计工具。一个六级成熟度框架分离了系统使什么可治理与其能计算什么,将当前以LLM为中心的实践定位为高能力但低成熟度。本文完全自包含:框架提出的四个研究问题在引言中陈述,结论记录了本文对每个问题的贡献;未来工作开发了架构的可构建核心以及朝向完整临床世界模型的研究计划。此处未声称任何实证结果。
查看缓存全文
缓存时间: 2026/08/18 10:09
# 生成式上下文与受控状态:可问责纵向临床推理的功能条件 来源:https://arxiv.org/html/2608.14804 ## 生成式上下文与受控状态:可问责纵向临床推理的功能条件 致谢:MyndwareMed 为医疗保健组织构建受控的临床状态基础设施。该工作中定义的证据层(成熟度等级3)已在生产环境中运行;信念层(等级4)处于工程化阶段,而完整的临床世界模型(等级5)则处于研究阶段。https://www.myndwaremed.com/ 维克多·洛雷娜·德法里亚斯·索萨 致谢:[email protected] 隶属机构:MyndwareMed 2026年8月 ###### 摘要 大型语言模型已成为临床人工智能的主要交互界面,但其暴露的接口——文本输入、文本输出、一次一个上下文窗口——并未维护任何关于患者当前真实状况的显式、持久、受控的表示。本文认为,纵向临床推理是在部分可观察性下的状态估计问题,而临床人工智能成败的关键维度并非模型解读病历的流畅度,而是其所推理的患者状态的*治理*能力。我们区分了生成式上下文与受控状态;分离了临床AI习惯性混为一谈的五种对象(真实状态、观测、证据、信念和模拟状态);定义了一个分层治理标准,可用于审计任何临床AI系统;并论证了可问责性的操作性定义可分解为四个信息需求——一个具有感知时间版本控制的不可变证据账本、一个区别于累积证据的信念状态、一个观测过程模型以及一个声明级别的因果类型划分。我们明确指出,这种分解是分析性的,而非必要性定理,其价值在于概念净化:它将“可问责的临床AI”从一个口号转变为审计工具。一个六级成熟度框架区分了系统可使其可治理的对象与其可计算的对象,将当前以LLM为中心的实践定位在高能力但低成熟度。本文完全自包含:框架提出的四个研究问题在引言中阐明,结论部分记录了本文在每个问题上所建立的内容;未来工作将开发架构的可构建核心以及朝向完整临床世界模型的研究路径。本文未声称任何实证结果。 ## 1 引言 六十年来,临床信息系统存储的是关于患者的文档,而非患者本身的状态。纸质病历变成了扫描病历;扫描病历变成了结构化文档;部门记录变成了临床文档架构交换,随后又变成了快速医疗互操作资源包。每一代技术都使临床文档更易于创建、交换和显示——而重建“患者当前真实状况”这项工作,却始终停留在阅读病历者的头脑中。大型语言模型是第一批足够流畅以按需执行这种重建的技术,而其流畅性使得人们容易将按需重建误解为标准LLM中心架构本身并未固有的某种东西:一个显式的、可问责的、持续受控的患者表示。这种误解及其架构层面的解决方案,正是本文的主题。 在过去的三年里,临床人工智能几乎等同于大型语言模型。医院、支付方和技术供应商现在通过通用模型处理文档、摘要、编码辅助和部分决策支持,最常见的是基于检索增强的底层架构。生产力提升是真实的,本文对此并无异议。但语言模型所暴露的接口无法保证对个体生理当前真实状况的持久理解,缺乏该真实状况如何变化的版本化记录,也缺乏区分观测事实与推断事实、或证据缺失与反面证据的固有机制。无论此类模型内部可能学到何种潜在结构,这些结构均未作为可查询、可审计、可纠正或可治理的对象暴露给医院。 我们需要精确说明本文论点的反常识程度与非反常识之处。它并非主张应弃用语言模型,也不是说神经网络表示是问题所在——我们下文承认语言模型可以被受控的外部记忆包裹,而真正的对比是生成式上下文与受控状态,而非神经网络与符号主义。实际的主张更为狭窄,我们认为也更为锐利:对患者状态的治理——而非模型解读它的流畅度——才是可问责纵向临床推理成败的关键维度。 一个重构方式组织了下文所有内容,我们在此阐明,而非让其到第八页才浮现:对纵向病历的临床推理是部分可观察性下的状态估计问题——其性质更接近机器人学、计量经济学或流行病学建模,而非摘要生成——恰好主要以自然语言记录。患者的真实状态从未被完全掌握;医疗过程有选择性地观测它;系统根据留存的证据形成和修正信念。一旦从这个角度看问题,关键就不再是哪个模型读病历最好,而是哪个制品扮演了估计器的状态角色——而当前实践的缺陷在于没有任何受控制品扮演此角色。用一句话概括:当前临床AI研究正日益学习患者动态;本文探讨的是另一个问题——临床AI系统必须维护什么状态,才能使其纵向推理可重构、可纠正、可审计,并能安全地与模拟分离?本文所有内容都围绕这个核心问题展开。 #### 研究问题 流畅性现已充足;受控临床状态则不然——两者之间的差距正是使该框架具有实证意义而非修辞性意义的原因。由此引出四个研究问题,在此提出以便读者从一开始就知道本文试图建立什么;结论部分记录了本文在每个问题上取得的进展,以及接下来需要回答的问题。 **RQ1**:一个维护持久、受控患者状态的架构,是否比长上下文或检索基线,能更一致地、以更好溯源支持回答关于患者当前和历史状态的问题? **RQ2**:基于受控时间证据推导的受控信念状态的动态模型,是否比对原始记录的下一个事件序列建模,能更好地预测多时间跨度的临床结果? **RQ3**:一个确定性验证器是否能在不显著降低敏感性的情况下,实质性地减少临床上不可能的输出? **RQ4**:对生成临床观测的过程进行建模,是否能恢复当模型跨机构迁移时损失的相当一部分性能? #### 贡献 本文有三大贡献。第一,精确阐述了LLM中心临床系统的缺陷:并非一般的表示问题,而是状态的具体治理特性,这些特性被组织成一个分层审计标准(第3节)。第二,提供了一套词汇表,将临床AI习惯性混为一谈的五种对象区分开来,并为断言和缺失制定了认识类型规则(第4节)。第三,给出了可问责性的操作性定义及其分解为四个信息需求的说明,诚实地阐述了该分解的逻辑性质,并提出了一个六级成熟度框架,将表示成熟度与计算能力区分开来(第6-7节)。本文是自包含的:它在自身条件下是一篇完整的概念和架构贡献,无需配套阅读材料即可评估。未来工作将开发可构建的核心——证据账本的完整规范、操作性信念状态和受控更新算子及其在人群规模上的可实现性——以及朝向完整临床世界模型的研究计划:观测过程模型、因果限定、条件动作动态和隔离模拟。本文所有内容均为规范和论证;未声称任何实证或临床结果。 ## 2 背景:临床AI现状 通用大型语言模型编码了大量的医学知识——经过指令微调的模型在执照考试风格的问答上接近专家水平性能,其应用涵盖文档记录、分诊和决策支持——并且基于下一个token预测训练的模型显然学到了超越表面统计的内部表示。本文的一切论述均不否认这一点。基准测试未能确立的是,一个能很好回答医学问题的模型,因此就能在多年的文档记录中维护一个关于特定患者的一致、可审计的表示:高考试分数陈述的是模型对医学文本的边际分布能力,而非其以任何人都可检查的形式,追踪两份冲突的药物清单中哪一份是当前的、以及谁记录了每一份的能力。 检索增强生成基于特定病历而非训练分布来支持答案,许多临床AI产品都建立在此基础之上;智能体框架链接调用并添加工具和记忆。但检索是对文档存储的搜索操作,而非基于患者模型的状态估计,链中的每个智能体仍然在短暂上下文上推理,而非在一个共享的、受控的状态对象上推理——链接语言模型本身并不产生状态机,尽管可以构建一个受控状态机并让语言模型在其上操作。智能体前沿实际上已在知识层面向此方向发展:Agents-K1用智能体原生的知识基底替代了扁平检索——科学语料库被转换为结构化图谱,保留了实体、声明、证据和来源以支持多跳推理。这一趋势支持了本文的论点,但也恰好标示了其不足之处:一个基于文档的声明和证据图谱治理的是文献*所述内容*;它并非关于一个演变中个体患者的信念状态,也不包含纵向临床问责所需的多元时间、修正或模拟规范。与此同时,临床决策支持从早期时代就设定了一个具有启发性的可信度标准:基于规则的警报可以逐行追溯到产生它的指南,并且在不同监管体系下,解释推荐的能力显著降低了部署难度。纯粹的生成式系统默认情况下并未达到这一标准——本文将其作为治理属性而非能力主张来阐述。 自回归语言模型被训练来估计 P\(ti∣t1,t2,...,ti−1\)\.P\(t\_\{i\}\\mid t\_\{1\},t\_\{2\},\\ldots,t\_\{i\-1\}\)\.\(1\) 通常从公式(1)中得出两个推断,但只有一个有效。无效的推断是认为此类模型不包含状态、转换或持久性的表示——训练目标约束的是接口,而非内部解决方案。有效的推断涉及接口本身:模型在推理时关于特定患者的所有知识都通过一个短暂的上下文窗口进入,并以生成文本的形式离开。无论在向前传播中形成的潜在患者表示是什么,它都没有在调用后存活的身份,没有第二个系统可以查询的地址,没有版本历史,没有审计员可以检查的语义,也没有区分修正与矛盾的更新规则。*表示可能存在;但对象不存在。*可问责的纵向临床推理需要的是这个对象。 以最强可辩护的形式阐述该论点:标准自回归语言模型架构并未提供一个可外部寻址、持久、版本化且临床受控的患者状态对象,其不变量无法被独立验证。图1展示了两种状态;相同的神经网络机制可能参与其中,这正是差异必须定位在对象而非网络的原因。受控状态所保证的属性是具体的工程要求:*身份*(每个患者一个规范状态对象,可稳定寻址);*持久性*(通过设计在调用、会话、诊疗、跨年间存活);*显式语义*(本体绑定、单位、值集);*更新治理*(通过定义的算子进行写入,包含谁可以断言、修正或取代的规则);*来源*(每个元素可追溯至产生它的证据);*可检查性*;*确定性约束*;*校准*;*回滚与修正*;以及*历史查询*(“在感知时间τ,关于临床时间t,我们相信什么,为什么?”)。 我们将这些属性视为规范性工程标准,而非必要和充分条件,并将它们——连同每个更高层级引入的额外需求——组织成与风险等级匹配的分层体系;定义1阐述了该分层,表1规范了其需求。 > ###### 定义1(受控临床状态,分层) > *核心*受控状态要求身份、持久性、显式语义、来源、更新治理和历史查询——这是其他组件视其为患者权威信息的任何表示的最低要求。 > *安全关键*受控状态额外要求确定性约束验证、修正传播和显式不确定性表示——在状态为临床决策提供依据的任何地方都需要。 > *预测性*受控状态额外要求结果校准、模型版本绑定以及在分布偏移下的监控有效性——在状态包含预测或模拟的任何地方都需要。 > 该定义与架构无关:它不要求表示是*符号的*(以显式、人类可读单元持有并声明语义的结构——图谱、规则、本体绑定断言)、*神经的*(以学习的连续参数和激活持有的结构)或*混合的*(两者的组合,并在它们之间定义接口)——只要求该层级的属性得以保持。
相似文章
治理行动,而非智能体:将机构认证作为自主AI系统的治理模型
本文提出了一种基于机构认证的自主AI智能体治理模型,其中行动通过独立认证的证据进行治理,而非监控智能体推理。该模型通过概念验证实现进行了形式化,适用于临床处方和软件部署等高风险行动。
从消费到反思:设计人机关系以实现稳定推理
本文引入了关系反思智能(RRI),这是一个推理时治理层,通过可审计的推理循环来稳定人机推理,解决了人类和大语言模型共有的认知弱点。
评估检索增强生成与长上下文输入在电子健康记录临床推理中的比较
本文评估了检索增强生成(RAG)与长上下文提示在电子健康记录临床推理任务中的表现,发现RAG在令牌效率上具有竞争力,尤其在影像提取和抗生素时间线重建方面表现突出。
长期运行的AI代理可能面临比记忆更大的连续性问题
反思了长期运行的AI代理所面临的连续性问题,认为需要确定性控制层来管理权威状态,并质疑现有的IAM、事务和溯源等基础设施是否足够。
面向可控医疗AI技能生态系统的临床管控框架
本文提出了临床管控框架,一种用于注册、编排、保护和监控AI赋能临床能力的运行时治理架构,并以骨质疏松症为例进行演示。