动态双向模式记忆:临床NLP中推理时门控的生产规模实证刻画
摘要
本文对使用Llama和MMed-Llama模型的生产规模临床NLP流水线中的推理时门控进行了实证研究,表明从验证器拒绝中学习过滤规则在大规模下会失败,而基于本体和证据测试的过滤器是有效的。
arXiv:2607.00870v1 Announce Type: new
摘要:我们在生产规模的临床自然语言处理(NLP)流水线中研究了推理时模式记忆门控。该流水线将生成器(Llama-3.3 70B)提出的提取与验证器(MMed-Llama-3.1 70B)的接受或拒绝配对,覆盖167,034篇PMC-Patients叙述,并添加了一个轻量记忆,该记忆在部署时学习哪些提取需要过滤,从而使验证器无需重新检查已确认失败的候选。我们报告了四个发现。第一,直接从验证器的拒绝中学习过滤规则在大规模下失败:关系提取过滤器始终为空,尽管记录了785,797次拒绝,因为它们分布过于分散,跨越太多不同的形式而无法累积。第二,使用固定临床本体的更简单规则无需验证器即可产生相同的过滤,在保留的5,000患者集上捕获了49,734个违反本体的关系。第三,在五个版本的问答过滤器中,有四个因不同且有启发性的原因失败;第五个通过检查患者的提取实体是否支持所问问题而成功,在其适用的情况下,标记验证器会拒绝的答案的可能性是标记其会接受的答案的1.84倍。第四,所有五个过滤器有一个共同模式:过滤器仅在测试验证器所衡量的相同证据时才有选择性,而非在模仿验证器的输出时。综合起来,这为任何生成器-验证器流水线提供了一个可迁移的结果:最自然的记忆设计可能会在大规模下悄然失败,而预生成门控是否具有选择性,早在任何工程努力之前就已由它的信号是否探测验证器自身回答的问题所决定。在整个过程中,系统标记可疑提取而非删除它们,因此每个决策对临床审查保持可见。所有代码和测试工件均已公开。
查看缓存全文
缓存时间: 2026/07/02 05:38
# 推理时门控的生产规模经验特征——以临床自然语言处理为例
来源:https://arxiv.org/html/2607.00870 \\tnotemark \[1\]\\tnotetext\[1\]本研究由伊拉克高等教育与科学研究部资助,并在Supercomputing Wales Falcon(SCWF00175)平台上进行。\[type=editor, role=通讯作者, orcid=0000-0002-8677-9689\]\\cormark\[1\]\\credit概念化、方法论、软件、验证、形式分析、研究、数据整理、初稿撰写、审阅与编辑、可视化 \[role=合著作者, orcid=0000-0003-3640-6750\]\\credit概念化、方法论、监督、审阅与编辑、项目管理 \[1\]organization=班戈大学计算机科学与工程学院, addressline=班戈, 格温内思郡, 邮政编码=LL57 2DG, country=英国 \[2\]organization=济加尔大学, addressline=纳西里耶, 邮政编码=64001, country=伊拉克 \\cortext \[cor1\]通讯作者
## 动态双向模式记忆:临床自然语言处理中推理时门控的生产规模经验特征
###### 摘要
我们研究了一个生产级临床自然语言处理(NLP)流水线中的推理时模式记忆门控。该流水线将提出提取内容的生成器(Llama-3.3 70B)与接受或拒绝这些内容的验证器(MMed-Llama-3.1 70B)配对,处理了167,034篇PMC-Patients叙事文本。我们增加了一个轻量级记忆,它在部署时学习哪些提取内容需要过滤,从而使验证器无需重新检查已经见过失败候选。我们报告了四个发现。第一,直接从验证器的拒绝中学习这些过滤规则在全规模下并不奏效:尽管流水线记录了785,797个被拒绝的候选,关系提取过滤器最终仍然为空,因为拒绝分布过于分散,涉及太多不同形式,无法累积。第二,基于固定临床本体的更简单规则完全无需依赖验证器就能实现相同的过滤效果,在一个保留的5,000名患者数据集上捕获了49,734个违反本体的关系。第三,我们测试了五种版本的问答过滤器;其中四种因不同且具有启发性的原因失败,第五种通过检查患者提取的临床实体是否实际支持所问问题而成功;在其适用的类别上,它标记出验证器会拒绝的答案的可能性,是标记出验证器会接受的答案的1.84倍。第四,在所有五个版本中,一个模式是一致的:只有当过滤器测试与验证器自身权衡的相同证据时,它才具有选择性,而不是试图模仿验证器的输出。综合这些发现,为任何生成器-验证器流水线提供了一个实用且可迁移的结果:最自然的记忆设计可能在部署规模下无声地失效,而预生成门控是否具有选择性,在投入任何工程努力之前,由其信号是否探测验证器自身回答的问题来决定。在整个过程中,系统标记可疑提取内容而非删除它们,因此每个决策对临床审查仍然可见。所有代码和测试工件均已公开。
###### 关键词:多智能体模式记忆\\sep推理时门控\\sep临床自然语言处理\\sep大语言模型验证\\sep生成器-验证器架构
## 1 引言
大语言模型已彻底改变了临床自然语言处理,使得以先前基于规则或微调分类器流水线无法达到的规模,从临床叙事文本中提取命名实体、关系和问答对成为可能。越来越多的研究工作将生成器模型与验证器模型配对,后者对生成器的输出进行评分或接受(Madaan et al., 2023 (https://arxiv.org/html/2607.00870#bib.bib17); Shinn et al., 2023 (https://arxiv.org/html/2607.00870#bib.bib24); Yao et al., 2023 (https://arxiv.org/html/2607.00870#bib.bib35)),在指令微调和检索之外增加了推理时正确性检查。这种模式在临床环境中颇具吸引力,因为未经验证的提取可能会将事实错误带入患者记录。然而,在临床信息学语料库的规模下,处理数十万篇叙事文本而无需模型重训练时,推理时验证成为主要的计算开销。这促使了一种机制的出现:避免对那些流水线实际上已经见过失败的候选调用验证器——一种推理时记忆,它在流水线运行时积累验证证据,并据此门控未来的候选,而无需重训练任一模型。这种记忆的设计空间很大,但哪些选择实际上能产生*选择性*门控——即标记出验证器会拒绝的候选,同时保留验证器会接受的候选——尚未确定。一种记忆可以被配置好,但在部署规模下仍然保持经验上的失活;一种门控信号可以很复杂,但仍然无法区分验证器所区分的候选。因此,核心开放问题不是如何构建这样的记忆,而是哪些信号源使其门控具有选择性,哪些则不能。
本文通过设计、部署和经验特征化动态双向模式记忆(DBPM)来解决这个问题。DBPM是一种推理时模式记忆,嵌入在一个多智能体临床NLP流水线中。该流水线使用Llama-3.3 70B作为生成器、MMed-Llama-3.1 70B(Qiu et al., 2024 (https://arxiv.org/html/2607.00870#bib.bib20))作为验证器,处理167,034名患者的PMC-Patients语料库(Zhao et al., 2023 (https://arxiv.org/html/2607.00870#bib.bib37))。DBPM消耗验证器的判决流,并在三个流水线阶段(命名实体识别、关系提取、以及带推理的问答)门控生成器的未来候选,不修改任一模型的参数。我们在生产规模下特征化其行为,在此规模下,基准评估无法揭示的失败模式变得可见。该特征化揭示了一个单一的结构规律,贯穿全文:预生成门控信号仅当直接测试验证器自身权衡的相同证据时,才对验证器拒绝具有选择性。一个探测不同量的信号,无论其聚合多么复杂,都无法区分验证器所区分的候选。该规律具有实用性:实践者可以通过询问该信号是否探测验证器回答的相同问题来评估候选信号源,然后再投入工程努力。它源于对五个门控信号源的受控剖析,其中四个未能产生选择性门控,一个成功;并且它与另一个关于这种记忆如何在大规模下填充的独立发现相一致。
### 贡献
本文做出四项贡献,统一于一个核心问题:在临床生产流水线中,是什么使得推理时模式记忆门控具有选择性。
#### (C1) 生产规模证据表明自然的验证器馈送设计会失败。
最自然的设计——按候选类型积累验证器自身的拒绝,并根据累积证据进行门控——在167,034名患者的规模下无法填充:关系提取阻止列表即使记录了数十万次拒绝事件也仍然为空。我们表明原因是结构性的:证据积累、时间衰减和在分散而非集中的拒绝流下的剪枝之间的相互作用,并且这适用于任何在自由形式LLM输出上积累统计量的推理时记忆。
#### (C2) 同一通道的、可工作的、不依赖验证器的信号源。
用确定性本体违反谓词(将自由形式关系标签映射到有界的规范空间)替换分散的验证器馈送信号,会在下游同一门控处填充,而验证器馈送路径则未能填充。决定通道是否填充的是信号源,而非持久化机制。
#### (C3) 对门控信号选择性的五源经验剖析。
我们测试了问答门控的五种不同信号源。四种未能产生选择性门控,每种都有各自结构上不同的原因——聚合级别不匹配、信号缺失、计数不对称、跨任务正交性——而一种成功。该剖析隔离了每个失败发生的原因,而不仅仅是报告有效设计。
#### (C4) 选择性推理时门控的结构规律。
成功的信号源是那种测试患者提取的临床实体是否支持所问问题的信号源,这正是验证器隐式解决的相同基础问题。在五个源中,选择性追踪这一对齐,而非其他任何因素,从而将上述规律作为一种经验性、可操作化的门控设计指南,适用于任何生成器-验证器架构。我们在一种测量仪器化的纪律下部署和测量DBPM,该纪律标记可疑候选而非删除它们,因此每个门控决策对临床审查仍然可见,并且我们披露了选择性门控适用的运行包络界限。所有门控代码和评估工件均已公开。
### 论文组织
第2节(https://arxiv.org/html/2607.00870#S2)将DBPM定位于相关工作。第3节(https://arxiv.org/html/2607.00870#S3)形式化了多智能体流水线和推理时记忆问题,并定义了记忆键控的候选签名。第4节(https://arxiv.org/html/2607.00870#S4)详细说明DBPM的设计,包括早期促使该设计的设计决策、持久化层、三层门控、本体违反信号源,以及为问答门控评估的五种门控信号源。第5节(https://arxiv.org/html/2607.00870#S5)描述实验设置和分层的5,000名患者评估队列。第6节(https://arxiv.org/html/2607.00870#S6)报告经验发现,从生产规模下验证器馈送通道的失败,到信号源剖析及其每个类别的运行包络。第7节(https://arxiv.org/html/2607.00870#S7)综合结构规律及其临床意义;第8节(https://arxiv.org/html/2607.00870#S8)披露运行包络和构造重叠界限;第9节(https://arxiv.org/html/2607.00870#S9)将模式闭包、数据集质量评估和保留验证确定为未来工作。第10节(https://arxiv.org/html/2607.00870#S10)总结。
## 2 相关工作
DBPM处于现代NLP和机器学习中七个研究线索的交汇处。我们将其定位于每个线索中最接近的邻居,在机制、部署范围以及框架明确*不*做什么方面进行区分。
### 2.1 多智能体流水线与验证器驱动的生成
生成器-验证器分离支撑了近期许多关于LLM可靠性的推理时工作。Self-Refine(Madaan et al., 2023 (https://arxiv.org/html/2607.00870#bib.bib17))使用同一个LLM在单个输入上进行多次自我迭代,生成、批评并精炼输出。Reflexion(Shinn et al., 2023 (https://arxiv.org/html/2607.00870#bib.bib24))扩展了这一思想,将口头自我反思持久化到试验之间的情景记忆缓冲区中,通过语言反馈而非梯度更新来强化智能体。ReAct(Yao et al., 2023 (https://arxiv.org/html/2607.00870#bib.bib35))在单条轨迹中交织推理轨迹与工具使用动作。AutoGen(Wu et al., 2024 (https://arxiv.org/html/2607.00870#bib.bib33))和MetaGPT(Hong et al., 2024 (https://arxiv.org/html/2607.00870#bib.bib10))将验证器-生成器分离分别视为具有角色专业化和标准化操作程序的多智能体对话。Generative Agents(Park et al., 2023 (https://arxiv.org/html/2607.00870#bib.bib19))将记忆轨迹概念扩展到长期运行的交互模拟。LLM-as-a-judge框架(Zheng et al., 2023 (https://arxiv.org/html/2607.00870#bib.bib38))系统化了使用强LLM作为较弱生成器的评估器。
这些系统与DBPM共享一个原则:推理时的批评者可以在不重训练的情况下提高输出质量。它们在两个结构方面与DBPM不同。第一,除了Reflexion的情景缓冲区外,这些系统中的批评者状态要么不跨输入持久化(Self-Refine,ReAct),要么持久化为自然语言反思,生成器每次调用都必须重新解释(Reflexion)。DBPM将关于候选签名的分类证据持久化到一个结构化存储中,由门控在决策时查询,具有摊销的O(1)\mathcal{O}(1)查找:门控查询简化为对预计算的任务级阻止、降级和白名单索引的哈希集成员检查,写操作则是基于签名键控的原位字典更新。这是作为设计约束C1(第3.3节 (https://arxiv.org/html/2607.00870#S3.SS3))所要求的,并在附录A.1 (https://arxiv.org/html/2607.00870#A1.SS1)中详细说明。第二,这些系统均未发布经验证据表明自然的验证器馈送记忆设计在生产规模下会失败;DBPM做到了(第6.1节 (https://arxiv.org/html/2607.00870#S6.SS1)),从而引出了后续的独立于验证器的信号源。
### 2.2 智能体间的知识共享
多智能体系统中的一个研究线索早在LLM时代之前就形式化了合作智能体之间的结构化信息交换。Tambe的STEAM模型(Tambe, 1997 (https://arxiv.org/html/2607.00870#bib.bib26))将团队工作框架化为:智能体维护共享的联合意图,监控团队成员绩效,并在决策理论约束下选择性通信证据——这是合作智能体需要共享结构化状态而不仅仅是消息传递才能可靠协调的原则的早期操作化。Teahan和Tuff(2006 (https://arxiv.org/html/2607.00870#bib.bib28))随后提出了一个在共享环境中运行的自主智能体之间知识共享的框架,解决了候选证据应如何交换和整合的问题。DBPM为生成器-验证器设定操作化了同样的问题:生成器和验证器是两个智能体,它们共享一个在门控时查询的结构化记忆,其中验证器的判决统计由独立于验证器的本体信号补充,形成共享表示。这些早期框架提出的问题——“自主智能体应如何共享关于候选决策的证据?”——正是DBPM在现代背景下回答的问题。我们将这一脉络视为本文框架的相关先驱;我们工作的贡献在于经验特征化哪些信号源实际上在部署规模下填充了这样的共享记忆。
### 2.3 检索与记忆增强生成
检索增强生成(Lewis et al., 2020 (https://arxiv.org/html/2607.00870#bib.bib14))以及万亿级令牌的RETRO架构(Borgeaud et al., 2022 (https://arxiv.org/html/2607.00870#bib.bib3))维护一个部署时的存储,在推理时查询,但存储包含用于增强生成器输入的信息(文档、嵌入、事实块)。端到端记忆网络(Sukhbaatar et al., 2015 (https://arxiv.org/html/2607.00870#bib.bib25))、记忆增强神经网络(Santoro et al., 2016 (https://arxiv.org/html/2607.00870#bib.bib22))以及可微分相似文章
受内存限制但不限于带宽:物理AI推理中批量1的LLM解码差距
本文研究了物理AI系统中批量1的LLM解码的性能差距,发现更快的内存带宽并没有按比例减少延迟,因为启动开销的存在,并且量化效率在不同硬件间差异显著。
基于混合分析与机器学习预测器的大语言模型推理延迟与能耗多级建模
本文介绍了HYMELL,一种混合分析与机器学习框架,用于估算LLM在预填充(prefill)和解码(decode)阶段的推理延迟与能耗,并在NVIDIA H100上进行了验证,对LLaMA 3 8B的误差低于5%。
相同事实,不同更新:推理设置影响LLM在医疗分配中的行为
本文探讨了推理设置如何影响LLM在医疗资源分配中的行为,揭示了上下文依赖的偏差,并强调了谨慎将其集成到决策系统中的重要性。
深入vLLM:高吞吐量LLM推理系统剖析(2025)
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。
内存
解释了为什么由于KV缓存随上下文长度和并发用户数扩展,LLM推理越来越受内存带宽限制,以及像vLLM和PagedAttention这样的系统如何提高内存利用率。