基于部分观测目标的锥形束CT报告生成中的临床推理

arXiv cs.CL 论文

摘要

本文提出了一种用于锥形束CT报告生成的复合目标,该目标优先考虑事实蕴含而非词汇重叠,表明优化词汇指标会损害事实准确性。它发布了一个数据集和代码,并展示了一个在极性、侧别和牙齿水平一致性约束下生成受限临床报告的系统。

arXiv:2609.13238v1 公告类型:新 摘要:这里,从锥形束计算机断层扫描生成的颌面部报告通过一个复合目标进行评分,该目标将80%的权重放在大型语言模型对事实蕴含的判断上,20%放在词汇重叠上,其中只有五分之一的词汇在开发期间可见。评分器的BLEU-4和METEOR例程在纯Python中复制,并与参考实现精确匹配,而一个离线蕴含替代模型,能够以0.987的曲线下面积区分一个患者编写的报告和另一个患者编写的报告,使得复合目标足够便宜以直接优化。在622个案例的公开发布中,根据可见词汇排名选择的报告得分为0.2909,而根据复合目标选择的报告得分为0.4122,因为追求n-gram重叠会使蕴含精确度从0.522下降到0.266。一个在发布数据上微调的2900万参数编码器在985条陈述上达到了0.486的流行率加权折外曲线下面积,与语料库先验不可区分,而从图像头文件读取的九个数字在下颌骨覆盖上达到0.945,在髁突覆盖上达到0.872,并且仅采集中心就能以0.718的准确率预测句子选择,而图像衍生模型为0.663,识别出口述惯例而非解剖结构作为词汇指标奖励的量。交付的系统在极性、侧别和牙齿水平一致性约束下,发出八个无条件语句和五个基于头文件几何形状的门控语句,并在来自未见中心的50个保留案例上达到0.3542的METEOR分数。数据集和代码可在 https://github.com/GIND123/CBCT-Clinical-Reasoner 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:32

# 锥形束CT报告生成中基于部分可观测目标的临床推理
来源:https://arxiv.org/html/2609.13238
Govind Arunhttps://orcid.org/0009-0002-2573-4003Affiliation:University of Maryland, College Park, Maryland, USASidharth N Krishnahttps://orcid.org/0009-0002-4336-2477Affiliation:Indira Gandhi National Open University, New Delhi, IndiaUma Ranjanhttps://orcid.org/0000-0001-6258-4513Affiliation:Indian Institute of Technology Jammu, India

###### 摘要

本文通过复合目标评估锥形束计算机断层扫描生成的颌面部报告,该目标将80%的权重置于大型语言模型对事实蕴含关系的判断,20%置于词汇重叠度,而开发过程中仅能看到权重占五分之一的词汇重叠部分。评分器的BLEU-4和METEOR例程以纯Python代码复现,并与参考标准达到机器精度匹配。一种离线蕴含关系代理模型能够以0.987的曲线下面积区分不同患者的报告,使得复合目标的优化成本足够低廉。在622例公开数据集上,依据可见词汇排名选择的报告得分为0.2909,而依据复合目标选择的报告得分达0.4122,因为追求n-gram重叠会使蕴含关系精确度从0.522降至0.266。基于该数据集微调的2900万参数编码器,在985个陈述上达到患病率加权折外曲线下面积0.486,与语料库先验分布无显著差异;而从图像头文件读取的9个数值在颌骨覆盖评估中达0.945、髁突覆盖评估中达0.872,仅采集中心信息对句子选择的预测能力为0.718,优于基于图像模型的0.663,表明词汇度量奖励的是口述规范而非解剖特征。所交付系统包含8个无条件陈述和5个受几何头文件约束的门控陈述,在极性、侧别及牙齿层面一致性约束下,在来自未见中心的50个保留案例上达到METEOR值0.3542。数据集与代码可在https://github.com/GIND123/CBCT-Clinical-Reasoner获取。

###### 关键词:

报告生成 锥形束计算机断层扫描 约束解码 事实蕴含 目标设定偏差

## 1 引言

三维成像在牙科和颌面外科中已成为常规,但将体数据转化为手术决策的报告仍依赖人工口述。自动化该步骤现被设定为基准任务:从一份颌骨锥形束计算机断层扫描数据中,生成涵盖牙齿状况、骨质量、解剖变异、与关键结构邻近度及手术相关风险的报告\[6\]。本次发布的数据集扩展了面向分割的系列研究\[8,7\],增加配对的临床文本,将任务从解剖结构描绘转向对其事实性陈述\[20\]。

报告生成通常通过词汇相似度评估,该方法的局限性已被充分记录\[18,22\]。本文研究的基准测试通过将RadFact\[4\]等大型语言模型的事实蕴含判断权重设为BLEU-4与METEOR总和的四倍来应对这一问题,并在开发阶段隐藏该评判组件:评估平台上蕴含关系判断器被禁用,公开排名仅反映决定结果的五分之一词汇分数。参与者针对目标的投影进行调整而非目标本身,而该投影被证实具有主动误导性。

所提系统基于这一观察构建,并附以支持每个决策的测量数据。评分器被精确复现,使得完整目标可离线计算,系统选择依据完整目标而非其可见投影进行,复合得分提升0.121(第6节)。可恢复信号通过测量而非假设进行定位(第4节),解码约束从蕴含度量算术中推导得出,使得自我矛盾和释义(两者在词汇评分中均可能得分)被结构性排除(第5节),且容器构建方式确保不会因单一负载失败导致模型失效,此前某次提交因该问题损失约14个排名位置(第7节)。

图1:提出的CBCT报告生成流程概览。系统提取图像与采集信号,选择候选临床陈述,实施一致性约束,并在组装最终结构化临床报告前应用基于几何的门控。
## 2 评分目标

条目按以下公式排名:

Final=0.8⋅F1RadFact+0.2⋅12(BLEU-4+METEOR),\\mathrm{Final}\\;=\\;0.8\\cdot F\\_{1}^{\\mathrm{RadFact}}\\;\\+\\;0.2\\cdot\\tfrac{1}{2}\\left(\\mathrm{BLEU\\text{-}4}\\+\\mathrm{METEOR}\\right),(1)

其中蕴含关系项在提交窗口关闭后离线计算\[6\]。发布评估代码中的三个细节影响后续所有环节:BLEU-4通过NLTK\[16,5]在语料库级别聚合,采用方法一平滑处理,因此逐案例平均会产生不同数值;METEOR使用评分器自身的精确分词变体,不含词干提取或同义词表,按案例平均;RadFact运行时禁用负向过滤,因此缺失发现在两个方向上均被计入。两种词汇度量均以纯Python代码重新实现,并在随机语料库上断言与参考标准达到机器精度匹配;若无此一致性,调优过程将优化与被评分函数不同的目标。

#### 发出陈述的边际规则:

RadFact将报告拆分为可验证短语,并询问蕴含模型每个短语是否被参考报告支持,对称地判断每个参考短语是否被报告支持。设候选报告包含n个短语,其中e个被蕴含,则精确度p=e/n。追加一个蕴含概率为q的短语将期望精确度变为(e+q)/(n+1),当q>p时获得改进,而召回率仅在短语覆盖了未被覆盖的参考短语时才会变化。因此发出规则为q>p−ΔR(∂F1/∂R)(∂F1/∂P)−1,这是针对每个陈述的阈值而非全局top-k截断,因为p和ΔR对每个候选都不同。词汇度量半部分也达成共识:METEOR将其组件组合为F=10PR/(R+9P),召回率权重约为精确度的九倍,且其分块惩罚项0.5(chunks/matches)³奖励对临床医生实际撰写的连续短语的重用。这些共同选择了一种架构:文本通过从训练语料库中观察到的句子中选择而非自由生成来组装,因此蕴含失败只能源于选择错误的发现,而非发明的语言\[13\]。

#### 隐藏项的离线代理:

调整阈值需要数万次完整语料库评估,这排除了在语言模型判断器参与下的搜索。因此使用确定性词汇代理进行搜索,该代理基于本体概念一致性、极性、侧别、牙齿标识符和词符包含度对短语蕴含关系进行评分,对矛盾极性和交换侧别进行硬置零处理,使其无法奖励真实判断器旨在惩罚的一类错误。一旦预计算蕴含矩阵并将METEOR对齐替换为已证明等效于评分器贪心分配的O(P+R)匹配器,一次语料库评估可在0.17秒内完成。在250个保留案例上,该代理能以0.9872的曲线下面积区分不同患者的报告,平均相似度为0.707对比0.217。它用于排名解码器变体,此处从不将其作为挑战指标报告。

## 3 语料库与标签空间

表1记录了公开发布的测量数据。视野远小于头部CT且更平坦,因此初始77×134×134mm裁剪区约70%为空气;调整为56×96×96mm后,0.5mm间距将填充比例降至38%。裁剪以牙列为中心,通过高强度百分位数隔离,而非以全部骨骼为中心(其质心在大范围采集中向颅骨偏移)。间距被保留而非归一化消除,因为报告量化了如窦底上方骨高度等物理距离,且367例携带多份报告。

表1:公开发布的测量数据。范围是沿每个采集轴的物理视野,中位数及第5、95百分位数。报告为意大利语口述并翻译为英语,翻译留下的痕迹需显式处理。牙齿标识符以裸形式出现,如"33义齿桥基台;34缺失",因此提取不能依赖关键词前缀;词符*mm*频繁结束句子,若将其作为缩写保护会合并两个发现为一个短语,度量随后将其评分为单个不可分割单元。最显著的工件是词汇层面的:意大利语*incluso*表示阻生牙,因此朴素本体将裸词"included"匹配为阻生牙,并在描述采集内容的每个句子上触发。这覆盖了16.3%的参考短语,其中86.4%为视野陈述;要求触发器旁需有牙齿标识符将该概念降至4.5%。第二个缺陷在4.4%的短语上反转了极性,因为缺失概念的触发器本身是否定线索。将词汇扩展到实际使用的术语使概念覆盖率从81%提升至90%。

短语经规范化、向量化并通过凝聚余弦链接聚类,每个聚类成为一个可报告陈述,由与其他成员比较时期望得分最大化的成员代表。标签联合了一个案例所有报告中的发现,因为临床医生记录的发现在扫描中存在,无论所选参考是否提及。标签空间由先知分数固定,即完美预测器通过发出所有正标签陈述所能达到的分数,这以零训练成本为后续所有步骤设定了上限。屏蔽牙齿标识符会将每个缺失句子合并为一个断言牙齿列表的聚类,这对几乎每个案例都是错误的:507个陈述覆盖率达84.6%,先知分数0.5406;对比512个牙齿感知陈述,覆盖率82.1%,先知分数0.5645。最终交付的空间保留989个牙齿感知陈述,覆盖率达89.0%,先知分数0.6008。

## 4 图像能预测什么,不能预测什么

基于该数据集训练了一个2900万参数的编码器:通过ImageNet预训练骨干网络\[9,21]生成多平面切片,经门控注意力多实例学习\[12]池化,在非对称多标签损失\[19]下训练,分类器偏差初始化为语料库对数几率。训练过程清晰,损失在五个患者分组折上从97降至60,验证集平均精度从0.057缓慢上升至0.072。

0.40.40.50.50.60.60.70.70.80.80.90.9Osteolytic lesionCondyles not incl.Mandibular bodyCanal regularMaxilla partialSinuses minimalCondyles excludedMandible incl.折外曲线下面积GeometryIntensity(a)按陈述区分度allprev.n≥12n\\\!\\geq\\\!120.450.450.50.50.550.550.60.60.650.650.70.7Mean AUCPriorEncoderLinear(b)预测器比较

图2:折外区分度。(a)9个头文件数值能区分所有视野陈述,但在病理上失败:病灶不是采集属性。(b)编码器在所有三种聚合方式下均低于语料库先验分布。所有这些结果都是噪声。约一千个陈述上的平均精度主要由出现两三次的列主导,本质上是随机的,因此无论模型如何改进,聚合指标几乎不动。针对语料库先验分布(设计上为精确的0.500)的逐陈述曲线下面积直接给出答案:每个支持区间都处于或低于机会水平,患病率加权指标在985个可评估陈述上为0.486,对于每个常见陈述,正负样本的平均预测概率相同。模型记忆了497个案例但未泛化。

决定性的后续是控制实验而非更大模型。仅从图像头文件读取9个数值(体积尺寸的对数、体素间距及物理范围的对数),对每个陈述拟合一个交叉验证的逻辑回归。视野陈述(语料库中最常见)被强烈预测(图2a)。在37个有足够支持的陈述上,头文件几何特征平均AUC为0.627,对比重采样后计算的强度统计特征的0.542;添加强度仅将均值提升至0.637,却需要像素解码,因此保留仅使用头文件路径。该任务可从网络辅助输入已接收的信息中学习,因此深度模型才是问题所在而非任务不可行。基于122维全局描述符\[17]对每个陈述拟合强正则化线性模型,将患病率加权区分度提升至0.593,在支持充足的情况下达0.669(图2b),部署形式仅52KB,对比折检查点的580MB。

### 4.1 为何训练模型无法赢得词汇列

更精确的诊断解释了该结果,并界定了该数据集上任何模型可达到的上限。仅基于*采集中心*预测报告使用的原型句子,在60个最常用句子上平均AUC达0.718,优于基于图像模型的0.663,且72.2%的句子使用集中于其单一最常用中心。句子选择是行文风格而非解剖特征:编码器并非未能观察颌骨,而是被要求预测口述规范,而这不在像素中。

所有后续观察由此而来。完美的逐案例选择器达到BLEU-4 0.4086,对比单一固定报告的0.1663,但该差距主要源于逐字复制某中心的措辞,而中心P提供了622例中的412例。评估中心具有所有四个训练中心均缺失的惯例,因此该差距在此处无法达到:观察到的测试BLEU-4为0.0943,低于所有留一中心折(范围从0.1241到0.1968)。完美知晓哪些牙齿缺失(体积中最直观的内容)仅值0.0041 BLEU-4,因为n-gram存在于句子框架而非具体标识符中。

相似文章

重新审视用于3D CT报告生成的LLM适配:规模与诊断先验研究

arXiv cs.CL

本文研究了将大语言模型适配到3D CT报告生成的参数高效策略,提出了RAD3D-Prefix,一个轻量级的诊断先验条件框架,该框架保持LLM冻结,仅需极少的可训练参数。结果表明,冻结更大的LLM(约10亿参数以上)并仅训练轻量级投影层,能够在性能、泛化能力和计算效率之间实现更优的权衡。

位置而非来源:区分医学视觉语言模型中的推理中介与谄媚

arXiv cs.LG

本文介绍了 CoT-Mediate,一个行为框架,用于测试医学视觉语言模型中的思维链推理是真正驱动预测,还是仅仅装饰预测。通过对 VQA-RAD 上的 LLaVA-Med 和 MedGemma 进行审计,发现推理的注入方式(前缀强制 vs 重新提示)以及归因来源(自我 vs 专家)显著影响模型的忠实度和谄媚程度。