SlideBank: 一个用于一致全切片推理的持久化分层证据库

arXiv cs.AI 论文

摘要

SlideBank 是一个用于病理学中全切片图像推理的免训练框架,通过使用持久化分层证据库来提高一致性并降低推理成本。

arXiv:2609.00342v1 Announce Type: new 摘要:全切片图像(WSIs)对视觉-语言推理具有挑战性,因为诊断相关的形态稀疏、异质,并分布在吉像素级图像和多个空间分辨率中。现有的 WSI 模型和病理学代理可以聚合切片特征或主动获取证据,但探索后保留的信息在语义上往往难以访问,同时保持其与原始视觉证据的联系。我们引入 SlideBank,一个免训练框架,将每个 WSI 表示为一个持久化、概念索引且空间锚定的证据库。SlideBank 执行与问题无关的从粗到细的探索,以识别信息丰富的区域和多尺度视图,将它们转换为明确的形态观察,并将病理信号锚定到其支持的补丁和 WSI 坐标。在推理时,问题被路由到相关的信号和证据尺度,并通过基于置信度的跨级别共识整合链接的全局、区域和补丁证据。在 WSI-VQA 和 SlideBench-BCNB 上的实验表明,使用 Patho-R1 时,SlideBank 在 WSI-VQA 上达到 52.77%,使用 Quilt-LLaVA 时,在 SlideBench-BCNB 上达到 50.92% 的平均准确率,而结构化信号引导检索始终优于随机证据采样。在重复查询中重用同一库进一步实现了超过 99% 的重新表述一致性,并通过持久化证据重用显著降低了摊销成本。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:01

# 一个用于一致全玻片推理的持久分层证据库
来源:https://arxiv.org/html/2609.00342
1\]不列颠哥伦比亚大学 2\]向量研究所 3\]哈佛大学 4\]莱斯大学 5\]芝加哥大学 6\]BC癌症机构\\贡献∗同等贡献 †通讯作者:Xiaoxiao Li,邮箱:[xiaoxiao\.li@ece\.ubc\.ca](mailto:[email protected])

黄歌新 张希罗 李安琪 谭宇生 周陈 王刚 高祖华 李晓晓
机构:\机构:\[机构:\[机构:\[机构:\[机构:\[

###### 摘要

全玻片图像(WSI)对视觉-语言推理构成了挑战,因为与诊断相关的形态学信息稀疏、异构,且分布于吉像素级图像和多个空间分辨率中。现有的WSI模型和病理学智能体能够聚合切片特征或主动获取证据,但探索后保留的信息往往难以在保持与原始视觉证据联系的同时进行语义访问。我们引入了**SlideBank**,这是一个无需训练的框架,将每个WSI表示为一个持久的、概念索引的、空间锚定的证据库。**SlideBank**执行与问题无关的由粗到细的探索,以识别信息丰富的区域和多尺度视图,将它们转化为明确的形态学观察,并将病理学信号锚定到其支持的图像块和WSI坐标。在推理时,问题被路由到相关的信号和证据尺度,链接的全局、区域和图像块证据通过基于置信度的跨层级共识进行整合。在WSI-VQA和SlideBench-BCNB上的实验表明,使用Patho-R1时,**SlideBank**在WSI-VQA上达到52.77%,使用Quilt-LLaVA时,在SlideBench-BCNB上达到50.92%的平均准确率,同时结构化的信号引导检索始终优于随机证据采样。在重复查询中重用同一证据库进一步实现了超过99%的改写一致性,并通过持久证据重用大幅降低了摊销推理成本。

## 1引言

全玻片图像(WSI)是计算病理学中最具挑战性的视觉输入之一。与传统的自然或医学图像不同,单个WSI可以包含数十亿像素,并跨越从大规模组织架构模式到精细细胞形态的多种组织结构。与诊断相关的发现通常稀疏、空间分散且高度异构:一小团非典型细胞、一个侵袭性组织界面或一个有丝分裂热点可能只占据整个切片的极小部分,但却对诊断具有决定性作用。因此,直接将WSI压缩为缩略图或统一处理有限的图像块集合很容易丢弃关键证据。因此,有效的WSI推理不仅需要理解*可见内容*,还需要确定*诊断信息性证据的位置*、*应检查的尺度*,以及*如何组织分布在切片中的证据*以进行下游推理。

近期研究主要从两个方向应对这一挑战。WSI级视觉-语言模型[Chen et al. \(2025b\) (https://arxiv.org/html/2609.00342#bib.bib5);Liang et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib1);Ding et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib12);Alawode et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib34)]将预计算的图像块或切片特征聚合为紧凑的潜在表示,从而能够对吉像素图像进行端到端推理。最近,病理学智能体Ghezloo et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib3);Chen et al. \(2025a\) (https://arxiv.org/html/2609.00342#bib.bib15);Yang et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib35)将WSI理解视为一个主动证据获取问题,使用规划、区域选择和多尺度导航来定位与诊断相关的视野,然后再生成答案。一些方法进一步引入了分层表示、缓存观察或切片特定记忆,以提高在大规模视觉上下文中的效率和推理能力Alawode et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib34);Chen et al. \(2025a\) (https://arxiv.org/html/2609.00342#bib.bib15);Yang et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib35);Huang et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib14);Li et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib36)。这些方法极大地推动了WSI理解的发展,但切片探索后保留的信息通常表示为潜在的视觉特征、扁平的观察集合,或针对特定导航或推理轨迹优化的状态。如何将来自*当前切片*的视觉证据组织成一种可以被不同下游问题语义访问的明确表示,仍相对缺乏探索。

这促使我们思考本工作的核心问题:*如何将从吉像素WSI获取的证据转化为一种持久表示,以支持多样化的下游问题,同时保持对底层视觉观察的明确可追溯性?*这一视角将焦点从单纯的证据获取转移到获取的证据在探索后如何组织和访问。一个有用的证据表示应以能够桥接不同问题表述的形式展示有临床意义的发现,保留病理学证据的多尺度结构,并维持语义发现与支撑它们的精细区域和WSI位置之间的可追溯联系。

构建这样的表示带来了若干挑战。首先,在吉像素尺度上进行穷尽检查是不可行的,但过于激进的采样又可能错过稀疏或异构的异常;因此,系统必须在结构和细胞尺度上识别出一个紧凑但诊断多样化的视野集合。其次,下游问题中使用的语言不一定与原始视觉观察的语言相匹配。例如,关于细胞核级别、多形性或细胞非典型性的问题,即使表面形式不同,也可能依赖于重叠的形态学信号,使得基于自由形式描述的直接检索不可靠。第三,有临床意义的证据本质上是多尺度且空间锚定的:一个语义发现应不仅链接到文本描述,还应链接到其来源的锚定区域、放大倍数、视野和WSI坐标。最后,不同的问题可能需要全局上下文、区域架构和细胞细节的不同组合,这就要求一个证据接口在保持持久的同时支持查询自适应组合。

为应对这些挑战,我们提出了**SlideBank**,一个无需任务特定训练的智能体驱动框架,将每个WSI转换为一个**概念索引、空间锚定的分层证据库**。为构建该库,**SlideBank**执行与问题无关的由粗到细的探索,利用全局调查和类别感知采样来识别具有诊断信息性的锚定区域以及互补的架构和细胞级视图。一个病理学生成模型将所选视图转化为明确的形态学观察,随后通过一个概念引导的病理学信号层将其归一化为具有临床意义的信号。每个信号与其状态、置信度、支持锚点、多尺度视图、坐标和放大倍数相关联,建立了从*病理学信号*到*支持证据*、*视野*,最终到*WSI位置*的可追溯路径。在推理时,一个信号感知的读取器将每个问题路由到相关的病理学概念,使用关联的信号检索支持的锚点和多尺度视图,并在全局、锚点和图像块级别独立生成候选答案。这些候选答案通过基于置信度的选择和跨层级共识进行组合。通过这种方式,**SlideBank**探索每个切片一次,将观察到的形态组织成一个持久的证据库,并重用同一证据库来回答不同的下游问题。

我们的贡献主要有三方面:

- • 我们引入了**SlideBank**,一种结构化的、切片特定的分层证据表示,它通过病理学信号组织观察到的形态,同时保留了与支持区域、多尺度视图和WSI坐标的明确链接。
- • 我们开发了一种概念到信号的检索方法,将概念级问题路由与信号锚定的证据检索相结合,为索引和推理跨不同问题表述提供了一致的语义接口,同时保留了对底层视觉证据的可追溯性。
- • 我们在两个公共WSI问答基准测试中评估了**SlideBank**的准确率、效率和跨轮次一致性。使用同一证据库的受控比较显示了概念到信号检索优于随机证据采样的好处。

参考标题图1:**SlideBank**概述。(a) 一个病理学智能体探索WSI并将多尺度观察组织为一个空间锚定的证据库。(b) 推理时,每个问题被路由到相关的病理学概念,并链接到全局、锚点和图像块级别的证据,其预测通过基于置信度的选择和加权跨层级共识进行组合。(c) 同一证据库在改写查询中被重用,以实现稳定高效的推理。

## 2相关工作

### 2\.1面向全玻片病理学的视觉-语言模型与智能体推理

早期的病理学视觉-语言模型主要从局部视野学习图像-文本对齐或指令跟随。CONCH学习可迁移的视觉-语言表示,而Quilt-LLaVA和PathChat支持对组织学图像的指令跟随和开放式交互Lu et al. \(2024a\) (https://arxiv.org/html/2609.00342#bib.bib16);Seyfioglu et al. \(2024\) (https://arxiv.org/html/2609.00342#bib.bib6);Lu et al. \(2024b\) (https://arxiv.org/html/2609.00342#bib.bib37)。由于这些模型无法以原始分辨率直接处理完整的WSI,后续方法将预提取的图像块特征聚合成切片级表示。WSI-VQA引入了针对WSI的生成式问答,TITAN学习了多模态的全切片表示,而SlideChat和WSI-LLaVA则将切片特征与语言模型连接起来,用于切片级对话和推理Chen et al. \(2024\) (https://arxiv.org/html/2609.00342#bib.bib7);Ding et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib12);Chen et al. \(2025b\) (https://arxiv.org/html/2609.00342#bib.bib5);Liang et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib1)。最新的系统改进了分层或大规模切片理解:MLLM-HWSI将细胞、图像块、区域和切片级标记与病理学语言对齐,而ALPaCA和PRISM2通过问答和临床对话扩展了切片级监督Alawode et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib34);Gao et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib29);Vorontsov et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib30)。与此同时,智能体系统使证据获取更具适应性。PathFinder、WSI-Agents、SlideSeek、GIANT和PathAgent引入了专门的智能体、规划、工具使用、迭代导航或证据综合来处理吉像素切片Ghezloo et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib3);Lyu et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib11);Weishaupt et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib4);Buckley et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib2);Chen et al. \(2025a\) (https://arxiv.org/html/2609.00342#bib.bib15); HistoSelect执行问题引导的由粗到细选择,BEACON根据预期信息增益获取图像块,AdaptivePath学习与问题无关的多尺度导航Huang et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib28);Wong et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib32);Chen et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib33)。EviPathBench进一步表明,定位诊断区域仍然比对预选证据进行推理困难得多Liao et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib31)。PathNavigate与我们的情境特别相关,因为它执行与问题无关的扫描,并在冻结的切片特征上维护在线记忆,然后进行问题条件的搜索Yang et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib35)。然而,现有方法主要将获取的证据表示为模型内部特征或瞬时推理状态。**SlideBank**则将选定的多尺度图像视野、形态学描述、病理学信号和WSI坐标**具体化**为一个可独立检查的库,该库可以在关于同一张切片的多个问题间被检索。

### 2\.2分层证据与记忆

分层建模为表示吉像素WSI提供了一种自然方式。HIPT学习嵌套的图像块和区域级表示,而H2-MIL将异构实例组织成层级结构用于切片分析Chen et al. \(2022\) (https://arxiv.org/html/2609.00342#bib.bib21);Hou et al. \(2022\) (https://arxiv.org/html/2609.00342#bib.bib22);然而,两者主要构建潜在的视觉特征用于下游预测。概念瓶颈模型暴露了人类可解释的中间变量,事后变体为预训练模型添加了此类结构Koh et al. \(2020\) (https://arxiv.org/html/2609.00342#bib.bib25);Yuksekgonul et al. \(2023\) (https://arxiv.org/html/2609.00342#bib.bib26)。持久记忆也在长期智能体中得到研究:Generative Agents存储情景经验,MemGPT通过外部记忆管理上下文,A-MEM和G-Memory通过链接或分层结构组织记忆Park et al. \(2023\) (https://arxiv.org/html/2609.00342#bib.bib20);Packer et al. \(2023\) (https://arxiv.org/html/2609.00342#bib.bib19);Xu et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib23);Zhang et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib24)。相关理念近期也出现在病理学中。SurvAgent构建了一个多模态病例库用于跨病例生存预测,而PathMem将结构化诊断知识组织为长期记忆,并将相关内容转移到工作记忆中Huang et al. \(2025\) (https://arxiv.org/html/2609.00342#bib.bib14);Li et al. \(2026\) (https://arxiv.org/html/2609.00342#bib.bib36)。这些方法关注潜在层级、一般情景记忆、跨病例经验或领域知识,而非对单个WSI重复检查产生的持久空间证据。**SlideBank**将分层视觉证据与可解释的路由接口相结合:概念表示粗粒度的问题侧类别,信号表示局部化的图像派生发现,预定义的本体将概念映射到相关信号。每个信号记录保留其状态并链接到相关的锚点、多尺度图像块视图、描述和WSI坐标。由此产生的切片特定库在多个问题间被重用,因此每一轮都从持久的证据库中回答,而不仅仅受累积对话历史的影响。

## 3方法

### 3\.1概述

全玻片推理具有挑战性,因为

相似文章

Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。