DocScope:用于值得信赖的长文档理解的可靠推理基准测试
摘要
DocScope 是一个新的基准测试,旨在评估多模态大语言模型在长文档上的可靠推理能力和可信度,引入了包含页面定位、区域定位、事实提取和答案验证四个阶段的评估协议。
arXiv:2605.08888v1 公告类型:新论文
摘要:评估多模态大语言模型是否能在视觉丰富的长文档上产生可靠且可验证的推理,需要超越端到端答案准确率的评估方法。我们引入了 DocScope,这是一个将长文档问答形式化为结构化推理轨迹预测问题的基准测试:给定完整的 PDF 文档和一个问题,模型输出证据页面、支持性证据区域、相关事实陈述以及最终答案。我们设计了一个四阶段评估协议——页面定位、区域定位、事实提取和答案验证——通过阶段间解耦独立审查轨迹的每个层面,所有评判标准均通过人工对齐研究进行选择和校准。DocScope 包含 273 个文档中衍生出的 1,124 个问题,所有层级证据标注均由人工标注员完成。我们对 6 个专有模型、12 个开源权重模型以及几个领域特定系统进行了基准测试。我们的实验表明,答案准确率无法替代轨迹级别的评估:即使在正确答案中,完整的证据链最高观察率仅为 29%。在所有模型中,区域定位仍然是最弱的轨迹阶段。此外,主要困难源于聚合分散在长距离和多个文档集群中的证据,而预言研究指出,忠实感知和事实提取是主要的瓶颈能力。跨架构比较进一步表明,激活参数数量比总规模更重要。基准测试和代码将在 https://github.com/MiliLab/DocScope 公开发布。
查看缓存全文
缓存时间: 2026/05/12 07:04
# DocScope:为可信长文档理解进行可验证推理的基准测试 来源:https://arxiv.org/html/2605.08888 向锋1 周佳伟1 黄张丰2 王可伟3 叶姗姗4 胡锦新2 陈祖龙2 罗勇111footnotemark:1 张京111footnotemark:1 1 武汉大学计算机学院、多媒体软件国家工程研究中心及多媒体与网络通信工程技术湖北省重点实验室,中国 2 阿里巴巴集团,中国杭州 3 中国科学技术大学电子工程与信息科学系,中国 4 穆罕默德·本·扎耶德人工智能大学机器学习系,阿联酋 fengxiang\_cs@whu\.edu\.cn, 2021302111478@whu\.edu\.cn huangzhangfeng\.hzf@alibaba\-inc\.com, kyrakeweiwang@mail\.ustc\.edu\.cn cassie\.ye133@hotmail\.com, jinxin\.hjx@alibaba\-inc\.com zulong\.czl@alibaba\-inc\.com, luoyong@whu\.edu\.cn, jingzhang\.cv@gmail\.com ###### 摘要 评估多模态大语言模型(MLLMs)是否能够在长篇幅、视觉信息丰富的文档上产生可信、可验证的推理,需要超越端到端答案准确性的评估。我们引入了DocScope,这是一个将长文档问答构建为结构化推理轨迹预测问题的基准测试:给定完整的PDF文档和问题,模型需输出证据页面、支撑证据区域、相关事实陈述以及最终答案。我们设计了一个四阶段评估协议——页面定位、区域定位、事实提取和答案验证——通过阶段间解耦独立审查轨迹的每一层级,所有评判员均通过人类对齐研究进行选择和校准。DocScope包含源自273篇文档的1,124个问题,所有层级证据标注均由人类标注员完成。我们对6个专有模型、12个开源权重模型以及若干领域特定系统进行了基准测试。实验表明,答案准确性无法替代轨迹级别的评估:即使在正确答案中,完整证据链的最高观察率也仅为29%。在所有模型中,区域定位仍然是最弱的轨迹阶段。此外,主要难点源于聚合分散在长距离和多个文档集群中的证据,而神谕研究(oracle study)表明,忠实的感知和事实提取是主要的瓶颈能力。跨架构比较进一步表明,激活参数数量比总规模更重要。基准测试和代码将在https://github.com/MiliLab/DocScope公开释放。参见图注 图1:DocScope概览。左图:给定长文档和问题(所示示例为说明性和虚构的),可信的响应应通过内联引用将每个主张锚定在特定页面和区域,而不可验证的响应可能会产生看似合理但幻觉的答案。右图:我们的四阶段评估协议在每一个层级独立审查模型的结构化推理轨迹——页面定位、区域定位、事实提取和答案验证。
## 1 引言
近年来,多模态大语言模型(MLLMs)在文档理解任务上取得了显著进展,这得益于其感知、推理和上下文处理能力的持续改进(Jaech等人,2024;Qwen团队,2026a;Huang等人,2026)。随着这些模型越来越多地部署在真实的应用场景中,仅仅生成答案已不足以满足用户需求。问答系统的可信度变得至关重要,要求模型输出不仅准确,而且必须扎根于源文档,从而使响应可验证、可审计。因此,一个关键且尚未充分探索的问题自然浮现:MLLMs能否作为产生扎根于长文档的可信、端到端推理痕迹的问答系统?
尽管最近的基准测试已开始探索长文档理解(Ma等人,2024;Deng等人,2025;Chia等人,2025)和可验证的多模态生成(Hue等人,2025b;Song等人,2026),但当前基准设计与可信文档问答的实际需求之间仍存在显著差距。如表1所述,先前的基准测试通常只解决证据验证问题的子集,留下了几个关键维度未被充分探索。
(1)抽象的输入上下文。几个面向引用的基准测试(Hue等人,2025b;Song等人,2026)在固定或预检索的证据池上评估模型,而不是要求模型处理在现实使用中自然出现的完整文档。虽然这种设置在衡量引用保真度方面很有价值,但它绕过了导航冗长、视觉丰富文档的挑战性步骤,在这些文档中,相关证据可能分散在许多页面上。
(2)粗糙的验证粒度。证据监督的粒度通常仅限于文档来源、页面、段落或预定义的证据项。这种粒度对于视觉复杂的文档来说是不够的,因为单页可能包含多个表格、图表、标题、段落和布局区域。在实践中,用户不仅需要知道*哪个页面*支持答案,还需要知道*哪个具体区域*和*哪个事实陈述*提供了支撑证据。
(3)隐式证据轨迹。现有的长文档基准测试(Ma等人,2024;Deng等人,2025)经常利用证据元数据进行数据集构建或事后分析,但并不要求模型明确产生完整的证据轨迹作为任务输出的组成部分。因此,它们无法在一个统一的评估协议中联合评估模型是否能够在定位相关证据、空间定位、提取忠实事实并得出正确最终答案方面具备能力。
为了克服这些局限性,我们引入了DocScope(图1),这是一个用于可验证长文档问答的分层评估基准测试。DocScope是从完整的、视觉丰富的PDF文档构建的,而不是孤立的证据池或预检索的页面。为了支持细粒度评估,我们从两个研究机构招募了13名标注员进行分层证据标注。对于每个问题,我们在三个证据层级提供人类标注:证据页面、证据区域以及从相应区域提炼出的事实陈述;对于可回答的问题,提供标准答案。总共,DocScope包含由MLLMs合成的1,124个问题,而所有答案和证据标注均由人类标注员完成。在评估时,模型需要以统一格式输出结构化推理轨迹,使我们不仅能评估最终答案的正确性,还能评估其是否在页面、区域和事实层级得到可验证证据的支持。
基于此框架,我们在DocScope上对6个专有模型、12个开源权重模型和若干领域特定系统进行了广泛的实验基准测试,并辅以产生关键见解的分析。首先,长文档问题的答案准确性仍然有限,更重要的是,它不能替代轨迹级别的评估:即使在正确回答的样本中,观察到的完整证据链最高比率仅为29%,揭示了答案正确性与推理可信度之间的显著脱节。其次,长文档问答的难度不仅由所需证据的数量驱动,更关键的是证据是否分散在长距离和多个文档集群中,这是一个固定证据池设置 largely 绕过的现实挑战。第三,神谕证据访问研究表明,忠实的事实提取构成了主要的能力瓶颈,表明可靠的文档问答需要模型不仅检索相关证据,还要感知并将其转化为准确的事实。
总之,我们做出三项贡献:(1)我们将长文档问答表述为结构化推理轨迹预测问题,并设计了一个经过良好校准的四阶段评估协议,独立诊断轨迹的每一层级;(2)我们构建了DocScope,这是一个高质量的基准测试,包含1,124个问题,具有页面、区域和事实层级的分层人工标注证据;(3)通过广泛的实验和分析,我们提供了关于当前MLLMs中答案准确性与推理可信度之间差距的可操作见解。
表1:DocScope与先前代表性基准的比较。绿色表示支持该功能,红色表示不支持。“Gen.”是“自动生成”的缩写。
| 基准测试 | 会议/来源 | 输入 | 页面/项 | Bbox | 事实 | 答案 | 来源 | 标注来源 | 可验证评估 | #Q |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| CiteBench | EMNLP 2025 | 固定证据池 | ✓ | ✗ | ✗ | Web + Gen. | Human | Item | 3,000 |
| MAVIS | AAAI 2026 | 检索文本/图像 | ✓ | ✗ | ✓ | Web | Gen. | Item + Fact | 1,000 |
| MMLongBench-Doc | NeurIPS 2024 | 完整文档 | ✓ | ✗ | ✗ | Human | Human | – | 1,062 |
| LongDocURL | ACL 2025 | 30页窗口 | ✓ | ✓ | ✗ | Gen. | Gen. | – | 2,325 |
| M-LongDoc | EMNLP 2025 | 检索页面 | ✓ | ✗ | ✗ | Gen. | Gen. | – | 851 |
| MMDocRAG | NeurIPS 2025 | 固定证据池 | ✓ | ✗ | ✗ | Gen. + Human | Gen. + Human | Item | 4,055 |
| **DocScope** | – | **完整文档** | **✓** | **✓** | **✓** | **Human** | **Human** | **Page + Bbox + Fact** | **1,124** |
## 2 数据集
本节介绍DocScope的设计。我们首先形式化可信长文档问答的结构化推理任务(第2.1节),然后描述我们如何构建基准测试及相应的真值标注(第2.2节),展示数据统计(第2.3节),并详细说明评估协议(第2.4节)。
### 2.1 任务定义
当在长篇幅、视觉丰富的文档上使用问答系统时,用户需要的不仅仅是一个正确的答案——他们需要通过回溯到源中的具体证据来验证答案*为什么*正确。这需要系统输出的不仅仅是一个最终答案,而是一个可以独立检查的结构化推理轨迹。因此,我们将长文档问答表述为一个结构化预测问题,其中模型必须在答案旁边产生一个显式的、多层级的证据轨迹。
具体而言,给定长文档 $D=\{p_1, ..., p_N\}$ 和问题 $q$,其中 $p_i$ 表示第 $i$ 页,模型被要求输出一个结构化推理轨迹:
$$ y=(P,R,F,a) \quad (1) $$
轨迹的每一层级解决一个 progressively 更细粒度的审查问题(推理提示见附录C.1)。
$P \subseteq \{1, ..., N\}$ 识别证据*在哪里*(证据页面);
$R=\{(i,[x_1,y_1,x_2,y_2]) | i \in \hat{P}, 0 \le x_1,y_1,x_2,y_2 \le 1\}$ 指定在这些页面上*看什么*(定位的证据区域),其中每个四元组 $[x_1,y_1,x_2,y_2]$ 表示一个边界框,$(x_1,y_1)$ 为左上角,$(x_2,y_2)$ 为归一化页面坐标中的右下角;
$F$ 明确说明模型从这些区域*理解了什么*(事实陈述);
以及 $a$ 是从这些事实得出的最终答案。
链条中的任何断裂——缺失的页面、不精确的区域,或幻觉或缺失的事实——都会使输出变得不可验证,无论最终答案碰巧是否正确。
如图1所示,我们将轨迹的每一层级与人工标注的真值独立进行评估,从而能够细粒度地诊断推理痕迹在哪里以及如何失败。*DocScope* 是我们为此评估构建的基准测试:它提供页面、区域和事实层级的分层证据标注,使得评估不仅限于答案的正确性,还包括导致答案的整个推理过程的可信度。
### 2.2 数据集构建
参见图注
图2:数据集策划流程。
#### 数据收集。
我们从公开可用的 FinePDF 语料库中获取文档,应用基于元数据和布局的过滤器,保留包含交织文本、图表和表格的长篇幅、视觉丰富的文档,随后进行人工检查以移除低质量或过于专业的材料(详细过滤标准见附录B.1),产生一个高质量的、视觉丰富的文档池。
#### 问题合成。
我们设计了一个自动化流程,聚类页面嵌入以识别信息密集段,然后提示 Claude-Opus-4.6 合成八个类别中的多样化问题(附录B.2)。经过质量过滤和去重后,我们使用六个前沿模型进行多模型盲测,以丢弃无需访问文档即可回答的问题。完整的合成流程在附录B.1中描述。
#### 人工标注和质量控制。
来自两个研究机构的13名标注员按照公式1构建每个问题的黄金推理轨迹:证据页面 ($P^*$)、边界框区域 ($R^*$)、事实陈述 ($F^*$) 和最终答案 ($a^*$)。标注通过包含模型辅助检查的人机在环验证阶段进行完善(Google DeepMind, 2026a),随后由标注团队之外的两名高级成员进行仲裁。更多细节见附录B.4。
### 2.3 概览与统计
表2:DocScope的基本统计信息。
| 统计项 | 数量 |
| :--- | :--- |
| **文档** | |
| - 包含问题的文档 | 273 |
| - 平均/最大页数 | 51.3 / 100 |
| - 平均/最大文本标记数 | 24,561 / 143,868 |
| - 每文档平均/最大问题数 | 4.12 / 17 |
| **问题与答案** | |
| - 总问题数 | 1,124 |
| - 平均/最大 q... | |相似文章
XL-DocBench:证据支撑的超长文档理解基准测试
介绍了XL-DocBench,这是一个经过人工验证的超长文档理解基准,涵盖六个专业领域的1,519个问题,要求多页证据和结构化推理,表明当前大语言模型在处理长上下文专业文档时仍存在困难。
DocTrace:通过分层证据图推理实现可追踪的长文档VQA
本文介绍了DocTrace,一个用于长文档视觉问答的分层框架,将该任务建模为显式证据图推理。它在三个基准上取得了最先进的结果,同时实现了可追踪的证据来源,比Qwen3-VL-8B-Instruct高出11-14个百分点。
DocHop: 信息密集文档中的跨域多跳推理基准测试
DocHop 引入了一个基准,用于评估信息密集文档中的多跳推理,重点是多模态大语言模型中的图表上下文集成,实验表明模型与人类性能之间存在显著差距。
SynthDocBench:长上下文视觉文档理解的控制基准
SynthDocBench 是一个完全合成的长上下文视觉文档理解基准,它系统地控制文档长度、布局、模态和问题类型,揭示了当前VLM中的失败模式,如长度退化和位置敏感性。
从片段到语义:重新思考多语言事实核查的证据粒度
本文介绍了SEEK,一个用于多语言事实核查中语义证据提取的框架,该框架从完整文章中构建连贯的证据块,并使用LoRA微调多语言大语言模型,在宏观F1分数上相比基线提升了高达20%。