DocAtlas:将长文档理解视为可变状态交互
摘要
DocAtlas 是一个研究系统,将长文档理解构建为可变状态交互过程,利用带有搜索、阅读、笔记和审查工具的外部文档框架。它在 MMLongBench-Doc 上使用 GPT-5.4 取得了最先进的结果,并通过端到端强化学习大幅改进了紧凑型 VLM 代理。
arXiv:2608.07527v1 公告类型:新
摘要:长文档理解要求模型在众多页面、布局、表格、图形和图表中查找并整合证据。现有的检索增强系统通常在生成前从静态索引中选择证据,而最近的智能体系统增加了多轮工具使用,但往往依赖冻结的专有主干,其行为由提示词设定。我们提出了 DocAtlas,一个将长文档理解视为可变状态信息寻求过程的系统。我们将 DocAtlas 实例化为一个可变文档框架:一个外部环境,决定每一步搜索、读取、存储、审查哪些文档信息以及向模型展示哪些信息。给定文档和问题,该框架提供搜索、阅读、笔记和审查工具,维护一个层次化树和笔记存储,并在智能体记录证据时更新两者。DocAtlas 在固定上下文预算下结合了自我改进的检索、选择性证据访问和主动工作记忆。同一框架支持使用大型 VLM 的推理时应用,以及面向紧凑型 VLM 智能体的端到端强化学习。使用 GPT-5.4,DocAtlas 在 MMLongBench-Doc 上达到 71.4\%,超过了 65.8\% 的人类专家参考值。一个在 DocAtlas 环境中通过端到端 RL 训练的 Qwen3.5-4B VLM 达到 63.7\%,而直接输入基线为 54.4\%,这表明可变文档框架设计可以大幅改进紧凑型文档智能体。
查看缓存全文
缓存时间: 2026/08/11 08:05
# DocAtlas:长文档理解作为可变状态交互
来源:https://arxiv.org/html/2608.07527
洪成伟1,†,‡ 王远哲2,†,‡ 刘蓓2,∗ 杨一帆2 齐岱2 邱凯2 李运生2 陈东东2 罗翀2 陈震中1 郭百宁2
1武汉大学 2微软
###### 摘要
长文档理解要求模型在众多页面、布局、表格、图形和图表中查找并整合证据。现有的检索增强系统通常在生成之前从静态索引中选择证据,而近年来的智能体系统增加了多轮工具调用,但往往依赖行为由提示词设定的固定闭源骨干模型。我们提出DocAtlas,一个将长文档理解视为可变状态信息寻求过程的系统。我们将DocAtlas实例化为一个可变文档工具框架:一个外部环境,决定每一步搜索、读取、存储、审查哪些文档信息,以及向模型展示什么内容。给定文档和问题后,该工具框架提供搜索、读取、笔记和审查工具,维护一棵层级树和笔记存储,并在智能体记录证据时更新二者。DocAtlas在固定上下文预算下结合了自改进检索、选择性证据访问和主动工作记忆。同一工具框架既支持大型VLM的推理时使用,也支持紧凑型VLM智能体的端到端强化学习。使用GPT-5.4,DocAtlas在MMLongBench-Doc上达到71.4%,超过了65.8%的人类专家参考水平。使用Qwen3.5-4B VLM在DocAtlas环境中通过端到端RL训练后达到63.7%,而直接输入基线仅为54.4%,这表明可变文档工具框架设计可以大幅度提升紧凑型文档智能体的性能。项目主页:https://officeintelligence.github.io/docatlas/。
††脚注:†同等贡献。‡在MSRA实习期间完成的工作。∗项目负责人。
## 1 引言
金融报告、法律合同、科学论文和政府文件等现实世界文档往往将重要信息分布在全文中,有时甚至横跨数十甚至数百页。它们还将自由文本与表格、图形和图表结合在多样化的版面中。因此,回答关于这些文档的自然语言问题需要查找、提取并整合分布在多页多模态中的证据[6 (https://arxiv.org/html/2608.07527#bib.bib7)]。这仍然很困难,因为相关证据可能出现在长文档中的任何位置;图表和表格等视觉元素无法仅通过文本提取来处理[3 (https://arxiv.org/html/2608.07527#bib.bib1)];复杂问题往往需要来自多个遥远区域或模态的证据[21 (https://arxiv.org/html/2608.07527#bib.bib21)]。简单地将整个文档输入模型很快就会遇到当前视觉-语言模型的实际限制[12 (https://arxiv.org/html/2608.07527#bib.bib17),18 (https://arxiv.org/html/2608.07527#bib.bib18),34 (https://arxiv.org/html/2608.07527#bib.bib16)]。即使输入能放入上下文窗口,性能也常常因为不相关内容竞争注意力而下降[17 (https://arxiv.org/html/2608.07527#bib.bib22)]。这些问题要求系统能够有选择性地导航长文档,将答案基于文本和视觉内容,并整合分布在不同文档区域的信息。
方法 | 可变状态 | 灵活交互 | 基于来源的记忆 | 可训练的RL策略
M3DocRAG[3 (https://arxiv.org/html/2608.07527#bib.bib1)] | × | × | × | ×
DocAgent[32 (https://arxiv.org/html/2608.07527#bib.bib23)] | × | △ | × | ×
SimpleDoc[13 (https://arxiv.org/html/2608.07527#bib.bib24)] | × | △ | △ | ×
DocLens[41 (https://arxiv.org/html/2608.07527#bib.bib25)] | × | ✓ | × | ×
DocDancer[38 (https://arxiv.org/html/2608.07527#bib.bib26)] | △ | ✓ | × | △
MACT[37 (https://arxiv.org/html/2608.07527#bib.bib27)] | △ | △ | × | ×
DocAtlas | ✓ | ✓ | ✓ | ✓
(a) 设计对比。✓:是,△:部分,×:否。参见说明
(b) MMLongBench-Doc ALL。
图1:DocAtlas的动机与定位。(a) ✓、△和×分别表示完全支持、部分支持和缺乏支持。灵活交互意味着智能体可以自主选择工具调用的顺序和参数,而非遵循固定流水线;基于来源的记忆意味着带有出处标注的证据可以被存储并在后续步骤中查询。DocAtlas结合了可变状态、灵活交互、基于来源的记忆和可训练的紧凑策略。(b) 在MMLongBench-Doc上,DocAtlas-Plus(我们的GPT-5.4实例化)超过了人类专家参考值,而同一环境将Qwen3.5-4B[27 (https://arxiv.org/html/2608.07527#bib.bib12)]从直接输入提升到DocAtlas 4B,再到DocAtlas 4B+RL。
早期工作[4 (https://arxiv.org/html/2608.07527#bib.bib9),8 (https://arxiv.org/html/2608.07527#bib.bib8)]已经用检索增强生成(RAG)部分解决了这个问题。在这些系统中,基于嵌入的检索器选择一组固定的相关页面,然后视觉-语言模型(VLM)一次性生成答案[3 (https://arxiv.org/html/2608.07527#bib.bib1),11 (https://arxiv.org/html/2608.07527#bib.bib31)]。这种设计对于简单的查找效果尚可,但它无法让模型控制更仔细地检查哪些页面,或如何根据部分发现来修正搜索。为克服这一局限,近期工作转向智能体方法,即视觉-语言模型通过迭代式工具调用与文档交互,进行搜索、阅读和推理[13 (https://arxiv.org/html/2608.07527#bib.bib24),29 (https://arxiv.org/html/2608.07527#bib.bib33),30 (https://arxiv.org/html/2608.07527#bib.bib34),33 (https://arxiv.org/html/2608.07527#bib.bib32),37 (https://arxiv.org/html/2608.07527#bib.bib27),41 (https://arxiv.org/html/2608.07527#bib.bib25)]。然而,这些系统仍然依赖冻结的闭源骨干模型,其智能体行为主要通过提示词指定,而非从数据中学习。一个自然而然的问题是:智能体本身能否被训练?DocDancer[38 (https://arxiv.org/html/2608.07527#bib.bib26)]采用了一种更简单的方法,通过监督微调在合成的轨迹上训练单个开源模型。然而,DocDancer使用纯文本LLM作为控制器,其Read工具依赖外部VLM进行视觉理解。结果,智能体学到了何时调用工具,但没有学会如何自行解读视觉内容。此外,由于它是通过模仿训练的,其能力也受限于所观察到的专家轨迹的覆盖范围。
DocAtlas通过将文档接口暴露为一个可训练智能体策略的可变环境来填补这些空白。等价地,DocAtlas可以被看作一个可变文档工具框架:它用工具和状态包装VLM,决定每一步搜索、读取、存储、审查和展示哪些文档信息。智能体不仅仅是在固定文档表示上调用工具。每个回合都维护一个环境状态,包括文档、层级树、结构化笔记存储以及已探索页面集合。Search读取这一更新后的状态;Read将选中的页面以markdown、裁剪图和页面图像的形式呈现;Note记录带来源标注的发现并将其写回层级树;Review在后续推理需要时重访先前的笔记。这一循环使后续检索依赖于前期的证据,并帮助智能体在固定上下文预算下跨多步进行推理。由于推理时和RL期间使用相同的交互协议,DocAtlas也提供了一种直接训练紧凑VLM智能体的方式,而不是将工具使用视为固定的提示词脚本。使用GPT-5.4[25 (https://arxiv.org/html/2608.07527#bib.bib14)],DocAtlas在MMLongBench-Doc[21 (https://arxiv.org/html/2608.07527#bib.bib21)]上达到71.4%,超过了65.8%的人类专家参考值。在同一环境中用端到端RL微调的Qwen3.5-4B[27 (https://arxiv.org/html/2608.07527#bib.bib12)] VLM达到63.7%,而直接输入基线只有54.4%。
这项工作有三个贡献:
- • 我们将长文档理解形式化为一个可变状态信息寻求过程,其中阅读和笔记操作会更新决策所依赖的检索和记忆状态。
- • 我们将这一形式化实例化为DocAtlas,一个结合自改进检索、解耦的搜索与阅读、以及结构化笔记和审查操作的工具框架。
- • 我们证明同一环境既支持推理时的大型VLM智能体,也支持紧凑型VLM的端到端RL:DocAtlas在MMLongBench-Doc上使用GPT-5.4达到71.4%,而RL调优的Qwen3.5-4B达到63.7%,直接输入基线为54.4%。
## 2 相关工作
用于长文档理解的多模态检索。多页文档问答[10 (https://arxiv.org/html/2608.07527#bib.bib2),23 (https://arxiv.org/html/2608.07527#bib.bib13),31 (https://arxiv.org/html/2608.07527#bib.bib10),40 (https://arxiv.org/html/2608.07527#bib.bib11)]通常使用多模态RAG处理:页面被嵌入为视觉或文本向量,检索固定top-k子集,然后VLM一次性回答。包括ColPali[7 (https://arxiv.org/html/2608.07527#bib.bib39)]、VisRAG[36 (https://arxiv.org/html/2608.07527#bib.bib44)]、ViDoRe[22 (https://arxiv.org/html/2608.07527#bib.bib45)]和MIRACL-VISION[26 (https://arxiv.org/html/2608.07527#bib.bib46)]在内的近期视觉检索器和基准测试,显示了页面图像检索对具有复杂布局和视觉内容文档的价值。M3DocRAG[3 (https://arxiv.org/html/2608.07527#bib.bib1)]和MDocAgent[11 (https://arxiv.org/html/2608.07527#bib.bib31)]在此静态索引设计上构建了长文档问答流水线,使用视觉或并行文本-图像检索。自适应检索也已在文本问答中通过查询重写[20 (https://arxiv.org/html/2608.07527#bib.bib41)]和自反思检索控制[1 (https://arxiv.org/html/2608.07527#bib.bib42)]得到研究。这些方法调整查询或检索决策,但文档索引本身仍是预先计算的。DocAtlas则在一个回合内通过将基于页面的发现写回层级树来更新检索状态。
智能体式文档理解。近期系统[2 (https://arxiv.org/html/2608.07527#bib.bib4),9 (https://arxiv.org/html/2608.07527#bib.bib3),15 (https://arxiv.org/html/2608.07527#bib.bib5),16 (https://arxiv.org/html/2608.07527#bib.bib6)]从一次性检索转向工具中介的交互:Doc-React迭代子查询[30 (https://arxiv.org/html/2608.07527#bib.bib34)],SimpleDoc结合视觉嵌入与页面摘要[13 (https://arxiv.org/html/2608.07527#bib.bib24)],DocLens将页面导航与元素定位分离[41 (https://arxiv.org/html/2608.07527#bib.bib25)]。与我们的基于树的导航最接近的是DocAgent[29 (https://arxiv.org/html/2608.07527#bib.bib33)],它构建了一个结构化的XML大纲,包含章节层级、页面范围、段落提示、标题和用于获取完整内容的标识符。其大纲主要是一个固定的导航脚手架,而DocAtlas将树视为随问题变化的可变状态,由Note丰富并被后续Search调用观察。现有文档智能体可以被视为手工设计的工具框架,决定检索、展示和携带哪些信息,这与近期LLM工具框架工作[14 (https://arxiv.org/html/2608.07527#bib.bib15),19 (https://arxiv.org/html/2608.07527#bib.bib43)]一致。然而,它们通常依赖冻结的闭源骨干模型,遵循分阶段工具流程,或者不改变文档状态。诸如DocDancer[38 (https://arxiv.org/html/2608.07527#bib.bib26)]之类的基于学习的系统训练工具使用行为,但要么将信用分配分散到多个智能体,要么依赖外部VLM进行视觉读取。DocAtlas将视觉读取、控制、可变记忆和RL优化整合在单一VLM策略中。
## 3 方法
将整篇长文档传给VLM很快就会超出有效的上下文窗口。即使文档能够放入,不相关内容也可能稀释注意力并损害性能[17 (https://arxiv.org/html/2608.07527#bib.bib22)]。静态检索选择固定的页面子集,但无法在证据积累过程中细化搜索。我们将DocAtlas实例化为一个可变文档工具框架。给定文档和问题,该工具框架暴露一组工具,维护文档树和笔记存储,并在智能体搜索、阅读和记录证据时更新二者。与静态检索工具框架不同,后续工具调用所看到的状态取决于先前的交互。我们将其形式化为一个可变状态信息寻求过程:智能体的动作揭示文档内容,并更新后续步骤所用的检索和记忆状态。
术语。我们用*模型*或*骨干模型*指代底层VLM权重,*策略*指代从交互历史到下一步动作的映射,*智能体*指代在DocAtlas工具环境中运行的策略。因此,同一个VLM在讨论其架构或大小时可以被称为模型,在讨论RL或动作选择时可以被称为策略,在与工具和环境状态交互时可以被称为智能体。
给定一个由N页组成的文档D=\{d_1,...,d_N\}和一个自然语言查询q,智能体产生一个轨迹
τ=(q, u_1, o_1, u_2, o_2, ..., u_T, a),(1)
其中每个动作u_t用于标记,如果存在的话。如果该答案不包含可解析的\boxed{}字段,则奖励为0。否则,我们提取最终框内答案的内容,并应用官方的LongDocURL类型感知评估分数:
r=Score_{LongDocURL}(ExtractBoxed(a), a⋆)。(7)
分数仅从提取的框内答案和真实答案计算得出;不使用单独的进程项。
### A.5 定性轨迹示例
图4 (https://arxiv.org/html/2608.07527#A1.F4)和图5 (https://arxiv.org/html/2608.07527#A1.F5)展示了两个完整的DocAtlas推理轨迹。这些示例说明了完整的交互循环:策略首先使用Search在可变文档树中定位宽泛的候选区域,然后对选定的页面或视觉区域调用Read,写入带来源标注的Note条目,可选地使用Review来回忆早期发现,最后产生一个基于页面的答案。这些示例旨在使环境动态具体化,而非作为额外的定量证据。
参见说明
图4:定性轨迹示例:多跳证据收集。DocAtlas迭代式地搜索文档树,读取选定的证据页面,在笔记中记录中间发现,并在回答之前通过审查整合它们。
参见说明
图5:定性轨迹示例:完整的DocAtlas推理流程。该轨迹展示了树搜索、选择性多模态读取、带来源标注的笔记和最终证据整合如何在一个回合内交互。
### A.6 DocAtlas提示词设计
本附录总结了DocAtlas使用的提示词材料和工具调用协议。运行时系统提示词由固定前言、工具使用协议、可选记忆和树注释块、忠实性规则、最终答案格式以及四个技能描述组装而成。
#### A.6.1 系统提示词模板
文档上下文和角色
你是一名专家级文档分析助手。请回答相似文章
DocAtlas:跨越80多种语言的多语言文档理解
DocAtlas是一个框架,通过差异渲染和合成生成,构建了覆盖82种语言的高保真OCR数据集和基准。它表明,直接偏好优化能够改善多语言模型的适配,而不会降低基础语言的性能。
DocOps: 面向复杂文档操作中自主智能体的可验证基准
本文介绍了DocOps,这是一个确定可验证的基准,用于评估自主智能体在复杂文档操作上的表现,揭示了关键失败模式,如长期状态跟踪崩溃、浅层语义验证以及对结构元数据的破坏性编辑。
DocsAlot
DocsAlot 是一款为人类和 AI 系统设计的文档工具。
MARDoc:面向多模态长文档问答的记忆感知精炼代理框架
MARDoc是一种用于多模态长文档问答的记忆感知精炼代理框架,在MMLongBench-Doc和DocBench基准上使用Qwen3-VL模型进行评估,相比基于MLLM、RAG和代理的基线表现出持续改进。
# MemoryDocDataSet:联合对话记忆与长文档推理基准测试
MemoryDocDataSet 是一个全新的合成基准测试,包含 50 个微型世界和 1,000 个问答对,专为同时评估 AI 系统在对话记忆与长文档推理两项联合任务上的表现而设计。最优基线方法(RAG-Both)的整体 F1 值仅为 0.358,凸显了当前系统在将对话记忆与长文档导航能力融为一体方面存在的显著差距。