Mr.LHDR: 一个针对多模态真实世界长周期深度研究代理的基准

arXiv cs.AI 论文

摘要

本文介绍了Mr.LHDR,一个用于评估多模态真实世界长周期深度研究代理的基准,表明当前模型在复杂推理链中难以实现依赖一致的证据整合。

arXiv:2609.11318v1 公告类型:新 摘要:深度研究代理在网络搜索、工具使用、多模态证据分析和信息综合方面的能力日益增强。然而,现有基准主要评估中周期探索,很少测试代理能否维持长期、依赖性强的研究过程。我们介绍了Mr.LHDR(多模态真实世界长周期深度研究),一个用于评估跨越八个类别的长期、不可约简的依赖证据链的真实世界深度研究的基准。每个问题都基于一个隐藏的节点-关系图构建,平均需要12.1个必要的中间结论,平均依赖深度为10.4,才能得到一个简短、唯一且可验证的答案。问题包含多模态证据,包括图像、地图、PDF、标志、图表、表格和视频帧,其中至少有一个非文本元素会改变推理状态。Mr.LHDR不仅评估最终答案,还评估在标注依赖关系下中间结论的正确性。我们使用总体准确率(OA)、严格准确率(SA)、检查表分数(CS)和依赖感知检查表分数(DACS)来评估通用模型、深度研究系统和代理框架。结果表明,即使是最强的系统也仅达到43.1%的OA和34.3%的SA,表明最终答案的准确性大大高估了完整研究的成功。移除图像使DACS降低了12.6分,证明了多模态证据的重要性,而SA随着推理链变长而持续下降。这些发现揭示了持续的、依赖一致的证据整合,而非孤立的事实检索,是当前深度研究代理的关键瓶颈。
查看原文
查看缓存全文

缓存时间: 2026/09/12 08:26

# 多模态真实世界长程深度研究智能体基准测试  
来源:https://arxiv.org/html/2609.11318  

郭明浩*[email protected]  
曹萌* [email protected]  
机构:穆罕默德·本·扎耶德人工智能大学  
赵 [email protected]  
机构:中国科学技术大学  
宁思宇[email protected]  
机构:中国科学技术大学  
王鑫 [email protected]  
机构:中国科学技术大学  
赵浩哲 [email protected]  
机构:穆罕默德·本·扎耶德人工智能大学  
杨嘉轩 [email protected]  
机构:浙江大学  
何海虹 [email protected]  
机构:中国科学技术大学  
韩明飞 [email protected]  
机构:穆罕默德·本·扎耶德人工智能大学  
荣顺林  
机构:腾讯  
吴海军  
机构:腾讯  
梁晓丹 [email protected]  
机构:穆罕默德·本·扎耶德人工智能大学  
常晓军 [email protected]  
机构:穆罕默德·本·扎耶德人工智能大学  

###### 摘要  
深度研究智能体在网页搜索、工具调用、多模态证据检验及多源信息综合方面的能力日益增强。然而现有基准测试大多局限于中等规模的证据探索。例如MM-BrowseComp平均每题仅包含3.0个核查项,未能充分检验智能体维持长程深度研究的能力。为此,我们推出Mr.LHDR(多模态真实世界长程深度研究)基准,该基准设计用于评估跨越八个类别的、基于长且不可简化的依赖性证据链的真实世界深度研究。每个问题基于隐藏的节点-关系图构建,平均需要12.1个必要的中间结论,平均依赖深度达10.4,最终得出简短、唯一且可验证的答案。我们为每个问题设计多个关键步骤涉及图像、地图、PDF、标识、图表、表格或视频帧。作为严格包含标准,每个问题至少包含一个能改变推理状态的非文本证据。因此Mr.LHDR既评估智能体是否返回最终答案,也评估在标注依赖关系下其陈述的中间结论是否正确。  

我们使用总体准确率(OA)、严格准确率(SA)、核查表分数(CS)和依赖感知核查表分数(DACS)对常规模型、专用深度研究系统和基于框架的智能体进行评估。实验发现:(1)OA最高的GPT-5.5运行仅达43.1% OA和34.3% SA,而OA最高的专用深度研究系统o3 Deep Research达32.4% OA和19.6% SA,表明最终答案准确率大幅高估了完整、依赖一致的任务成功率;(2)在控制消融实验中,屏蔽图像使DACS降低12.6个百分点,证实非文本证据对推理链具有实质性贡献;(3)在核查表长度范围有充足观测时,所有代表性模型的SA随链长单调递减。  

这些发现共同表明,持续、依赖一致的证据整合而非孤立的事实检索,是当前深度研究智能体的核心瓶颈。  
代码与数据可在https://github.com/minghaoguo20/Mr-LHDR-eval获取。  
††脚注文本:*同等贡献。  

## 1 引言  
AI智能体越来越需要执行深度研究而非回答孤立问题(Zheng等,2025 (https://arxiv.org/html/2609.11318#bib.bib37);Zhang等,2025 (https://arxiv.org/html/2609.11318#bib.bib38);Du等,2025 (https://arxiv.org/html/2609.11318#bib.bib19))。有用的研究助手应分解不明确的目标、跨异构源搜索、检查视觉与文档证据、维护中间结论,并依据累积证据验证最终答案。许多现实任务遵循此模式:智能体可能需要在图像中识别对象、追溯网络上的实体链、阅读地图、图表或PDF,然后将证据整合为简短的事实性答案。  

难度不仅源于晦涩的个别事实,更在于早期错误可能引导整个调查偏离。现有基准在评估网络赋能智能体方面已取得重要进展(Wei等,2025 (https://arxiv.org/html/2609.11318#bib.bib7);Zhou等,2025 (https://arxiv.org/html/2609.11318#bib.bib18);Li等,2025d (https://arxiv.org/html/2609.11318#bib.bib20);Du等,2025 (https://arxiv.org/html/2609.11318#bib.bib19)),但未完全覆盖此场景。BrowseComp式任务强调在开放网络中寻找难找信息,适用于测量搜索与浏览能力,但仍以文本为中心。MM-BrowseComp式任务增加了多模态浏览,但集中于短至中等规模研究:MM-BrowseComp平均每题仅3.0个核查项(Li等,2025d (https://arxiv.org/html/2609.11318#bib.bib20)),依赖证据链的长序列大多未被测试。  

Mr.LHDR针对真实调查中发现的长程、紧密耦合、多源、跨模态研究过程。强智能体可能解决单个浏览或多模态步骤,但当任务需要多个依赖步骤、跨模态桥接和反复验证时仍会失败。图1(https://arxiv.org/html/2609.11318#S1.F1)通过一个公开MM-BrowseComp示例和一个Mr.LHDR示例说明此区别。  
**图注**:标注结构深度比较。公开的MM-BrowseComp图像输入示例使用四个顺序核查项;其224项发布版平均每题3.0项(Li等,2025d (https://arxiv.org/html/2609.11318#bib.bib20))。Mr.LHDR示例使用两个前提分支中的12个必要结论,完整基准平均12.1个结论、依赖深度10.4。两种设置均需多模态网络研究与简短可验证答案。节点表示结论而非浏览动作;箭头表示标注的前提条件。  

我们推出Mr.LHDR(多模态真实世界长程深度研究),一个用于真实世界开放网络研究任务的基准。Mr.LHDR包含八个类别共102个问题。每项包括自然语言问题、简短可验证答案、源证据、多模态证据、必要中间结论的不可简化核查表、类别标签、粗略作者模板标签和操作标签。最终答案刻意设计为简短、唯一且稳定,如人名、地名、组织名、年份、数字、颜色或短语。Mr.LHDR将真实世界研究任务构建为可验证的简短问答,其难度源于真实证据依赖。  

Mr.LHDR的设计遵循三项原则:  
(1) **结构深度**。长程指前提关联证据结构的深度而非输入/输出长度:智能体必须在依赖步骤间维持演化的研究状态,而非仅处理长提示或生成长响应。  
(2) **开放世界多模态调查**。解决单项可能需要分解目标、定位网页/PDF/图像/地图/视频/音频/表格中的证据、跨模态桥接信息、维护中间结论、反复验证约束并返回最终简短答案。  
(3) **依赖感知评估**。Mr.LHDR报告总体准确率(OA)、严格准确率(SA)、核查表分数(CS)和依赖感知核查表分数(DACS),以区分最终答案正确性、完整响应正确性、中间结论覆盖率和依赖一致覆盖率。SA、CS和DACS基于提交响应中陈述的结论计算,DACS额外要求其标注前提条件得到满足。由于这些指标不观察智能体内部推理,也不确认陈述结论是否来自实际检索,因此评估的是依赖一致的陈述结论而非实际证据链完成度。  

我们在Mr.LHDR上评估了25个常规模型、专用深度研究系统和基于框架的智能体,得出四个主要发现:  
**第一,当前系统远未饱和。** OA最高的常规模型GPT-5.5仅达43.1% OA和34.3% SA;OA最强的专用系统o3 Deep Research达32.4% OA和19.6% SA;DeerFlow(qwen3-vl-235b)达15.7% OA和9.8% SA。  
**第二,最终答案成功高估完整任务执行。** 显著的OA-SA差距表明正确最终答案常与缺失必要结论并存,而DACS低于CS揭示存在前提缺失的结论。  
**第三,视觉证据显著提升证据链恢复。** 在控制相同模型的消融实验中,提供图像使DACS从21.6%升至34.2%,提升12.6个百分点(95% CI [6.9, 18.9])。  
**第四,更长证据链增加严格完成压力。** 在至少有20项观测的三个核查表长度范围中,所有代表性模型的SA随核查表长度单调递减。由于许多相邻系统置信区间重叠,这些结果支持广泛的能力模式而非统计可分的排名。  

##### 贡献。本文贡献如下:  
- •**长程多模态深度研究基准**。我们引入Mr.LHDR,一个包含八个真实世界类别共102个问题的开放网络基准。每个问题采用节点-关系设计,配有多模态源证据、简短唯一可验证答案及作为作者验证依赖DAG的不可简化核查表。基准包含1231个标注中间结论,平均依赖深度10.4,通过前提关联证据结构实现长程难度操作化。  
- •**依赖感知评估协议**。我们引入依赖感知核查表分数(DACS),递归地将每个陈述结论的得分条件化为其标注前提的正确性。结合总体准确率(OA)、严格准确率(SA)和核查表分数(CS),该协议区分最终答案正确性、完整响应正确性、中间结论覆盖率和依赖一致覆盖率,实现对异构研究系统的统一评估。  
- •**当前研究系统的系统实证研究**。我们评估了涵盖工具增强VLM、无工具VLM、专用深度研究系统和基于框架智能体的25个系统。结果揭示最终答案正确性与完整陈述结论正确性之间、核查表覆盖率与依赖一致覆盖率之间存在系统性差距。使用相同模型的控制图像消融进一步证明视觉证据对恢复依赖约束结论的贡献。自举不确定性估计以及评审员和依赖图的稳健性分析支持了这些发现。  

## 2 相关工作  
##### 多模态理解与证据基准。最近的多模态大型语言模型已超越图像-文本感知,支持文档、图表、视频、屏幕、长上下文及智能体中心视觉推理。Li等(2025a)(https://arxiv.org/html/2609.11318#bib.bib22);Guo等(2025)(https://arxiv.org/html/2609.11318#bib.bib23);Team等(2025)(https://arxiv.org/html/2609.11318#bib.bib24);Bai等(2025)(https://arxiv.org/html/2609.11318#bib.bib25)体现了向通用多模态理解、长上下文定位及交错视觉文本输入推理的转变。  

多模态评估也随之发展。Liu等(2024)(https://arxiv.org/html/2609.11318#bib.bib8)和Yue等(2023)(https://arxiv.org/html/2609.11318#bib.bib27)评估广泛与专家级推理;Masry等(2022)(https://arxiv.org/html/2609.11318#bib.bib28)和Mathew等(2020)(https://arxiv.org/html/2609.11318#bib.bib29)聚焦图表与文档图像;较新的证据导向基准研究长多模态文档、检索增强视觉文化理解、多模态文档RAG及参数知识与外部多模态证据间的冲突(Duan等,2024 (https://arxiv.org/html/2609.11318#bib.bib26);Huybrechts等,2025 (https://arxiv.org/html/2609.11318#bib.bib40);Li等,2025b (https://arxiv.org/html/2609.11318#bib.bib30);Dong等,2025 (https://arxiv.org/html/2609.11318#bib.bib31);Jia等,2025 (https://arxiv.org/html/2609.11318#bib.bib32))。这些研究共同确立了证据选择、跨模态整合、领域知识和对抗冲突先验稳健性的重要性。  

然而在这些基准中,证据通常随查询提供、包含在固定语料库内或在预定义文档/RAG设置中检索。Mr.LHDR考虑一种互补的开放研究场景:智能体必须在开放网络中发现必要的非文本证据,将其与演化的文本及符号约束关联,并在长程节点-关系研究过程中保持中间结论。  

##### 工具增强浏览与深度研究智能体。工具增强智能体通过搜索引擎、浏览器、API、代码执行及其他外部工具扩展语言和多模态模型。Nakano等(2021)(https://arxiv.org/html/2609.11318#bib.bib33)、Yao等(2023)(https://arxiv.org/html/2609.11318#bib.bib1)和Schick等(2023)(https://arxiv.org/html/2609.11318#bib.bib34)确立了浏览器辅助问答、交错推理与行动及学习工具调用的早期范式。  

近期搜索与深度研究训练工作从检索增强回答转向规划搜索、分解问题、检查来源并在多轮中修正中间状态的智能体。示例包括Li等(2025e)(https://arxiv.org/html/2609.11318#bib.bib35);Song等(2025)(https://arxiv.org/html/2609.11318#bib.bib36);Jin等(2025)(https://arxiv.org/html/2609.11318#bib.bib9);Zheng等(2025)(https://arxiv.org/html/2609.11318#bib.bib37);Zhang等(2025)(https://arxiv.org/html/2609.11318#bib.bib38);Li等(2025c)(https://arxiv.org/html/2609.11318#bib.bib39)。面向用户的系统包括OpenAI(2025)(https://arxiv.org/html/2609.11318#bib.bib10);Google(2024)(https://arxiv.org/html/2609.11318#bib.bib11);Perplexity AI(2025)(https://arxiv.org/html/2609.11318#bib.bib12);xAI(2025)(https://arxiv.org/html/2609.11318#bib.bib13);Microsoft(2024)(https://arxiv.org/html/2609.11318#bib.bib14)以及开源框架如ByteDance(2026)(https://arxiv.org/html/2609.11318#bib.bib15)反映了向多步研究工作流和报告综合的相同转变。  

尽管这些进展表明智能体可搜索、浏览、调用工具、收集来源并综合长形式输出,但它们留下一个更具体的评估问题:智能体能否在长时间范围内维持研究状态并保持依赖一致性?

相似文章

LongDS-Bench:论长时域智能体数据分析的失败

arXiv cs.LG

介绍LongDS,一个用于评估LLM智能体在长时域、多轮数据分析任务上的基准。评估表明,即使最佳模型也仅达到48.45%的准确率,性能随轮次急剧下降,凸显出维护分析状态是关键瓶颈。