Struct-Searcher:基于主体结构思维推进多模态深度信息获取
摘要
Struct-Searcher 引入了一种基于信念修正理论的结构化主体工作流,用于多模态深度信息获取,相较于现有的视觉语言模型和深度研究智能体,实现了显著的准确率提升。
查看缓存全文
缓存时间: 2026/06/10 05:45
论文页面 - Struct-Searcher:基于结构化思维的智能体推动多模态深度信息检索
来源:https://huggingface.co/papers/2606.07689
摘要
Struct-Searcher 引入了一种基于信念修正理论的结构化智能体工作流,用于多模态信息检索,相比现有视觉语言模型和深度研究智能体,显著提升了准确性。
深度研究智能体 (https://huggingface.co/papers?q=Deep%20research%20agents) 因其能够大规模收集在线信息以获取目标知识而受到越来越多的关注,近期研究方向已从纯文本信息检索转向多模态场景。然而,现有的智能体工作流大多与证据积累模型 (https://huggingface.co/papers?q=evidence%20accumulation%20models) 保持一致,这些模型线性地聚合证据,缺乏处理跨异质模态矛盾信息的原则性机制。为此,我们提出 Struct-Searcher,一种基于信念修正理论 (https://huggingface.co/papers?q=belief%20revision%20theory) 的结构化智能体工作流 (https://huggingface.co/papers?q=structural%20agentic%20workflow),该工作流在整个推理过程中显式维护一个不断演变的多模态结构图 (https://huggingface.co/papers?q=multimodal%20structural%20graph),从而能够实现有效的冲突感知型多模态深度信息检索。在多个基准数据集和骨干模型上的广泛实验表明,Struct-Searcher 具有以下特点:(1) 即插即用且与模型无关,在 BrowseComp-VL 上使用五种不同骨干模型时,平均相对准确率提升了 17.2%;(2) 性能领先,一致性地优于最先进的视觉语言模型 (https://huggingface.co/papers?q=vision-language%20models) (VLM) 和深度研究智能体 (https://huggingface.co/papers?q=deep%20research%20agents),在 MM-BrowseComp、HLE-VL 和 BrowseComp-VL 上相较于次优方法,相对准确率分别提升了 3.7%、1.5% 和 0.7%。
查看 arXiv 页面 (https://arxiv.org/abs/2606.07689)查看 PDF (https://arxiv.org/pdf/2606.07689)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.07689)
引用该论文的模型0
暂无模型关联该论文
请在模型 README.md 中引用 arxiv.org/abs/2606.07689 以在此页面建立链接。
引用该论文的数据集0
暂无数据集关联该论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.07689 以在此页面建立链接。
引用该论文的 Space0
暂无 Space 关联该论文
请在 Space README.md 中引用 arxiv.org/abs/2606.07689 以在此页面建立链接。
包含该论文的收藏集0
暂无包含该论文的收藏集
请将该论文添加到收藏集 (https://huggingface.co/new-collection) 中以在此页面建立链接。
相似文章
Visual-Seeker: 通过主动视觉推理实现视觉原生多模态代理搜索
Visual-Seeker 提出了一种视觉原生多模态深度搜索代理,它主动推理细粒度视觉细节并综合多模态证据,在五个具有挑战性的多模态搜索基准上实现了最先进的性能。
自主代理搜索模型(5分钟阅读)
自主代理搜索模型是专门为编排搜索任务而训练的LLM,相比GPT-5等通用模型,它们提供更小、更快且领域特定的替代方案。这些模型通过让智能模型管理整个检索过程,解构了传统的单体搜索栈。
SearchEyes:通过搜索世界模拟迈向前沿多模态深度搜索智能
SearchEyes 使用带类型的知识图谱作为模拟搜索世界的骨干,统一了训练数据、搜索环境和奖励信号。它提出了感知知识链(PKC)用于多跳路径采样,以及跳锚策略优化(HaPO)用于步级信用分配,在多模态知识密集型基准测试中取得了最先进的性能。
重新思考基于 Pi-Serini 的智能体搜索:词法检索是否足够?
本文介绍了 Pi-Serini,这是一个基于 BM25 的智能体搜索系统。该系统证明了当智能体优化查询时,词法检索足以支持深度搜索,相比默认设置,它在实现高准确率的同时降低了成本。
迭代优化搜索:用于评估电商中智能搜索架构的双智能体模拟框架
eBay的这篇论文提出了一个模块化的双智能体模拟框架,用于评估对话式购物助手架构,能够对响应器设计进行受控比较。关键发现包括:滚动窗口内存在速度上比意图提取内存快35%,系统性故障分析将故障率降低了62%。