迈向可验证的多模态深度研究:一种用于交错报告生成的多智能体框架

Hugging Face Daily Papers 论文

摘要

本文提出 Ptah,一种多智能体框架,通过专门智能体和验证机制交错文本与视觉证据,生成可验证的多模态深度研究报告,并引入 PtahEval 进行评估。

大语言模型(LLMs)推动了自主智能体从深度搜索(检索简洁事实答案)向深度研究(将零散证据综合成长篇报告)的进步。然而,可验证的多模态深度研究仍然面临挑战,原因在于其开放式合成缺乏确定性的真实答案,以及需要将文本论证与视觉证据交错呈现。我们提出 Ptah,一种用于交错报告生成的多智能体框架。Ptah 通过规划、研究和写作阶段编排从用户查询到渲染网页报告的完整生命周期:专业智能体构建视觉感知计划、收集基于主张的证据、在视觉工作记忆中维护与源对齐的图像,并通过声明式多模态工具使用撰写报告。验证智能体作为框架的验收函数,在整个工作流中强制执行事实依据、引用保真度和跨模态一致性。我们还引入了 PtahEval,一种评估协议,通过图像级和呈现级评估增强现有基准。在深度研究基准上的实验表明,Ptah 生成的面向用户的多模态报告比强基线更可靠、视觉信息更丰富且更实用。
查看原文
查看缓存全文

缓存时间: 2026/05/29 07:00

论文页面 - 面向可验证多模态深度研究:用于交错报告生成的多智能体系统框架

来源:https://huggingface.co/papers/2605.29861

摘要

多智能体系统,通过专门智能体和验证机制交错文本与视觉证据,生成可靠且视觉信息丰富的多模态报告。

大型语言模型(LLM)推动了自主智能体从深度搜索(检索简明事实答案)向深度研究(将分散证据综合成长篇报告)的演进。然而,可验证的多模态深度研究仍面临挑战,原因在于:开放式综合缺乏确定性真值,以及需要将文本论证与视觉证据交错呈现。我们提出Ptah——一个用于交错报告生成的多智能体系统框架。Ptah协调从用户查询到呈现网页报告的完整生命周期,涵盖规划、研究和撰写阶段:专门智能体构建视觉感知计划、收集基于主张的证据、在视觉工作记忆中维护与来源一致的图像,并通过声明式多模态工具使用撰写报告。验证智能体作为框架的验收函数,在流程中强制执行事实依据、引用忠实性和跨模态一致性。我们还引入PtahEval,一种评估协议,在现有基准基础上增加了图像级和呈现级评估。在深度研究基准上的实验表明,Ptah生成的多模态报告比强基线方法更可靠、视觉信息更丰富、更便于人类使用。

查看 arXiv 页面 (https://arxiv.org/abs/2605.29861)查看 PDF (https://arxiv.org/pdf/2605.29861)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29861)

在您的智能体中获取此论文:

hf papers read 2605.29861

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.29861 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.29861 以从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2605.29861 以从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

请将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从此页面链接。

相似文章

DuMate-DeepResearch:一个可审计的多智能体系统,具备递归搜索与基于评分标准的推理

arXiv cs.AI

本技术报告介绍了DuMate-DeepResearch,一个用于深度研究任务的多智能体框架。该框架将智能体核心与工具生态系统解耦,并集成了基于图的动态规划、递归双层执行以及基于评分标准的测试时优化。该系统在两个深度研究基准测试中取得了最先进的结果,展示了可审计智能体基础设施的价值。

PresentAgent-2: 迈向通用多模态演示代理

Hugging Face Daily Papers

PresentAgent-2 是一个智能体框架,通过开展调研、创建多模态幻灯片并生成跨单人、讨论和互动模式的交互式内容,根据用户查询生成演示视频。