迈向可验证的多模态深度研究:一种用于交错报告生成的多智能体框架
摘要
本文提出 Ptah,一种多智能体框架,通过专门智能体和验证机制交错文本与视觉证据,生成可验证的多模态深度研究报告,并引入 PtahEval 进行评估。
查看缓存全文
缓存时间: 2026/05/29 07:00
论文页面 - 面向可验证多模态深度研究:用于交错报告生成的多智能体系统框架
来源:https://huggingface.co/papers/2605.29861
摘要
多智能体系统,通过专门智能体和验证机制交错文本与视觉证据,生成可靠且视觉信息丰富的多模态报告。
大型语言模型(LLM)推动了自主智能体从深度搜索(检索简明事实答案)向深度研究(将分散证据综合成长篇报告)的演进。然而,可验证的多模态深度研究仍面临挑战,原因在于:开放式综合缺乏确定性真值,以及需要将文本论证与视觉证据交错呈现。我们提出Ptah——一个用于交错报告生成的多智能体系统框架。Ptah协调从用户查询到呈现网页报告的完整生命周期,涵盖规划、研究和撰写阶段:专门智能体构建视觉感知计划、收集基于主张的证据、在视觉工作记忆中维护与来源一致的图像,并通过声明式多模态工具使用撰写报告。验证智能体作为框架的验收函数,在流程中强制执行事实依据、引用忠实性和跨模态一致性。我们还引入PtahEval,一种评估协议,在现有基准基础上增加了图像级和呈现级评估。在深度研究基准上的实验表明,Ptah生成的多模态报告比强基线方法更可靠、视觉信息更丰富、更便于人类使用。
查看 arXiv 页面 (https://arxiv.org/abs/2605.29861)查看 PDF (https://arxiv.org/pdf/2605.29861)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29861)
在您的智能体中获取此论文:
hf papers read 2605.29861
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.29861 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.29861 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.29861 以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
请将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
数据记者智能体:将数据转化为可验证的多模态故事
本文介绍了数据记者智能体(Data2Story),一个多智能体框架,通过生成基于证据的多模态新闻故事来自动化数据新闻,同时确保透明性和可验证性。
TVIR:构建面向文本-视觉交织报告生成的深度研究代理
介绍了TVIR,一个用于生成文本-视觉交织报告的基准和层次化多代理框架,评估了自动化报告生成中的事实可靠性和视觉对齐。
DuMate-DeepResearch:一个可审计的多智能体系统,具备递归搜索与基于评分标准的推理
本技术报告介绍了DuMate-DeepResearch,一个用于深度研究任务的多智能体框架。该框架将智能体核心与工具生态系统解耦,并集成了基于图的动态规划、递归双层执行以及基于评分标准的测试时优化。该系统在两个深度研究基准测试中取得了最先进的结果,展示了可审计智能体基础设施的价值。
HarnessEval-W: 智能体化视觉世界的评估
HarnessEval-W 引入了一种针对世界模型的智能体化评估管道,使用层级化的子智能体将评估分解为透明的推理链,并在18个模型上进行基准测试,以与人类偏好对齐。
Video-DeepResearch:迈向下一代多模态深度研究智能体
Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。