迈向可验证的多模态深度研究:一种用于交错报告生成的多智能体框架
摘要
本文提出 Ptah,一种多智能体框架,通过专门智能体和验证机制交错文本与视觉证据,生成可验证的多模态深度研究报告,并引入 PtahEval 进行评估。
查看缓存全文
缓存时间: 2026/05/29 07:00
论文页面 - 面向可验证多模态深度研究:用于交错报告生成的多智能体系统框架
来源:https://huggingface.co/papers/2605.29861
摘要
多智能体系统,通过专门智能体和验证机制交错文本与视觉证据,生成可靠且视觉信息丰富的多模态报告。
大型语言模型(LLM)推动了自主智能体从深度搜索(检索简明事实答案)向深度研究(将分散证据综合成长篇报告)的演进。然而,可验证的多模态深度研究仍面临挑战,原因在于:开放式综合缺乏确定性真值,以及需要将文本论证与视觉证据交错呈现。我们提出Ptah——一个用于交错报告生成的多智能体系统框架。Ptah协调从用户查询到呈现网页报告的完整生命周期,涵盖规划、研究和撰写阶段:专门智能体构建视觉感知计划、收集基于主张的证据、在视觉工作记忆中维护与来源一致的图像,并通过声明式多模态工具使用撰写报告。验证智能体作为框架的验收函数,在流程中强制执行事实依据、引用忠实性和跨模态一致性。我们还引入PtahEval,一种评估协议,在现有基准基础上增加了图像级和呈现级评估。在深度研究基准上的实验表明,Ptah生成的多模态报告比强基线方法更可靠、视觉信息更丰富、更便于人类使用。
查看 arXiv 页面 (https://arxiv.org/abs/2605.29861)查看 PDF (https://arxiv.org/pdf/2605.29861)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29861)
在您的智能体中获取此论文:
hf papers read 2605.29861
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.29861 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.29861 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.29861 以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
请将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
数据记者智能体:将数据转化为可验证的多模态故事
本文介绍了数据记者智能体(Data2Story),一个多智能体框架,通过生成基于证据的多模态新闻故事来自动化数据新闻,同时确保透明性和可验证性。
TVIR:构建面向文本-视觉交织报告生成的深度研究代理
介绍了TVIR,一个用于生成文本-视觉交织报告的基准和层次化多代理框架,评估了自动化报告生成中的事实可靠性和视觉对齐。
DuMate-DeepResearch:一个可审计的多智能体系统,具备递归搜索与基于评分标准的推理
本技术报告介绍了DuMate-DeepResearch,一个用于深度研究任务的多智能体框架。该框架将智能体核心与工具生态系统解耦,并集成了基于图的动态规划、递归双层执行以及基于评分标准的测试时优化。该系统在两个深度研究基准测试中取得了最先进的结果,展示了可审计智能体基础设施的价值。
PresentAgent-2: 迈向通用多模态演示代理
PresentAgent-2 是一个智能体框架,通过开展调研、创建多模态幻灯片并生成跨单人、讨论和互动模式的交互式内容,根据用户查询生成演示视频。
用于高中成绩单自动处理的多智能体AI系统:大规模协作式文档分析
本文介绍了一个多智能体AI系统,包含由协调智能体协调的专业智能体(模式识别、语义分析、视觉智能),用于自动处理多样化的高中成绩单。在来自13个州的40份成绩单测试集上,实现了96.7%的准确率和每份45秒的处理速度。