基于蒙特卡洛树搜索的表格到多模态报告生成
摘要
介绍了MCTS-Report,一种基于蒙特卡洛树搜索的框架,用于从表格数据生成多模态报告,同时提出了MMRBench基准。它在结构完整性、数值准确性、图表-文本对齐和洞察新颖性方面优于强基线。
arXiv:2608.04071v1 Announce Type: new
摘要:从结构化表格数据自动生成包含文本分析和可视化图表的专业多模态报告是数据智能中的一个关键挑战。现有方法受限于固定的线性流程和孤立的子任务处理,这阻碍了事实准确性、视觉质量和叙事连贯性的联合优化。为了解决这些问题,本文提出了MCTS-Report,一种由蒙特卡洛树搜索(MCTS)驱动的框架,将多模态表格到报告生成构建为结构化搜索空间上的渐进式构建过程。核心思想是将报告生成分解为原子操作,包括章节规划、可视化任务识别、图表生成、见解组织和叙述优化,每个操作由LLM基于当前报告状态的动态推理来执行。我们使用LLM在MCTS期间生成逐步推理和操作,并将推理轨迹存储在每个节点中,以实现上下文感知的、连贯的报告构建。为了指导搜索,我们设计了一个多维奖励函数,联合评估数值事实一致性(通过SQL)、图表质量、图表-文本对齐和结构完整性,同时引入多样性惩罚以抑制重复图表,并进行前置条件检查以剪枝无效操作。我们还构建了MMRBench,这是一个综合基准,包含来自六个领域的真实世界表格,并配有专家精炼的参考报告结构和可验证的关键见解。在MMRBench上的实验表明,MCTS-Report在结构完整性、数值准确性、图表-文本对齐和洞察新颖性方面显著优于强基线,取得了77.9的总体得分。
查看缓存全文
缓存时间: 2026/08/06 07:41
# 用于表格到多模态报告生成的蒙特卡洛树搜索
来源:https://arxiv.org/html/2608.04071
###### 摘要
从结构化表格数据自动生成包含文本分析和可视化图表的专业多模态报告,是数据智能领域的一项关键挑战。现有方法受限于固定的线性流程和孤立的子任务处理,这阻碍了事实准确性、视觉质量和叙事连贯性的联合优化。为解决这些问题,本文提出 MCTS-Report,一种基于蒙特卡洛树搜索(MCTS)驱动的框架,将多模态表格到报告生成问题定义为在结构化搜索空间上的渐进式构建过程。其核心思想是将报告生成分解为原子动作,包括章节规划、可视化任务识别、图表生成、洞察组织和叙述润色,每一步都由大语言模型(LLM)根据当前报告状态进行动态推理来执行。我们使用 LLM 在 MCTS 过程中生成逐步的推理和动作,并将推理轨迹存储在每个节点中,以实现上下文感知、连贯的报告构建。为引导搜索,我们设计了一个多维奖励函数,联合评估数值事实一致性(通过 SQL)、图表质量、图表-文本对齐和结构完整性,同时引入多样性惩罚以抑制重复图表,并通过前置条件检查剪枝无效动作。我们还构建了 MMRBench,一个综合基准,包含来自六个领域的真实世界表格,并配以专家精炼的参考报告结构和可验证的关键洞察。在 MMRBench 上的实验表明,MCTS-Report 在结构完整性、数值准确性、图表-文本对齐和洞察新颖性方面显著优于强基线,取得了 77.9 的总体得分。
## 引言
从结构化表格自动生成包含文本分析和可视化图表的专业多模态报告,是数据智能中一项日益重要的能力(Huang et al. 2026 (https://arxiv.org/html/2608.04071#bib.bib28); Lin et al. 2026c (https://arxiv.org/html/2608.04071#bib.bib54))。与传统表格问答或纯文本摘要不同,多模态报告生成要求模型同时解析表格数据、生成连贯的自然语言叙述、设计和渲染合适的图表,并最终生成将文本与视觉元素以逻辑连贯性和事实可信度整合在一起的报告。随着企业和研究机构越来越多地部署 AI 代理进行数据分析,使系统能够可靠地生成和评估此类多模态报告已成为一个紧迫且具有挑战性的研究问题(Lin 2025a (https://arxiv.org/html/2608.04071#bib.bib53); Lin et al. 2026b (https://arxiv.org/html/2608.04071#bib.bib1))。
尽管在表格推理和报告生成方面取得了近期进展,现有方法仍存在两个根本性局限。**(1) 固定的线性流程。** 大多数当前系统遵循预定的执行路径(例如,表格解析 → 图表生成 → 文本撰写 → 润色)。这种固定顺序阻碍了任何形式的回溯或全局优化:一旦基于对数据的不完整理解生成了图表,后续的文本分析就必须去适应图表,而不是让图表服务于分析。**(2) 孤立的子任务处理。** 现有方法顺序地或孤立地处理表格解析、图表生成和内容评估等子任务。这些目标被分开优化,彼此之间没有相互验证或调整。例如,图表生成可能优先考虑视觉美学而忽略对源表格的事实保真度,或者文本分析可能做出数字断言,而这些断言在随附图表中没有视觉支持。近期的研究已指出,图表-文本不一致是数据驱动报告生成中一个长期存在的问题(Lin et al. 2026a (https://arxiv.org/html/2608.04071#bib.bib11); Yang et al. 2026 (https://arxiv.org/html/2608.04071#bib.bib12)),分阶段的流程常常导致“洞察冻结”和浅层分析(Lin et al. 2026a (https://arxiv.org/html/2608.04071#bib.bib11), 2025b (https://arxiv.org/html/2608.04071#bib.bib56); Lin 2025b (https://arxiv.org/html/2608.04071#bib.bib58), c (https://arxiv.org/html/2608.04071#bib.bib57))。
除了这些方法论上的缺陷,评估基准也面临关键空白。早期基准如 WikiTableQuestions(Pasupat and Liang 2015 (https://arxiv.org/html/2608.04071#bib.bib21))、FeTaQA(Nan et al. 2022 (https://arxiv.org/html/2608.04071#bib.bib34))和 TabFact(Chen et al. 2020 (https://arxiv.org/html/2608.04071#bib.bib26))专注于狭窄的表格问答或句子级文本生成。较新的基准如 T2R-Bench(Zhang et al. 2025 (https://arxiv.org/html/2608.04071#bib.bib30))和 DDR-Bench(Liu et al. 2026a (https://arxiv.org/html/2608.04071#bib.bib29))支持文章级报告生成,但仍局限于文本输出,完全忽略了视觉图表——而视觉图表是商业报告的重要组成部分。与此同时,LLM 作为裁判(LLM-as-a-judge)的范式容易受到奖励黑客(reward hacking)的影响(Zheng et al. 2023 (https://arxiv.org/html/2608.04071#bib.bib14); Zhao et al. 2026 (https://arxiv.org/html/2608.04071#bib.bib13)),现有的可视化评估方法(例如 VisEval(Chen et al. 2024 (https://arxiv.org/html/2608.04071#bib.bib20))、VIS-Shepherd(Pan et al. 2025 (https://arxiv.org/html/2608.04071#bib.bib18)))与源表格及随附的文本分析脱节。MMDR-Bench(Huang et al. 2026 (https://arxiv.org/html/2608.04071#bib.bib28))为深度研究报告提出了多阶段评估及视觉证据保真度检查。目前还没有基准能够以统一的方式整合结构化表格、多模态报告生成和可验证的多维评估(Lin et al. 2025a (https://arxiv.org/html/2608.04071#bib.bib123))。
为了同时解决方法论和评估方面的不足,我们提出了 MCTS-Report,一个从根本上重新构思多模态报告生成的新框架。我们不再设计由专门代理组成的复杂流水线,而是将报告构建定义为一个在部分报告构成的树形搜索空间中的结构化搜索问题。在该公式中,根节点代表空的报告框架,叶节点对应完整报告,每条边表示一个构建动作,例如规划章节、识别值得可视化的洞察、生成可视化,或优化叙述流程。
为了高效地导航这个指数级增长的搜索空间,我们采用了蒙特卡洛树搜索(MCTS)(Coulom 2007 (https://arxiv.org/html/2608.04071#bib.bib16))。MCTS 通过迭代的选择、扩展、模拟和反向传播,为平衡探索(尝试新的报告结构)和利用(优化有前景的结构)提供了一种原则性机制。MCTS-Report 在整个搜索过程中使用单一的 LLM 作为统一的“动作-评估”引擎。
该设计相比现有方法具有三个决定性优势。**(1)** MCTS 实现了全局优化:系统可以从死胡同回溯并探索替代的报告结构,避免了线性流程的“洞察冻结”。**(2)** 统一的 LLM 驱动框架消除了对脆弱的多代理协调的需求,简化了系统设计并减少了错误传播。**(3)** 自监督奖励确保事实正确性和跨模态一致性能够被联合优化,而无需在训练期间依赖可能有偏见的 LLM 作为裁判的评估。
在 MCTS-Report 之外,我们构建了 MMRBench,一个用于表格到多模态报告生成的综合基准。MMRBench 包含来自六个领域(金融、制造业、医疗健康、教育、零售和 IT 运维)的 185 个真实世界表格,每个表格都配有专家精炼的参考报告和可验证的关键洞察点。该基准支持在四个维度上进行系统评估:结构完整性、数值准确性、图表-文本对齐和洞察新颖性。与之前的基准不同,MMRBench 在统一框架中整合了结构化表格、多模态输出和多维评估。
**贡献。** 本工作做出了三项主要贡献:
- • **MCTS-Report 框架:** 提出了一个新颖的 MCTS 驱动框架,将多模态报告生成重新定义为结构化搜索问题,使用单一 LLM 作为统一的动作-评估引擎,联合优化事实准确性、视觉质量和叙事连贯性。
- • **MMRBench 基准:** 构建了一个综合基准,包含专家精选的参考报告和可验证的关键洞察点,支持对结构完整性、数值准确性、图表-文本对齐和洞察新颖性的系统评估。
- • **广泛的实验验证:** MCTS-Report 在 MMRBench 上的所有指标上均显著优于 12 个基线,消融研究证实了 MCTS 规划、统一 LLM 驱动的动作-评估机制以及自监督奖励反馈的关键贡献。
## 相关工作
参见图 1 的说明:MCTS-Report 的流程图。
### 表格到报告生成的基准
早期的表格推理基准主要集中在狭窄的任务上。WikiTableQuestions(Pasupat and Liang 2015 (https://arxiv.org/html/2608.04071#bib.bib21))、FeTaQA(Nan et al. 2022 (https://arxiv.org/html/2608.04071#bib.bib34))和 TabFact(Chen et al. 2020 (https://arxiv.org/html/2608.04071#bib.bib26))评估半结构化表格上的问答。ToTTo(Parikh et al. 2020 (https://arxiv.org/html/2608.04071#bib.bib24))和 HiTab(Cheng et al. 2022 (https://arxiv.org/html/2608.04071#bib.bib22))解决了受控的表格到文本生成问题。然而,这些任务仅需要句子级输出,无法捕捉生成文章级分析报告的复杂性。为了弥补这一空白,T2R-Bench(Zhang et al. 2025 (https://arxiv.org/html/2608.04071#bib.bib30))定义了表格到报告任务,并构建了涵盖 19 个领域的 457 个真实世界工业表格的基准。但它仍局限于文本输出,不包含可视化。DDR-Bench(Liu et al. 2026a (https://arxiv.org/html/2608.04071#bib.bib29))进一步推动了自主数据探索:代理在没有预定义问题的情况下调查结构化数据库,并生成洞察报告,通过基于检查清单的事实验证进行评估。有几项工作试图整合视觉元素。MultimodalReportBench(Yang et al. 2026 (https://arxiv.org/html/2608.04071#bib.bib12))由 Multimodal DeepResearcher 引入,提供了一个基于网页深度研究生成的文本-图表交错报告基准。然而,它并不针对基于表格的报告生成,其评估依赖于风格和一致性指标,而不是对照源表格进行数值事实验证。
### 多模态报告的评估框架
评估多模态报告具有挑战性,因为需要同时评估文本和视觉质量。LLM 作为裁判的范式因其可扩展性而被广泛采用,但存在根本性的弱点:最近的研究表明,推理型裁判可能被对抗性输出欺骗,这些输出获得了高奖励却违反了任务意图(Liu et al. 2026b (https://arxiv.org/html/2608.04071#bib.bib27))。在可视化领域,VisEval(Chen et al. 2024 (https://arxiv.org/html/2608.04071#bib.bib20))和 VIS-Shepherd(Pan et al. 2025 (https://arxiv.org/html/2608.04071#bib.bib18))在 NL2VIS 流程中使用 LLM 来评判图表。然而,这些方法孤立地评估图表,与文本上下文和源表格脱节。一个能联合衡量基于表格的多模态报告中的事实基础、视觉保真度和叙事连贯性的统一评估框架仍然缺失。
## MCTS-Report 框架
### 任务定义
多模态报告生成任务定义如下:给定一个或多个结构化表格 T=\{T_1,T_2,\ldots,T_n\} 以及一个指定分析焦点的自然语言查询 q,模型必须生成一个多模态报告 \mathcal{R}=(R_{\text{text}},R_{\text{vis}})。文本组件 R_{\text{text}} 是一篇文章长度的分析报告,包含结构化章节(例如,概述、数据概览、核心分析、结论与建议)。视觉组件 R_{\text{vis}} 由一个或多个嵌入文本的生成图表(例如,柱状图、折线图、饼图、散点图)组成,直接用来自表格的证据支持叙述。
### 框架概述
与先前采用固定线性流程或多代理协调的工作不同,MCTS-Report 将报告生成重新定义为树形空间上的**结构化搜索问题**。如图 1 (https://arxiv.org/html/2608.04071#Sx2.F1) 所示,该框架由四个核心组件组成:
- • **搜索树表示:** 定义报告构建的状态空间、动作空间和转移规则。
- • **MCTS 搜索引擎:** 通过选择、扩展、模拟和反向传播迭代地探索树。
- • **LLM 执行引擎:** 在关键的 MCTS 阶段调用单一 LLM,根据特定于上下文的提示生成具体内容(动作、报告草稿)。
- • **自监督奖励函数:** 通过对照源表格和结构规则的自动验证来评估完成的报告草稿,为搜索引导提供反馈信号。
至关重要的是,LLM 在整个过程中充当统一的推理引擎,而不是具有不同身份和协调协议的多个专门代理。所有能力,包括数据解析、图表生成、洞察撰写和质量评估,都是通过对同一底层 LLM 应用不同的提示策略,并基于当前搜索状态来实现的。
### 搜索树定义
我们将部分报告的空间表示为一棵树 \Psi=(V,E),其中:
- • **节点 V:** 每个节点 v\in V 表示一个部分报告状态。根节点 v_0 包含输入表格 T、查询 q 和一个空的报告骨架。中间节点存储累积的报告内容(已完成的章节、生成的图表、已撰写的洞察),以及元数据,例如当前章节索引和已完成的动作历史。叶/终端节点 v_t 表示一个完整报告,其中所有章节均已定稿。
- • **边 E:** 每条边 e\in E 对应一个构建动作 a\in\mathcal{A} 的执行,从某个部分状态转移到下一个状态。
- • **通往完整报告的路径:** 一个完整报告 \mathcal{R} 对应于从 v_0 到终端节点 v_t 的一条路径,其中动作序列构成了完整的生成轨迹。
#### 动作空间
我们定义了一个全面的动作空间 \mathcal{A}=\{a_1,\ldots,a_7\},覆盖了报告构建的完整生命周期。每个动作都与一个特定的提示模板相关联,该模板指示 LLM 预期的输出格式。表 1 (https://arxiv.org/html/2608.04071#Sx3.T1) 总结了动作空间。
表 1:MCTS-Report 的动作空间
#### 动作顺序约束
并非所有动作序列都是有效的。为了确保逻辑连贯性,我们施加了一个**转移约束矩阵**(表 2 (https://arxiv.org/html/2608.04071#Sx3.T2))。
表 2:有效动作相似文章
TableVista:在视觉和结构复杂性下对多模态表格推理进行基准测试
介绍了 TableVista,这是一个全面的基准测试,用于评估基础模型在视觉和结构复杂性下的多模态表格推理能力,包含 3,000 个问题,扩展为 30,000 个多模态样本。对 29 个模型的评估显示,在复杂布局和仅视觉设置下性能有所下降。
WildTableBench:在真实场景中评估多模态基础模型的表格理解能力
WildTableBench 提出了首个针对真实世界表格图像的问答应答基准,揭示了现有多模态基础模型在结构感知和数值推理方面存在显著困难,仅有1个模型准确率超过50%。
TVIR:构建面向文本-视觉交织报告生成的深度研究代理
介绍了TVIR,一个用于生成文本-视觉交织报告的基准和层次化多代理框架,评估了自动化报告生成中的事实可靠性和视觉对齐。
用于 Monte Carlo Tree Search 规划的因果对象中心模型
COMET 是一种基于模型的强化学习算法,结合了冻结的对象中心编码器、基于 Transformer 的世界模型和 Monte Carlo Tree Search,通过因果注意力聚焦于任务相关对象,在视觉强化学习基准上取得了更高分数。
MulTaBench:基于文本与图像的多模态表格学习基准测试
介绍了 MulTaBench,一个包含40个数据集的基准测试,用于文本和图像模态的多模态表格学习。实验表明,任务特定的嵌入调优优于冻结的预训练嵌入,特别是在模态提供互补预测信号时。