EpiNarrate: 基于智能体的流行病学情景预测有依据叙述生成
摘要
介绍了EpiNarrate,一个将结构化数值推理与自然语言生成分离的智能体框架,用于从集成预测中生成有依据的流行病学叙述。
arXiv:2607.15544v1 Announce Type: new
摘要:生成清晰且易于理解的公共卫生叙述对于向政策制定者和广大公众传达复杂的流行病学预测至关重要。这类叙述不仅仅需要报告数字:预测必须在多个维度上进行语境化和定量依据。此外,预测通常来自大型集成数据集,这些数据集结合了干预假设、地理和人口层级、结果、时间范围和不确定性分位数。然而,直接使用大型语言模型(LLMs)来总结和语境化此类数据往往会导致不一致、遗漏和脆弱行为。我们提出了一种用于公共卫生报告生成的智能体框架(EpiNarrate),该框架将结构化数值推理与自然语言生成分离。该框架首先提取情景轴并将其组织成偏序模式,从而能够系统地遍历底层多维空间。然后构建增强数据集,并通过比较语法推导出有效的定量陈述,该语法强制执行语义和算术一致性。为了平衡覆盖度和非冗余性,我们引入了一种基于最大熵原理的趣味性驱动选择机制。在COVID-19 Scenario Modeling Hub上的实验表明,我们的模型生成的叙述具有改进的事实依据和对显著流行病学模式的更广泛覆盖,同时保留了专家撰写报告的风格。
查看缓存全文
缓存时间: 2026/07/20 09:34
# EpiNarrate:基于流行病学情景预测的具身叙事智能生成
来源:https://arxiv.org/html/2607.15544
Rituparna Datta
计算机科学系,弗吉尼亚大学
Srini Venkatramanan
生物复杂性研究所,弗吉尼亚大学
Bryan L\. Lewis
生物复杂性研究所,弗吉尼亚大学
Yiqi Su
计算机科学系,弗吉尼亚理工大学
Harry Hochheiser
生物医学信息学系,匹兹堡大学
Lucie Contamin
生物医学信息学系,匹兹堡大学
Parantapa Bhattacharya
生物复杂性研究所,弗吉尼亚大学
Naren Ramakrishnan
计算机科学系,弗吉尼亚理工大学
Anil Vullikanti
生物复杂性研究所和计算机科学系,弗吉尼亚大学
###### 摘要
生成清晰易懂的公共卫生叙事对于向政策制定者和广大公众传达复杂的流行病学预测至关重要。此类叙事不仅仅需要报告数字:预测必须在多个维度上进行背景化并定量落地。此外,预测通常来自大型集成数据集,这些数据集结合了干预假设、地理和人口统计分层、结果、时间范围和不确定性分位数。然而,直接使用大型语言模型(LLM)来总结和背景化此类数据往往会导致不一致、遗漏和行为脆弱。我们引入了 **EpiNarrate**,一个用于公共卫生报告生成的智能体框架,它将结构化数值推理与自然语言生成分离开来。该框架首先提取情景轴并将其组织成偏序模式,从而实现对底层多维空间的系统遍历。然后,它构建一个增强数据集,并通过比较语法推导出有效的定量陈述,该语法强制语义和算术一致性。为了平衡覆盖范围和非冗余性,我们引入了一种基于最大熵原理的兴趣驱动选择机制。在 COVID-19 情景建模中心上的实验表明,EpiNarrate 生成的叙事具有改进的事实基础和对显著流行病学模式的更广泛覆盖,同时保持了专家撰写报告的风格。
## 1 引言
公共卫生机构,如 CDC ([链接](https://arxiv.org/html/2607.15544#bib.bib9))、CDC ([链接](https://arxiv.org/html/2607.15544#bib.bib10))、CDC ([链接](https://arxiv.org/html/2607.15544#bib.bib11))、WHO ([链接](https://arxiv.org/html/2607.15544#bib.bib12)),依赖精心制作、有证据支持的陈述(称为叙事)向广大公众传达关键信息。这些信息可以包括当前和预测的趋势,例如流感 CDC ([链接](https://arxiv.org/html/2607.15544#bib.bib11)) 或 COVID-19 发病率预测 CDC ([链接](https://arxiv.org/html/2607.15544#bib.bib10)),通常由领域专家撰写,以将模型或集成的结果背景化。例如,COVID-19 情景建模中心 (SMH) 构建了多模型集成,以提供稳健的长期预测,指导联邦和州级响应 MIDAS 网络 (2025 [链接](https://arxiv.org/html/2607.15544#bib.bib21)); Reich 等人 (2022 [链接](https://arxiv.org/html/2607.15544#bib.bib31))。这些集成的摘要报告由 CDC 制作 ([链接](https://arxiv.org/html/2607.15544#bib.bib10)),供流行病学家和普通公众使用。图 1(a) ([链接](https://arxiv.org/html/2607.15544#S1.F1)) 显示了这样一个摘要的示例。正如我们在这里研究的,摘要生成是 LLM 的典型任务,并且与数据到文本生成的更广泛主题密切相关。先前的工作研究了诸如表格到文本生成等问题,其中维基百科表格中高亮显示的单元格被转化为忠实的文本描述 (Parikh 等人, 2020 [链接](https://arxiv.org/html/2607.15544#bib.bib23)),以及体育摘要生成,其中系统首先选择相关记录并规划其顺序,然后生成连贯的叙事 (Puduppully 等人, 2019a [链接](https://arxiv.org/html/2607.15544#bib.bib25))。其他工作比较了模块化流水线系统与端到端神经生成,表明显式的中间表示可以提高泛化能力和输出质量 (Ferreira 等人, 2019 [链接](https://arxiv.org/html/2607.15544#bib.bib24))。然而,公共卫生情景建模报告与这些标准设置不同,因为它们的输入包括大型、多维度的集成预测、情景假设、地理和人口统计分层以及不确定性分位数。制作可消费的报告不仅需要总结给定的数据,还需要将其置于背景中,进行背景化比较,并突出关键要点。
参见说明
(a) 示例输入-输出叙事
参见说明
(b) 数据流抽象
图 1:(a) SMH 一轮的 EpiNarrate 示例输入和输出。输入包括结构化预测数据,输出是一个具身叙事,报告情景对比、负担、干预效果和特定年龄的解释。(b) EpiNarrate 中的数据流具有以下结构:提示 ↔ 偏序 → 增强数据集 → 事实集 → 有趣事实。偏序是属性值之间关系的抽象表示,并支持更容易的验证。它用于使用语法构建增强数据集,然后构建事实集。使用基于熵的方法生成有趣事实。这里的组件映射到 EpiNarrate 的架构中,如图 2 所示 ([链接](https://arxiv.org/html/2607.15544#S3.F2))
因此,我们工作的核心问题是:*能否开发智能体系统来为公共卫生信息准备叙事?* 我们表明,即使直接提示最先进的 LLM 从流行病学数据生成摘要,也会导致频繁的结构不一致和脆弱行为;即使在少样本学习的情况下也是如此。我们引入了 **EpiNarrate**,一个用于生成公共卫生任务叙事的智能体框架;EpiNarrate 中的一个关键组成部分是对某些属性的偏序,这有助于提高生成摘要的鲁棒性,如图 2 所示 ([链接](https://arxiv.org/html/2607.15544#S3.F2))。我们的主要贡献是:
1. 我们形式化了 EpiNarrate,一个需要正确性、覆盖率和趣味性的公共卫生叙事生成问题;
2. 我们提出了 EpiNarrate,一个使用偏序引导的模式发现、数据集增强和比较语法来生成具身事实的智能体流水线;
3. 我们引入了一种基于最大熵的兴趣感知事实选择方法,该方法通过智能体评估和领域专家评审进行评估。
## 2 相关工作
#### 数据到文本生成。
经典的数据到文本 (D2T) 系统通过手动设计的流水线将结构化记录映射到文本,用于内容选择、句子规划和表面实现 (Reiter and Dale 2000 [链接](https://arxiv.org/html/2607.15544#bib.bib82))。神经 D2T (Lebret 等人 2016 [链接](https://arxiv.org/html/2607.15544#bib.bib83); Wiseman 等人 2017 [链接](https://arxiv.org/html/2607.15544#bib.bib84); Parikh 等人 2020 [链接](https://arxiv.org/html/2607.15544#bib.bib23)) 用端到端序列到序列模型取代了这些阶段,这些模型在记录-叙事对上训练。例如,WikiBio (Lebret 等人 2016 [链接](https://arxiv.org/html/2607.15544#bib.bib83)) 处理传记信息框,RotoWire (Wiseman 等人 2017 [链接](https://arxiv.org/html/2607.15544#bib.bib84)) 处理篮球比赛数据,ToTTo (Parikh 等人 2020 [链接](https://arxiv.org/html/2607.15544#bib.bib23)) 处理维基百科表格中高亮显示的单元格。Castro Ferreira 等人 (Ferreira 等人 2019 [链接](https://arxiv.org/html/2607.15544#bib.bib24)) 比较了端到端神经模型与流水线系统,并报告显式中间表示产生更准确的输出。所有这些方法都是为适合编码器上下文窗口的小型扁平表格构建的,而不是公共卫生集成预测产生的数百万单元格超立方体。
#### 内容选择和规划。
D2T 的另一条研究路线认为,显式建模*要提及什么*以及*以什么顺序*可以提高忠实度。Puduppully 等人 (Puduppully 等人 2019a [链接](https://arxiv.org/html/2607.15544#bib.bib25)) 介绍了一种用于体育摘要生成的神经流水线,该流水线选择记录,用规划器排序,然后将它们实现为散文。后续工作增加了层次规划器 (Rebuffel 等人 2020 [链接](https://arxiv.org/html/2607.15544#bib.bib85)) 和以实体为中心的规划 (Puduppully 等人 2019b [链接](https://arxiv.org/html/2607.15544#bib.bib87))。这些规划器是在小型扁平记录元组上训练的。将它们适应多轴结构化输入需要大量的新工程,正如本文所做的那样。
#### 对结构化输入的 LLM 提示。
最近的工作直接使用 LLM 作为生成器,将结构化输入展平或总结到提示中。Dibia 的 LIDA (Dibia 2023 [链接](https://arxiv.org/html/2607.15544#bib.bib77)) 构建了数据集列级统计信息,如数据类型、范围、均值和样本值,并将该信息作为完整输入提供给模型。其他工作将表格序列化为提示中的 Markdown 或 CSV 片段,并依赖长上下文模型对线性化数据进行推理 (Chen 2023 [链接](https://arxiv.org/html/2607.15544#bib.bib90); Sui 等人 2024 [链接](https://arxiv.org/html/2607.15544#bib.bib96))。一个共同的限制是模型必须决定展示哪些对比和数量,而没有对有效性的结构约束,这可能导致虚假或不匹配的比较。
#### 结构化摘要。
最近的一些摘要工作引入了输入和摘要之间的中间结构化表示,包括结构化表示摘要 (Balachandran 等人 2021 [链接](https://arxiv.org/html/2607.15544#bib.bib88)) 和图感知摘要 (Koncel-Kedziorski 等人 2019 [链接](https://arxiv.org/html/2607.15544#bib.bib89))。EpiNarrate 也使用显式中间结构。它在两个方面与公共卫生设置不同。首先,中间表示是从自由文本情景描述中归纳出的情景轴上的偏序集,而不是通用图或知识结构。其次,事实生成步骤由领域感知的比较语法控制,该语法防止结构上无效的对比。据我们所知,之前没有任何摘要是系统实施这种语法,或者已经在超立方体规模的集成预测上进行过评估。
## 3 问题陈述
我们考虑从大型结构化数值数据集自动生成自然语言总结的问题。虽然这是一个非常普遍的问题,但我们以公共卫生作为示例应用。设 \(\mathcal{D}\) 表示一个按 \(K\) 个离散维度 \(\mathcal{F}=\{a_1,\ldots,a_K\}\) 组织的数据集,其中每个维度 \(a_k\) 取有限集 \(\mathcal{V}_k\) 中的值。这些维度的示例包括干预情景、结果测量、人口分组、地理单位、时间段和不确定性分位数。例如,如果 \(a_k\) 表示年龄组,那么 \(\mathcal{V}_k\) 可以是组 \([0-10], [10-25], \cdots, [65+]\)。输入 \(\mathcal{D}\) 通常表示为一个扁平表格,每条记录对应维度值的唯一组合。因此,\(\mathcal{D}\) 可以被视为一个 \(K\) 路张量,\(\mathcal{D}: \mathcal{V}_1 \times \cdots \times \mathcal{V}_K \rightarrow \mathbb{R}\),其中每个条目 \(\mathcal{D}[\mathbf{v}]\) 存储与维度的一种配置相关的数值统计。
参见说明
图 2:基于情景的摘要生成流水线。该框架将预测数据转换为结构化情景轴,构建多维超立方体,增强子集比较,使用比较语法过滤有效事实,使用最大熵方法,并用 LLM 总结选定的事实。
**问题陈述**。
给定 \(\mathcal{D}\),以及可选的一组情景文本描述 \(\{m_s\}_{s \in \mathcal{S}}\),目标是生成一个简洁的自然语言总结 \(\mathcal{C}(\mathcal{D})\),满足三个标准:(1) **正确性**:\(\mathcal{C}(\mathcal{D})\) 中的每一个定量断言都应基于对 \(\mathcal{D}\) 的确定性计算。形式上,对于每个数值声明,应该存在一个可执行的计算路径 \(\pi_i\),使得将 \(\pi_i\) 应用于 \(\mathcal{D}\) 能够重现所陈述的值。(2) **覆盖率**。总结应覆盖数据集的主要维度。此外,当参考总结可用时,生成的总结应恢复与 \(\mathcal{D}\) 相关的地面真实总结中表达的关键信息单元,例如主要情景对比、高负担亚组、区域异质性以及峰值或累积趋势。(3) **趣味性和非冗余性**。目标是选择一个紧凑的子集 \(\mathcal{C}^* \subset \mathcal{C}\),且 \(|\mathcal{C}^*| \ll |\mathcal{C}|\),该子集具有多样性、非冗余性,并优先考虑具有大效应大小或令人惊讶结构的比较。冗余声明会消耗总结预算,而不改善读者对数据集的理解。对于给定的实例,我们将输出 \(\mathcal{C}\) 和 \(\mathcal{C}^*\)。正确性要求至关重要,因为直接应用于大型表格的 LLM 常常会产生幻觉、颠倒排名或报告错误数量。覆盖率要求确保总结不仅仅局限于情景层面的差异,而忽略了亚组、区域、时间或不确定性水平上的重要变化。同时满足所有这些要求具有挑战性。即使是一个中等规模的设置,包含 5 个情景、3 个结果、4 个亚组、50 个区域、52 周和 23 个不确定性分位数,也会产生大约 \(1.6 \times 10^6\) 个条目,远远超出当前大型语言模型的上下文预算。因此,任何摘要是系统都必须在生成之前执行选择、聚合或压缩,而这一中间阶段的错误直接限制了最终输出的质量。其次,\(\mathcal{D}\) 的组合结构导致了大量可能的比较空间,在没有原则性选择机制的情况下,穷举枚举和排序是不切实际的。因此,天真的端到端 LLM 方法通常在所有三个轴上失败:它们产生幻觉或错误陈述数值,遗漏重要维度,并过度强调冗余或明显的发现。
## 4 方法
我们提出了一个结构化的流水线,用于从基于情景的集成预测生成具身、定量准确的总结。该流水线将摘要生成分解为五个模块化阶段:(\(i\)) 潜在轴分解和维度发现,(\(ii\)) 超立方体构建,(\(iii\)) 通过关系操作的数据集增强,(\(iv\)) 通过结构化比较的事实生成,以及 (\(v\)) 通过最大熵选择的趣味性过滤,详见附录中的算法 B.3 ([链接](https://arxiv.org/html/2607.15544#A2.SS3))。通过将结构化数值推理与自然语言生成分离,我们的框架减少了幻觉,强制进行有效比较,并保持了定量一致性。
#### 步骤 0。风格提取。
为了确保生成的总结与...相似文章
从角色到情节:基于角色的多智能体长篇叙事故事生成
介绍了Magnet——一个基于角色的多智能体目标驱动叙事引擎,用于长篇故事生成,以及Atlas——一个基于图的流水线,用于检测生成叙事中的幻觉。该框架相比单模型基线和IBSEN提高了连贯性并减少了幻觉。
ArcDeck:叙事驱动的论文到幻灯片生成
ArcDeck 是一个多智能体框架,通过话语树和迭代智能体优化来建模逻辑流程,从而从学术论文生成演示幻灯片,性能优于直接摘要方法。该论文还引入了 ArcBench,这是一个新的基准测试,用于评估论文到幻灯片生成,强调叙事连贯性和逻辑结构。
NARRA-Gym:用于评估交互式叙事智能体的基准
本文介绍了 NARRA-Gym,这是一个基准和可执行评估环境,用于评估大型语言模型在多轮对话中维持交互式叙事、管理记忆以及适应用户的能力。
帮助图表讲述它们的故事!基于论文的视频生成,解释复杂的科学图表
介绍了 MINARD,一个从科学图表及其论文生成带旁白、区域定位的讲解视频的流水线,以及 FigTalk 基准和新的定位指标。
评估检索增强生成与长上下文输入在电子健康记录临床推理中的比较
本文评估了检索增强生成(RAG)与长上下文提示在电子健康记录临床推理任务中的表现,发现RAG在令牌效率上具有竞争力,尤其在影像提取和抗生素时间线重建方面表现突出。