论提高文档生成播客的忠实度

arXiv cs.CL 论文

摘要

本文首次系统研究了文档接地播客生成中的忠实度问题,提出了一个轮次级别的LLM作为评委的评估框架,以及一个与模型无关的捕获-修复方法,该方法能跨领域提高忠实度。

arXiv:2607.21961v1 Announce Type: new 摘要:大型语言模型(LLMs)越来越多地被用于从文本源生成长篇对话内容,例如播客。尽管这些系统能生成流畅且引人入胜的叙述,但它们常常引入无根据的信息。在这项工作中,我们首次系统研究了文档接地播客生成中的忠实度问题,其中接地必须在长篇多说话人转录的对话轮次中保持。我们构建了一个包含五个领域、超过1500个文档的数据集,并使用多个LLM生成了播客转录。我们引入了一个轮次级别的LLM作为评委的评估框架,用于评估对话轮次是否得到源文档的支持,并通过人类研究验证了其可靠性。我们的分析表明,即使是最先进的模型,包括GPT-4o,也经常生成无根据的内容。为了缓解这一问题,我们提出了catch-n-repair,一个与模型无关的框架,能够检测并重写不忠实的对话轮次,同时保持对话流畅。实验表明,在领域内和跨领域设置中,忠实度均得到一致提升。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:39

# 关于提升文档生成播客的忠实度
来源:https://arxiv.org/html/2607.21961
Soumya Dutta1,2, Tejas Indulal Dhamecha2, Pannaga Shivaswamy2
1Indian Institute of Science, 2Adobe Research
soumyad@adobe\.com (https://arxiv.org/html/2607.21961v1/mailto:[email protected])

###### 摘要

大型语言模型(LLMs)越来越多地被用于从文本源生成长篇对话内容,例如播客。虽然这些系统能生成流畅且引人入胜的叙述,但它们常常引入无根据的信息。在这项工作中,我们首次系统性地研究了基于文档的播客生成中的忠实度问题,在这种生成中,必须在长篇、多说话者转录的对话轮次间保持基于文档的忠实性。我们构建了一个涵盖五个领域、超过1,500篇文档的数据集,并使用多个LLM生成播客转录。我们引入了一个轮次级别的LLM-as-a-judge框架,用于评估对话轮次是否得到源文档的支持,并通过人类研究验证了其可靠性。我们的分析表明,即便是最先进的模型,包括GPT-4o,也频繁生成无根据的内容。为了缓解这一问题,我们提出了catch-n-repair,一个与模型无关的框架,它能检测并重写不忠实的对话轮次,同时保持对话流畅性。实验表明,在领域内和跨领域设置中,忠实度均得到一致提升。

# 关于提升文档生成播客的忠实度

Soumya Dutta1,2, Tejas Indulal Dhamecha2, Pannaga Shivaswamy2
1Indian Institute of Science, 2Adobe Research
soumyad@adobe\.com (https://arxiv.org/html/2607.21961v1/mailto:[email protected])

## 1 引言

播客已成为分享信息最流行的方式之一,涵盖新闻、教育、娱乐和生活方式等多个领域。皮尤研究中心(Pew Research Center)近期的一份报告突显了这一增长:2013年,12岁及以上的美国人中仅有12%每月收听播客,而到2023年,这一比例上升至42%(Pew Research Center, 2023 (https://arxiv.org/html/2607.21961#bib.bib1))。这一普及率的激增不仅反映了受众对这种媒介的熟悉程度,还体现了人们对播客作为信息来源日益增长的信任。然而,直到最近,播客在很大程度上仍是一种消费媒介,听众收听由人类主持人创作和策划的内容。随着生成式AI系统(例如Google的NotebookLM¹¹https://notebooklm.google.com/)的出现,这一范式正在发生转变。这类系统能够直接从源材料生成播客风格的叙述。这一转变开启了个性化播客大规模生成的可能,个人和组织可以根据自己的需求和兴趣生成定制播客。

图1:生成的播客转录中不忠实的示例。根据《Attention Is All You Need》论文生成的转录中提到了ChatGPT,而ChatGPT在2017年并不存在。

这一发展建立在生成式AI应用一系列更广泛的工作之上,如摘要生成(Zhang et al., 2024 (https://arxiv.org/html/2607.21961#bib.bib10); Kim and Kim, 2025 (https://arxiv.org/html/2607.21961#bib.bib9); Liu et al., 2025a (https://arxiv.org/html/2607.21961#bib.bib2))和问答(QA)(Zaib et al., 2022 (https://arxiv.org/html/2607.21961#bib.bib11); Hu et al., 2025 (https://arxiv.org/html/2607.21961#bib.bib13); Zhang et al., 2025 (https://arxiv.org/html/2607.21961#bib.bib12)),这些工作中的模型将源材料转化为更易理解的形式。这些任务的一个核心挑战是*忠实度*——确保生成的输出基于源材料,不引入扭曲或幻觉(Chiesurin et al., 2023 (https://arxiv.org/html/2607.21961#bib.bib16); Jia et al., 2023 (https://arxiv.org/html/2607.21961#bib.bib15); Ming et al., 2024 (https://arxiv.org/html/2607.21961#bib.bib14))。

虽然AI生成的播客继承了这些担忧,但它们也引入了独特的挑战。与摘要或答案不同,播客通常是长篇的、叙事驱动的、并且有多个说话者,要求模型在较长的篇幅内保持连贯性和事实准确性(Xiao et al., 2025 (https://arxiv.org/html/2607.21961#bib.bib17))。此外,在这种设置中,忠实度必须在单个轮次级别得到保持,其中幻觉可能局部出现,但会通过叙述传播。尽管近期在播客生成方面有所努力(Ju et al., 2025 (https://arxiv.org/html/2607.21961#bib.bib18); Xiao et al., 2025 (https://arxiv.org/html/2607.21961#bib.bib17); Peng et al., 2026 (https://arxiv.org/html/2607.21961#bib.bib3)),先前的工作主要集中在流畅性、结构和音频呈现上,而对基于源文档的忠实性问题则基本未被探索。

为了说明这一挑战,考虑图1 (https://arxiv.org/html/2607.21961#S1.F1)中的例子。源文档是《Attention Is All You Need》论文²²https://arxiv.org/pdf/1706.03762。NotebookLM生成了一个转录,其中提到了ChatGPT作为这篇论文的遗产;虽然事后看是正确的,但ChatGPT在2017年并不存在,而且源论文中没有提到ChatGPT,这使得这一陈述不忠实。这个例子突显了事实正确性与对给定上下文的忠实性之间的微妙但关键的区别。

受此观察启发,我们首次系统性地研究了*基于文档的播客生成*中的忠实度。与先前工作不同,我们聚焦于长篇、多说话者的转录,并在单个对话轮次级别分析忠实度。为了实现这项研究,我们收集了一个包含1520篇文档的数据集,涵盖五个领域,并使用多个大语言模型(LLM)生成相应的播客转录。我们引入了一个*轮次级别的LLM-as-a-judge评估协议*,用于评估每个对话轮次在多大程度上得到源文档的支持。这种方法能够捕捉微妙的情况,例如部分基于源和细微的幻觉,这些在长篇生成中很常见。我们还通过人类研究验证了该评估框架的可靠性。基于这个评估框架,我们提出了catch-n-repair,一种简单而有效、与模型无关的缓解策略。我们的方法在单个对话轮次级别操作:它使用一个轻量级分类器检测不忠实的生成,并重写它们以确保基于源文档,同时保持对话流畅性。重要的是,catch-n-repair可以应用于开源和闭源LLM,使其在实际设置中具有广泛的适用性。我们的贡献总结如下:

- • **评估协议**:我们引入了一个轮次级别的LLM-as-a-judge框架,用于测量长篇、多说话者播客转录中的忠实度。该协议在单个对话轮次级别捕获细粒度的基于源的程度,并已通过人类标注验证。
- • **基准测试和分析**:我们在多个LLM和领域上进行了系统的实证研究,提供了对基于文档的播客生成中忠实度的首次分析。
- • **缓解方法**:我们提出了catch-n-repair,一种与模型无关的策略,它能检测不忠实的对话轮次并重写它们以确保基于源文档,从而在保持对话流畅性的同时提升忠实度。

## 2 相关工作

图2:忠实度评估:一旦生成了这些转录,使用LLM-as-a-judge(GPT-4o)评估,根据每个播客轮次对源文档的忠实度,打分1到5。缓解:提出的缓解策略——catch-n-repair——与LLM结合使用,以生成对源文档忠实的转录。

**从文档生成播客**:直接从源文档生成播客的任务在研究界受到的关注相对较少。Ju等人(2025 (https://arxiv.org/html/2607.21961#bib.bib18))提出了Mooncast,利用现有的播客脚本生成长篇、引人入胜的音频内容。Xiao等人(2025 (https://arxiv.org/html/2607.21961#bib.bib17))提出了PodAgent,一个基于用户指定主题生成播客脚本的LLM代理,而不依赖于源文档。相比之下,我们的工作聚焦于*基于文档的播客生成*,并系统性地研究生成转录对底层源材料的忠实度。

**LLM生成中的忠实度**:确保模型输出对给定上下文的忠实性已在摘要和问答等任务中得到广泛研究(Chiesurin et al., 2023 (https://arxiv.org/html/2607.21961#bib.bib16); Jia et al., 2023 (https://arxiv.org/html/2607.21961#bib.bib15); Ming et al., 2024 (https://arxiv.org/html/2607.21961#bib.bib14))。现有的度量方法,包括Token重叠度量如Knowledge-F1(Shuster et al., 2021 (https://arxiv.org/html/2607.21961#bib.bib31)),以及学习型评估器如FaithCritic(Dziri et al., 2022 (https://arxiv.org/html/2607.21961#bib.bib33)),已被提出来检测幻觉。最近,LLM-as-a-judge框架(Zheng et al., 2023 (https://arxiv.org/html/2607.21961#bib.bib34); Adlakha et al., 2024 (https://arxiv.org/html/2607.21961#bib.bib35))在评估正确性和忠实度方面展示了强大的性能。然而,先前的工作主要集中在短篇生成上,其中输出通常是单轮且简洁的。相比之下,播客转录是长篇的、多说话者的、且叙事驱动的,要求忠实度在单个对话轮次级别得到维持。我们的工作将忠实度的研究扩展到这一更复杂的设置。

**播客转录的评估**:近期工作已开始探索评估LLM生成的播客风格输出,通常使用LLM-as-a-judge框架来评估连贯性、流畅性和吸引力等属性(Xiao等人(2025 (https://arxiv.org/html/2607.21961#bib.bib17));Xu等人(2026 (https://arxiv.org/html/2607.21961#bib.bib4)))。然而,这些方法主要在整篇转录级别操作,并未明确评估相对于源文档的基于源程度。因此,它们并未设计用于检测生成过程中可能出现的不忠实内容。相比之下,我们的工作聚焦于*对源文档的忠实度*作为主要评估目标,并引入了一个轮次级别的评估协议,能够在长篇、多说话者转录中实现细粒度的基于源程度评估。

**缓解LLM中的无根据性**:已经提出了多种方法来缓解LLM输出中的幻觉,即模型生成的内容要么事实不正确,要么未基于提供的上下文。在这项工作中,我们关注后者——相对于源文档的*无根据性*。值得注意的是,无根据的陈述在现实世界中可能是事实正确的,但不受输入文档支持,这使得在长篇生成中检测它们特别具有挑战性。现有方法通过几个方向来缓解开源LLM的幻觉。基于解码的方法调整token概率以减少无根据的生成(Shi et al., 2024 (https://arxiv.org/html/2607.21961#bib.bib29); Huang et al., 2025 (https://arxiv.org/html/2607.21961#bib.bib30))。其他方法使用辅助模型或知识图谱进行事后纠正(Dziri et al., 2021 (https://arxiv.org/html/2607.21961#bib.bib27); Ji et al., 2023a (https://arxiv.org/html/2607.21961#bib.bib28))。然而,许多这些方法需要访问模型内部(例如,logits),限制了它们在黑盒设置中的适用性。对于此类设置,先前工作主要依赖外部知识或自一致性信号。例如,Ji等人(Ji et al., 2023b (https://arxiv.org/html/2607.21961#bib.bib7))将验证公式化为对特定领域知识库的问答任务,而Manakul等人(Manakul et al., 2023 (https://arxiv.org/html/2607.21961#bib.bib8))通过多次采样生成之间的不一致性检测幻觉。Gao等人(Gao et al., 2023 (https://arxiv.org/html/2607.21961#bib.bib5))进一步提出通过从网页检索支持证据来纠正输出。相比之下,我们提出的catch-n-repair框架与模型无关,并在单个对话轮次级别操作,能够在无需访问模型内部或外部检索系统的情况下实现忠实的生成。

## 3 问题陈述

### 3\.1 问题设定

设 \(\mathcal{D} = \{d_1, d_2, \dots, d_n\}\) 表示一个源文档集合。对于每个文档 \(d_i \in \mathcal{D}\),一个由 \(\mathcal{L}_{\text{gen}}\) 表示的大语言模型(LLM)生成一个播客风格的对话转录:\[ \mathcal{T}_i = \{t_{i1}, t_{i2}, \dots, t_{im_i}\} \],其中每个 \(t_{ij}\) 表示转录中的第 \(j\) 个对话轮次。

我们的目标是评估并提升生成的播客转录相对于其源文档的忠实度。为此,我们定义一个忠实度评估函数 \(\mathcal{F}_{\text{eval}}\),它为每个对话轮次 \(t_{ij}\) 基于源文档 \(d_i\) 分配一个忠实度得分。转录 \(\mathcal{T}_i\) 的整体忠实度得分 \(f_i\) 通过其 \(m_i\) 个轮次的平均值得到:
\[ f_i = \frac{1}{m_i} \sum_{j=1}^{m_i} \mathcal{F}_{\text{eval}}(t_{ij}, d_i). \tag{1} \]
与先前在响应或文档级别评估基于源程度的不同,我们在单个对话轮次级别制定忠实度。这种粒度在长篇播客生成中尤为重要,因为无根据的内容通常局限于特定轮次,而转录的其余部分仍忠实于源文档。此外,轮次级别的评估允许有针对性的缓解,而无需重新生成整篇转录。

我们的目标是设计一种缓解方法,catch-n-repair,可以应用于生成模型 \(\mathcal{L}_{\text{gen}}\) 以提高忠实度得分;即,获得改进的转录 \(\mathcal{T}'_i\),使得其对应的忠实度得分 \(f'_i > f_i\)。所提出框架的概述如图2 (https://arxiv.org/html/2607.21961#S2.F2) 所示。

### 3\.2 播客转录的创建

我们考虑一个播客生成设置,其中转录以轮次顺序生成。具体来说,我们聚焦于现实播客中常见的双说话者对话结构,其中主持人引导讨论,专家提供详细、基于文档的回答。主持人的轮次应包含自然且引人入胜的问题以促进对话流畅性,而专家的轮次应保持对源文档的忠实。转录生成过程由LLM \(\mathcal{L}_{\text{gen}}\) 驱动,其顺序特性使得在生成过程中能够进行轮次级别的监控和干预。

### 3\.3 评估生成的播客转录的忠实度

设计忠实度评分函数 \(\mathcal{F}_{\text{eval}}\)...

相似文章

测量AI的忠实度——无论好坏

Reddit r/AI_Agents

本文讨论了LLM优化中忠实度的重要性,引入了一种结构忠实度分数,通过测量词汇重叠、约束保留和任务类型匹配的漂移,确保提示优化不牺牲意图。