示例引导的文档级文本简化提示方法

arXiv cs.CL 论文

摘要

本文研究了使用检索到的文档简化示例来引导大语言模型进行文档级文本简化,在OneStopEnglish语料库上展示了相比仅使用提示生成的改进效果。

arXiv:2608.05447v1 公告类型:新增 摘要:文档级文本简化要求大型语言模型(LLM)在保留意义、可读性和篇章连贯性的同时重写复杂文档。尽管基于提示的LLM已展现出有前景的性能,但由于文本指令对复杂的文档级变换所提供的指导有限,它们往往会产生不一致的简化结果。我们研究了通过从平行简化语料库中选取示例来增强提示,检索到的文档简化示例是否能够改进文档级生成。这种示例引导的提示方法使LLM能够利用相关的简化模式,而无需针对任务进行微调。在OneStopEnglish语料库上使用多种最先进的LLM进行的实验表明,纳入检索到的示例始终能比仅使用提示的生成带来更好的简化质量,并且相比具有代表性的监督式(T5)和基于规划的(PlanSimp)文档简化系统,能达到有竞争力或更优的性能。此外,我们发现示例引导提示的收益在不同LLM之间有所不同,这表明有效利用检索到的示例取决于模型在生成过程中整合上下文信息的能力。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:50

# 示例引导提示用于文档级文本简化
来源:https://arxiv.org/html/2608.05447
Ilan Shtilman SCE,以色列贝尔谢巴 shtilmanilan@gmail\.com Michael Färber ScaDS\.AI,TUD Dresden,德国 michael\.faerber@tu\-dresden\.de Marina Litvak SCE,以色列贝尔谢巴 ScaDS\.AI,TUD Dresden,德国 marinal@sce\.ac\.il

###### 摘要

文档级文本简化要求大型语言模型(LLM)在保留意义、可读性和语篇连贯性的同时改写复杂文档。尽管基于提示的 LLM 已展现出有前景的性能,但由于纯文本指令对复杂的文档级转换提供的指导有限,它们常常产生不一致的简化结果。我们研究了检索到的文档简化示例是否能够通过使用从平行简化语料库中选取的示例来增强提示,从而改进文档级生成。这种示例引导提示方法使 LLM 能够利用相关的简化模式,而无需针对任务进行微调。在 OneStopEnglish 语料库上使用多种最先进的 LLM 进行的实验表明,与仅使用提示的生成相比,加入检索到的示例能够持续提高简化质量,并达到与具有代表性的有监督(T5)和基于规划(PlanSimp)的文档简化系统相当或更优的性能。此外,我们发现示例引导提示的收益因 LLM 而异,这表明有效利用检索到的示例取决于模型在生成过程中整合上下文信息的能力。

示例引导提示用于文档级文本简化

Ariel PerstinSCE,以色列贝尔谢巴arielperstin10@gmail\.comIlan ShtilmanSCE,以色列贝尔谢巴shtilmanilan@gmail\.com

Michael FärberScaDS\.AI,TUDDresden,德国michael\.faerber@tu\-dresden\.deMarina LitvakSCE,以色列贝尔谢巴ScaDS\.AI,TUDDresden,德国marinal@sce\.ac\.il

## 1 引言

大型语言模型(LLM)已成为文本简化的有效方法,能够通过指令遵循和上下文学习实现高质量改写,而无需针对任务进行训练 [Brown 等人 (2020)](https://arxiv.org/html/2608.05447#bib.bib13);[Liu 等人 (2023)](https://arxiv.org/html/2608.05447#bib.bib14);[Cohen 等人 (2026)](https://arxiv.org/html/2608.05447#bib.bib10)。虽然近期研究主要关注句子级简化,但许多实际应用(如教育资源、新闻文章和技术文档)需要在保持语义保真度、语篇连贯性和适当可读性水平的同时简化整个文档。与句子级改写相比,文档级简化需要在多个句子之间进行协调转换,同时在整个文档中保持一致的简化风格。

基于提示的 LLM 提供了一种灵活的解决方案,但仅靠文本指令往往无法为复杂的文档级转换提供充分指导,导致简化质量不一致 [Cohen 等人 (2026)](https://arxiv.org/html/2608.05447#bib.bib10);[Maddela 等人 (2023)](https://arxiv.org/html/2608.05447#bib.bib18);[Alfea 等人 (2024)](https://arxiv.org/html/2608.05447#bib.bib21)。这引出了一个重要问题:检索到的示例能否比单独的文本指令提供更有效的指导?

检索增强生成(RAG)通过在进行推理时整合相关外部上下文,成功改进了许多生成任务 [Lewis 等人 (2020)](https://arxiv.org/html/2608.05447#bib.bib15)。与知识密集型应用不同,文档级简化需要的是关于如何转换文本的指导,而不是额外的事实信息。因此,我们研究检索文档–简化示例。

为此,我们提出了**示例引导提示(EGP)**,这是一种推理时方法,它使用从平行简化语料库中选取的检索示例来增强强提示。模型不再仅仅依赖文本指令,而是接触展示类似文档此前如何被简化的示例,从而无需额外训练或参数更新即可利用相关的简化模式。

我们在 OneStopEnglish 语料库上使用多种最先进的 LLM 评估 EGP [Vajjala and Lučić (2018)](https://arxiv.org/html/2608.05447#bib.bib6)。在强提示公式的基础上,我们研究检索到的示例相比仅使用提示的生成是否能改进文档级简化。我们还将 EGP 与两个具有代表性的文档简化基线进行比较:T5 [Raffel 等人 (2020)](https://arxiv.org/html/2608.05447#bib.bib16) 和 PlanSimp(由 [Cripwell 等人 (2023)](https://arxiv.org/html/2608.05447#bib.bib9) 提出的一种文档级规划方法),并使用简化质量 [Xu 等人 (2016)](https://arxiv.org/html/2608.05447#bib.bib2)、语义保留 [Maddela 等人 (2023)](https://arxiv.org/html/2608.05447#bib.bib18);[Zhang 等人 (2019)](https://arxiv.org/html/2608.05447#bib.bib8) 和可读性 [Flesch (1948)](https://arxiv.org/html/2608.05447#bib.bib29);[Kincaid 等人 (1975)](https://arxiv.org/html/2608.05447#bib.bib30) 的自动度量指标进行评估。

我们的实验表明,EGP 能持续改进仅使用提示的生成,达到与具有代表性的最先进简化系统相当或更优的性能,并揭示了示例引导提示的有效性取决于底层 LLM。

我们的贡献总结如下:(1)我们提出了示例引导提示(EGP),这是一种推理时方法,通过检索到的文档–简化示例增强 LLM 提示,以用于文档级文本简化<sup>1</sup>。(2)我们证明 EGP 在多种最先进的 LLM 上能持续改进仅使用提示的生成,并达到与具有代表性的有监督和基于规划的文档简化系统相当或更优的性能。(3)我们提供了关于示例引导提示何时最有效的实证分析,表明其收益取决于底层 LLM,并涉及语义保留与可读性之间的权衡。

<sup>1</sup>我们的代码和数据可在 https://github.com/simplify120/RAG-simp 获取。该链接已匿名化,以符合双盲评审政策。

## 2 背景

文本简化旨在将复杂文本转换为更简单的版本,同时保留意义并提高不同受众的可及性 [Siddharthan (2006)](https://arxiv.org/html/2608.05447#bib.bib3);[Xu 等人 (2015)](https://arxiv.org/html/2608.05447#bib.bib12)。早期方法依赖于词汇替换、句法改写、统计机器翻译 [Siddharthan (2006)](https://arxiv.org/html/2608.05447#bib.bib3);[Pavlick and Callison-Burch (2016)](https://arxiv.org/html/2608.05447#bib.bib1);[Xu 等人 (2016)](https://arxiv.org/html/2608.05447#bib.bib2),以及后来的有监督神经模型 [Martin 等人 (2020)](https://arxiv.org/html/2608.05447#bib.bib4);[Sheang and Saggion (2021)](https://arxiv.org/html/2608.05447#bib.bib5)。最近,大型语言模型(LLM)使得无需任务特定微调的基于指令的简化成为可能,为有监督方法提供了一种灵活的替代方案 [Brown 等人 (2020)](https://arxiv.org/html/2608.05447#bib.bib13);[Liu 等人 (2023)](https://arxiv.org/html/2608.05447#bib.bib14);[Cohen 等人 (2026)](https://arxiv.org/html/2608.05447#bib.bib10)。然而,基于提示的简化仍然对提示公式高度敏感,且往往产生不一致的简化结果,这促使研究者探索提高基于 LLM 的简化的可控性 [Cohen 等人 (2026)](https://arxiv.org/html/2608.05447#bib.bib10);[Maddela 等人 (2023)](https://arxiv.org/html/2608.05447#bib.bib18);[Alfea 等人 (2024)](https://arxiv.org/html/2608.05447#bib.bib21)。

RAG 通过在进行推理时整合相关外部信息来改进生成 [Lewis 等人 (2020)](https://arxiv.org/html/2608.05447#bib.bib15)。它已成功应用于广泛的生成任务,包括问答、摘要和其他知识密集型应用 [Parvez 等人 (2021)](https://arxiv.org/html/2608.05447#bib.bib23);[Zhao 等人 (2026)](https://arxiv.org/html/2608.05447#bib.bib24),[2025](https://arxiv.org/html/2608.05447#bib.bib25);[Cai (2025)](https://arxiv.org/html/2608.05447#bib.bib26)。在这些场景中,检索到的文档主要提供事实知识,用于补充模型的内部知识。

与以往的 RAG 应用不同,我们的工作将检索用于基于示例的转换指导,而不是事实依据。通过检索文档–简化示例而非支持性证据文档,EGP 使检索适应文档级简化的需求。据我们所知,这一视角在文档级文本简化中很少受到关注。

## 3 示例引导提示

图 1 展示了 EGP 的流程。给定一个复杂的输入文档,EGP 检索语义相似的文档–简化示例,并将其与目标文档一起纳入提示。得到的提示被传递给 LLM,由 LLM 生成简化输出。

参见图注

图 1:所提出的 EGP 框架概览。给定一个复杂的输入文档,系统从平行语料库中检索语义相似的文档–简化示例,并将其与目标文档一起纳入提示。LLM 将这些示例作为文档级简化的指导,并使用简化质量、语义保留和可读性的自动度量指标评估生成的输出。

## 4 实验

### 4.1 实验设置

我们在 OneStopEnglish 语料库上评估所提出的方法 [Vajjala and Lučić (2018)](https://arxiv.org/html/2608.05447#bib.bib6),采用高级到初级(advanced-to-elementary)的简化设置。

实验使用五种最先进的 LLM,涵盖商业模型和开放权重模型:GPT-4o-mini、Claude Haiku 4.5、Gemini 2.0 Flash、Sonar 和 Llama 3.2。

作为初步实验,我们比较了三种提示策略(零样本、结构化和基于约束),并选择性能最佳的提示用于所有后续实验。然后我们比较仅使用提示的生成与 EGP。

对于 EGP,我们使用稠密检索从平行简化语料库中检索最相似的 top-k(k=3)文档–简化示例。检索组件使用稠密嵌入和余弦相似度来识别语义相似的文档。被评估的文档将从检索池中排除,以防止数据泄漏。

我们使用互补的自动度量指标来评估生成的简化,这些指标覆盖了文档级文本简化的主要目标。SARI [Xu 等人 (2016)](https://arxiv.org/html/2608.05447#bib.bib2) 衡量简化质量,BERTScore [Zhang 等人 (2019)](https://arxiv.org/html/2608.05447#bib.bib8) 和 LENS [Maddela 等人 (2023)](https://arxiv.org/html/2608.05447#bib.bib18) 评估语义保留,FKGL [Kincaid 等人 (1975)](https://arxiv.org/html/2608.05447#bib.bib30) 与 FRE [Flesch (1948)](https://arxiv.org/html/2608.05447#bib.bib29) 量化可读性。这一组合使我们能够分析生成更简单文本与保留原始意义之间的权衡。

我们还将我们的方法与具有代表性的有监督(T5<sup>2</sup>)和基于规划(PlanSimp)的简化系统进行比较 [Raffel 等人 (2020)](https://arxiv.org/html/2608.05447#bib.bib16);[Cripwell 等人 (2023)](https://arxiv.org/html/2608.05447#bib.bib9)。

<sup>2</sup>T5-large-text-simplification

### 4.2 提示选择

如附录表 A1 所示,基于约束的提示在所有评估模型上始终获得最高的 SARI,同时保持有竞争力的语义保留和可读性。因此,我们在后续实验中采用这种提示策略作为仅使用提示的基线。

表 1:仅使用提示的基线与 EGP 的比较。每个单元格报告 EGP 结果,括号中为相对于仅使用提示基线的变化。SARI、BERTScore、LENS 和 FRE 的正值表示改进,而 FKGL 的负值表示改进。

### 4.3 EGP 的效果

首先,我们检验 EGP 是否改进了仅使用提示的生成。表 1 比较了仅使用提示的生成与所提出的 EGP 方法。在五种评估 LLM 中,有四种的简化质量通过加入检索到的文档–简化示例持续获得改进。Claude Haiku 4.5 取得了最大的提升,将 SARI 分数从 40.78 提高到 44.84,同时提高了由 BERTScore 和 LENS 衡量的语义保留。Gemini 2.0 Flash 和 Sonar 也观察到类似的改进,而 GPT-4o-mini 显示出较小但一致的增益。

其次,我们将 EGP 与具有代表性的有监督和基于规划的简化系统进行比较。EGP 持续达到相当或更优的性能。Claude Haiku 4.5 + EGP 获得了最高的 SARI 分数(44.84),超过了 PlanSimp(42.02)和 T5(30.0)。Gemini 2.0 Flash 也优于 PlanSimp,而 Sonar 在无需有监督训练或显式规划的情况下达到了与 PlanSimp 相当的性能。EGP 在语义保留方面的优势更加明显。根据 LENS,GPT-4o-mini 和 Claude Haiku 4.5 大幅优于 T5 和 PlanSimp,比基于规划的基线提高了 20 多个点。这些结果表明,检索到的示例在保留文档意义方面明显优于现有的有监督或基于规划的简化方法。这些结果尤其值得注意,因为 T5 和 PlanSimp 都是面向特定任务的文档简化系统,而 EGP 仅依赖带有检索示例的推理时提示。

最后,我们分析 EGP 何时最有效。检索示例的影响因模型而异。Claude Haiku 4.5、Gemini 2.0 Flash 和 Sonar 能有效利用检索到的简化示例,而 Llama 3.2 则出现了明显的性能下降。这表明,成功的 EGP 不仅取决于检索质量,还取决于 LLM 在生成过程中整合上下文示例的能力。

我们还观察到简化与语义保留之间的权衡。EGP 持续改进面向语义的指标,尤其是 BERTScore 和 LENS,但并不总是带来由 FKGL 和 FRE 衡量的最大可读性提升。因此,检索到的示例似乎鼓励了更贴近源文档并保留更多意义的简化,这凸显了在文档级简化中平衡可读性和语义保真度的必要性。

## 5 讨论

我们的结果表明,EGP 能持续提高基于提示的简化质量,而无需针对任务进行微调。

本研究的一个重要发现是,EGP 的有效性高度依赖于模型。虽然 Claude Haiku 4.5、Gemini 2.0 Flash、Sonar 和 GPT-4o-mini 能成功利用检索到的示例,但 Llama 3.2 在所有评估指标上都表现出显著的性能下降。这一观察表明,仅凭检索质量是不够的;成功的示例引导提示还需要模型具备整合上下文示例的能力。

相似文章

通过风格引导提示解释风格表示

arXiv cs.CL

本文提出了一个通过使用风格引导提示(即自然语言指令,引导大语言模型生成具有特定风格属性的文本)来解读风格表示的框架。该方法在描述和模仿写作风格方面均优于基线大语言模型提示技术。

自监督提示优化

Papers with Code Trending

本文提出了一种名为自监督提示优化(SPO)的框架,该框架通过输出对比来优化大语言模型的提示词,无需外部参考,显著降低了成本和数据需求。