LongNovel:多尺度长上下文小说摘要幻觉检测基准测试
摘要
LongNovel 引入了一个多尺度基准测试,用于评估长上下文小说摘要中的幻觉,基于中英文小说构建,以改进LLM评估。
arXiv:2608.18082v1 公告类型:新
摘要:尽管近年来上下文窗口显著扩大,但长上下文摘要中的幻觉仍是一个挑战。长篇小说由于其内在信息和对事件及对话的详细描述,比新闻或论文更适合研究这些幻觉。然而,当前研究缺乏一个用于长上下文小说摘要幻觉检测的多尺度基准测试,且未充分探索幻觉随上下文增长的变化。在本研究中,我们提出了LongNovel,一个多尺度、长上下文、双语(中英文)小说幻觉检测基准测试。该基准测试基于29本中文小说(从16k到100k令牌不等)和BookSum数据集的章节级数据构建。我们设计了8种幻觉类型,并采用多模型仲裁和实体参考幻觉生成相结合的方法,以确保数据真实性和幻觉类别的平衡分布。此外,我们手动修订了测试集中的内容,以保证数据可靠性。大量实验结果表明,LongNovel是一个具有挑战性的基准测试。我们发布LongNovel供未来研究使用。https://github.com/BDML-lab/LongNovel
查看缓存全文
缓存时间: 2026/08/20 09:49
# LongNovel:面向长上下文小说摘要幻觉检测的多尺度基准
来源:https://arxiv.org/html/2608.18082
张锐智1†✠陈锦伟1†✠鲁祥驹2¶✠ 严赫2¶于墨3‡朱军民2¶张伟1§∗
1华东师范大学 2爱奇艺股份有限公司 3腾讯
†{51275901045, 51285901033}@stu.ecnu.edu.cn¶{luxiangju, yanhe, zhujunmin}@qiyi.com, ‡[email protected],§[email protected]
###### 摘要
尽管近年来大语言模型的上下文窗口已显著扩展,长上下文摘要中的幻觉问题仍是技术难点。由于小说固有的信息密度及对事件与对话的细致描写,相比新闻或学术论文,长篇小说更适合用于研究此类幻觉。然而,当前研究缺乏针对长上下文小说摘要幻觉检测的多尺度基准,且尚未充分探索幻觉如何随上下文长度增长而演变。本研究提出LongNovel——一个面向幻觉检测的多尺度长上下文双语(中英文)小说基准。该基准基于29部中文小说(涵盖16k至100k token长度)及BookSum数据集的章节级数据构建。我们设计了八类幻觉类型,并采用多模型仲裁与实体参照式幻觉生成的组合方法,确保数据的真实性及幻觉类别的均衡分布。此外,我们人工修正了测试集内容以保障数据可靠性。大量实验表明LongNovel是一个具有挑战性的基准。现发布LongNovel供未来研究使用。111https://github.com/BDML-lab/LongNovel
rmTeXGyreTermesX [\*devanagari]rmLohit Devanagari [\*arabic]rmNoto Sans Arabic
**LongNovel:面向长上下文小说摘要幻觉检测的多尺度基准**
张锐智1†✠陈锦伟1†✠鲁祥驹2¶✠严赫2¶于墨3‡朱军民2¶张伟1§∗
1华东师范大学 2爱奇艺股份有限公司 3腾讯
†{51275901045, 51285901033}@stu.ecnu.edu.cn¶{luxiangju, yanhe, zhujunmin}@qiyi.com,‡[email protected],§[email protected]
††✠\\malteseEqual contribution.††∗\\astCorresponding author.
## 1 引言
尽管大语言模型的上下文窗口已扩展至100k token以上[Chen et al.(2024c); Peng et al.(2024); Ding et al.(2024)],从而实现了长文本内容处理,但这种容量提升并未从根本上解决长上下文摘要中的幻觉问题[Kim et al.(2024); Belém et al.(2025); Pal et al.(2023)]。小说摘要因其需要从对话与事件中推断隐含信息(比处理新闻或学术论文中的显性数据更复杂),成为研究长上下文摘要幻觉的理想载体[Karpinska et al.(2024a); Kryscinski et al.(2022); Kim and Kim (2025); Chen et al.(2024a)]。传统评估指标如ROUGE[Lin (2004)]和BERTScore[Zhang et al.(2020)]仅限于词汇或语义相似度,而其他基于NLI的方法如SummaCLAB[Laban et al.(2022)]和AlignScore[Zha et al.(2023)]由于输入窗口限制,常无法检测长上下文幻觉。因此,亟需开发能识别长上下文场景幻觉的更精确评估模型。然而,稳健评估模型的开发依赖于高质量基准数据集,构建长文本多尺度幻觉检测数据集将有助于发现更可靠的评估模型。当前研究面临两大挑战:首先,人工标注成本高昂阻碍了长上下文小说幻觉检测基准的构建,传统数据集如NOCHA[Karpinska et al.(2024b)]和StorySumm[Subbiah et al.(2024)]依赖人工标注的幻觉数据,既耗时又耗力;而合成数据集如LCHD[Liu et al.(2025)]虽降低了标注成本,却未达到100k token规模。其次,幻觉如何随上下文长度增长而演变尚属研究空白,现有基准大多缺乏跨不同长度评估模型鲁棒性的多尺度设计。尽管Fables[Kim et al.(2024)]涵盖100k token规模,但仅限于单一长度;Clipper[Pham et al.(2025)]虽在100k规模引入书籍级与章节级声明的多尺度方法,却非专为摘要幻觉检测设计。
| 基准 | 摘要幻觉检测 | 100K规模 | 自动生成 | 不同长度 |
|------|------------|---------|---------|---------|
| Nocha (2024a) | ✗ | ✓ | ✗ | ✗ |
| StorySumm (2024) | ✓ | ✗ | ✗ | ✗ |
| FABLES (2024) | ✓ | ✓ | ✗ | ✗ |
| LCHD (2025) | ✓ | ✗ | ✓ | ✗ |
| CLIPPER (2025) | ✗ | ✓ | ✓ | ✓ |
| LongNovel (本研究) | ✓ | ✓ | ✓ | ✓ |
表1:本基准与其他小说基准对比。"摘要幻觉检测"、"100K"、"自动生成"和"不同长度"分别表示是否为摘要幻觉检测数据集、是否达到100K token、幻觉数据是否通过自动化方法生成、是否包含不同长度层级。LCHD[Liu et al.(2025)]指长上下文幻觉检测数据集。
为解决上述问题,我们提出LongNovel——一个面向长上下文小说摘要幻觉检测的多尺度基准。基于29部书籍语料构建,我们创建了S(16k)、M(32k)、L(64k)和XL(100K)四种长上下文场景,测试集共包含600个样本。基于这些场景设计了八种幻觉类型。值得注意的是,我们使用人工撰写的摘要作为基准事实来指导LLM生成,以确保数据可靠性。每个判断包含摘要一致性评分、识别出的幻觉类型及判断理由。本基准框架如图1所示。为平衡数据真实性与幻觉类型的均匀分布,我们采用两种互补的构建方法:其一是多模型仲裁,利用GLM4-9B-chat[GLM et al.(2024)]、Qwen3-32B[Yang et al.]和GPT-4o[OpenAI (2024)]生成摘要,随后通过跨模型验证进行数据标注,以捕捉LLM输出中的真实幻觉;其二是实体参照式幻觉构建,通过提取实体并利用LLM基于八种特定提示模板在人工撰写的摘要基础上制造幻觉,从而确保所有目标幻觉类型的均衡分布。最终为保障数据可靠性,我们对测试集进行了全面人工修订。与先前长上下文小说基准相比,LongNovel具有多项独特优势(如表1所示)。我们在LongNovel上评估了若干前沿模型并采用不同方法进行实验,结果表明该基准对当前模型构成了挑战。总体贡献如下:
- 我们引入LongNovel,这是一个专为长上下文小说摘要幻觉检测设计的多尺度中英双语基准,涵盖四个长度层级与八种不同幻觉类型。
- 我们实现了结合多模型仲裁与实体参照式幻觉构建的构造方法,该方法使数据集既保持现实真实性又覆盖多种幻觉类型。
- 我们在LongNovel上评估了前沿模型与方法,揭示了长上下文幻觉检测的挑战性,为未来研究提供了具有挑战性的基准。
[图示描述] 图1:LongNovel框架图
[图示描述] 图2:不同上下文长度下的幻觉类型分布
## 2 相关工作
### 2.1 幻觉检测基准
当前幻觉数据集构建方法可分为两类:第一类由LLM生成后经人工标注识别幻觉样本[Laban et al.(2023); Karpinska et al.(2024a); Subbiah et al.(2024); Akbar et al.(2024); Tang et al.(2024b); Chen et al.(2024b); Bao et al.(2025); Abdaljalil et al.(2025)],该方法的优势在于生成的幻觉模式与模型在实际场景中的表现高度吻合,但严重依赖高质量标注,既耗时又耗资源[Qi et al.(2025)]。第二类是基于现有参考材料(如书籍或摘要)的自动幻觉注入:早期方法如Kryscinski et al.(2020)通过实体替换与否定插入生成负样本;Cao and Wang (2021)将低似然分数的系统输出选为负样本;近期研究则利用LLM的指令遵循能力进行幻觉合成[Tang et al.(2024a); Liu et al.(2025); Ming et al.(2025)]。Pham et al.(2025)从原始书籍内容中提取摘要或大纲,引导LLM生成真假声明对及相应推理链。
### 2.2 幻觉检测方法
现有幻觉检测方法按处理文本长度可分为短文本与长文本检测。短文本检测中:Laban et al.(2022)通过将文档分解为句对并计算基于NLI的蕴含分数来评估事实一致性;Zha et al.(2023)通过大规模对齐预训练增强跨任务泛化能力;Liu et al.(2023c)引入基于原子内容单元的评估框架;Chen et al.(2025)提出基于语义图的方法捕捉实体与句子间的复杂关系,从而增强句段与篇章层面的幻觉检测。此外,基于QA的方法[Deutsch et al.(2021); Scialom et al.(2021)]通过衡量源文本与生成摘要间的答案一致性来验证信息忠实度。在长文本幻觉检测中,许多短文本方法受输入窗口限制。相关解决方案包括:直接利用LLM进行二分类,或采用思维链[Wei et al.(2022)]在最终判断前提供逐步分析;Liu et al.(2023b)利用LLM基于预设指标为内容评分,显示与人工判断高度相关;Min et al.(2025)引入基于辩论的框架,为LLM分配特定角色(如辩护者、怀疑者、裁决者)以增强数据可靠性。此外,用于验证QA任务忠实度的RAG系统[Zhang et al.(2025); Hu et al.(2025); Laban et al.(2024)]也可检测摘要中的幻觉[Min et al.(2023)]。
## 3 LongNovel构建
### 3.1 数据收集
我们使用中英文文学资源构建LongNovel。中文语料收集自开源中文网络平台的29部书籍,每部均具备连贯情节,适用于长文本一致性检测。每部书籍B=\{u₁,u₂,...,uₙ}被划分为一系列文本单元(章节或段落),每个单元uᵢ的长度范围为2k至6k token。我们聘请16名标注员:每个文本单元由一名标注员起草初始摘要,再由另外两名标注员修订,以确保准确性与对原文的忠实度。英文语料直接采用BookSum[Kryscinski et al.(2022)]的章节级子集,将每章视为文本单元uᵢ,并利用其高质量人工撰写摘要。最终,两种语言的每个文本单元uᵢ均配对相应的人工摘要sᵢ。
### 3.2 长度扩展
为全面评估模型在不同上下文窗口下的性能,我们定义四种目标长度T∈\{16k,32k,64k,100k\}及其对应的评估范围ℛ(T):
ℛ(T)=[T-2k, T+4k] (1)
我们使用Qwen3[Yang et al.]分词器计算token数。书籍B由多个文本单元u构成,表示为B=\{u₁,u₂,...,uₙ}。针对目标范围ℛ(T)与书籍B,采样方法如下:
1) 从u₁初始化滑动窗口w,逐单元扩展。
2) 当w=[uⱼ, uⱼ₊₁,..., uₖ₋₁, uₖ](1≤j≤k≤n)时:
i. 若Len(w)<infℛ(T)相似文章
幻觉检测引导的临床摘要偏好优化
介绍了HDSR和HDSR-PL方法,这些方法使用幻觉检测器来指导迭代自我改进和偏好学习,在MIMIC-IV-Note上使用Llama和Gemma模型进行临床摘要时,幻觉减少高达48%。
NovGauge:一种用于诊断LLMs在论文新颖性评估能力的细粒度基准
NovGauge是一个基于人类锚定的基准,用于诊断LLMs在论文新颖性评估中的能力,覆盖任务、问题和方法维度。对18个LLMs的评估显示高幻觉率和逻辑不匹配,表明当前模型在此任务上不可靠。
抽象摘要中关系级幻觉评估的基于依据的分解框架
本文提出了一个基于依据的、可分解的框架,用于评估抽象式摘要中的关系级幻觉,引入了标准化的关系幻觉指数(RHI),并带有语言感知的关系抽取增强。
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。
ClinHallu:用于诊断医疗多模态大语言模型推理中阶段性幻觉的基准
ClinHallu是一个基准,通过将推理分解为视觉识别、知识回忆和推理整合阶段,并使用轨迹监督微调来减少错误,从而诊断和缓解医疗多模态大语言模型中的幻觉。