基于大型语言模型的长文本生成中大纲阶段的多框架比较

arXiv cs.CL 论文

摘要

本文提出了一个统一基准,用于比较基于大纲的大型语言模型长文本生成框架,独立评估大纲,发现性能随框架与粒度匹配度变化,支持将大纲与写作阶段解耦。

arXiv:2608.26177v1 公告类型:新 摘要:长文本生成暴露了大型语言模型的根本局限性。即使是700亿参数的模型在16k-token输出时也会出现长度崩溃,多章故事频繁触发‘中间丢失’效应的属性漂移。‘先大纲,后写作’的范式已被广泛采用,但现有研究评估的是最终写作而非大纲本身,混淆了两个应解耦的评估对象。我们构建了一个统一的头对头基准,覆盖7个代表性的长文本生成框架,涉及3种生成粒度——单章、多章和全书——并提出了一种基于锚点的LLM-as-a-judge协议,直接在5分锚点尺度上将大纲与源文本进行评估。在21个框架-粒度单元中,没有单一框架占主导;性能取决于框架内在输出形式与目标粒度的匹配度。SuperWriter在长度受限的单章模式中排名第一,但这一优势在全书模式中减弱。大纲侧排名仅与写作侧排名中度相关,支持大纲-写作解耦原则。计算约束限制了写作侧评估仅限于部分案例;后续实验将扩大样本量并添加跨模型评估器,以实现更强的统计推断。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:23

# 大语言模型长文本生成中大纲阶段的多框架比较
来源:https://arxiv.org/html/2608.26177
###### 摘要

长文本生成暴露了大语言模型的根本局限。即使是700亿参数的模型,在输出16k tokens时也会出现长度塌缩,而多章节故事则频繁触发“中间丢失”效应中典型的属性漂移问题。“先大纲,后写作”的范式已被广泛采用,但现有研究评估的是最终写作而非大纲本身,混淆了本应解耦的两个评估对象。我们构建了一个统一的直接比较基准,涵盖7种代表性长文本生成框架和3种生成粒度——单章节、多章节与全书——并提出一种基于锚点的大语言模型评判协议,该协议使用五点锚定评分尺度直接根据源文本评估大纲质量。在21个框架-粒度组合中,没有单一框架占据绝对优势;性能取决于框架内在输出形式与目标粒度的匹配程度。SuperWriter在长度受限的单章节模式中排名第一,但此优势在全书模式中减弱。大纲侧排名与写作侧排名仅呈中等相关性,这支持了大纲与写作解耦的原则。计算资源限制将写作侧评估限定在部分案例中;后续实验将扩大样本量并引入跨模型评估器以增强统计推断能力。

关键词:长文本生成、大语言模型、大纲驱动生成框架、受控比较、长度合规性、远距离连贯性、大语言模型评判

## 1引言

近期长文本生成领域的进展引发了学界对大纲驱动框架的浓厚兴趣,然而如何独立于最终文本来评估大纲阶段质量仍不明确。当任务长度从几百字符扩展到数千字符时,三个相互交织的约束定义了问题的范围:结构连贯性、远距离一致性和长度合规性。其中,远距离一致性最为突出——Transformer的注意力机制存在众所周知的“中间丢失”效应[10],即上下文中间位置的信息会系统性地获得较低权重,导致角色漂移和情节矛盾。长度合规性构成了另一个独立瓶颈:LongGenBench[20]显示,即使700亿参数模型在16k/32k token输出时STIC-2得分仅达11.5%,HelloBench[13]发现模型在要求生成4000字符时往往止步于2000字符左右。这些失效模式促使我们将研究焦点转向大纲阶段。先前工作——LongWriter、Re3、DOC和StoryWriter——反复确认了大纲对远距离连贯性的核心作用,并将大纲规划构建为核心机制。多智能体反思修订也得出了相同结论。

现有研究通过三个相互交织的范式解决长文本生成问题(详见第2节综述)。“先规划后写作”范式将大纲生成与初稿撰写分离,起源于早期神经故事生成[4],并延伸至递归重提示[24]、细粒度大纲控制[23]和自然语言记忆模拟[27]。多智能体协作范式将“对话智能体+程序化对话流”视为处理复杂大语言模型任务的通用模式[19,7]:该范式将标准操作流程编码为提示序列,协调规划与写作智能体,或通过多轮对话迭代优化大纲。反思修订范式验证了“评估-反思-修订”循环在长文本连贯性中的关键作用,通过自然语言反思将自我批评提炼为情景记忆[17,11]。

评估方法也在同步演进:从BLEU/ROUGE主导的局面,发展到以HANNA[3]和WriteJudge[21]为代表的多维度细粒度评分。大语言模型评判范式在与人类评估达成80%以上一致性方面已获验证[26,6],但位置偏差、冗长偏好和自我偏好偏差仍然存在。在长文本评估方面,ExPerT[15]、ProxyQA[18]和WritingBench[22]通过原子方面提取、代理问题和查询相关评分标准减少了对黄金标准参考答案的依赖。然而,一个关键的评估缺口依然存在:现有写作侧评估——即HANNA和WriteJudge对写作输出的评分——评估的是写作内容而非大纲本身。当研究者追问“哪种框架能产生更好的大纲?”时,他们只能从写作侧指标进行反向推断,混淆了大纲质量与写作质量,掩盖了不同框架在大纲设计上的真正差异。我们双轨设计背后的洞见在于:大纲与写作是两个解耦的评估对象,它们仅共享源文本。

这一缺口推动了本研究。我们构建了统一的受控基准并提出双轨评估协议。我们的贡献有三方面:

#### (1)涵盖7个长文本生成框架、跨3种生成粒度的统一直接比较基准。

我们在统一的大语言模型后端上比较了代表性的“先规划后写作”框架与朴素基线,并在21个框架-粒度组合中控制了对原始论文骨架的忠实度。

#### (2)用于直接大纲评估的基于锚点的大语言模型评判协议。

该协议将评分尺度以源文本为锚点建立五点量表,将大纲评估与写作评估解耦。两个互补轨道——大纲侧约89个案例与写作侧部分样本——仅共享源文本。

#### (3)四项经验性启发规则和一项解耦原则

(首次在第4.5节报告)。没有单一框架能在所有粒度上占据主导;大纲侧与写作侧排名仅呈中等相关性,支持了大纲与写作解耦原则。

计算资源限制将写作侧评估限定在部分案例中;后续实验将扩大样本量并引入更多模型作为评估器进行受控比较。

## 2相关工作

长文本生成已形成共识性组织原则:显式的写作前规划、多智能体协作和事后反思构成了控制远距离连贯性的三大主流范式。我们依次回顾这些范式,并将本基准研究置于其背景下。

#### 大纲驱动的长文本生成。

“先大纲,后写作”是人类写作的经典模式,也是长文本生成领域首个被系统研究的范式。Fan等人[4]将其引入神经故事生成;Yao等人[25]提出“规划-写作”方法,将生成明确分为规划和写作阶段;Goldfarb-Tarrant等人[5]通过用户研究证明,规划-写作-修订能带来10%–50%的质量提升。在大语言模型时代,这一范式得到进一步拓展:Yang等人的Re3[24]和DOC[23]通过递归重提示和细粒度大纲控制提升远距离连贯性;Zhou等人[27]用自然语言组件模拟LSTM的长短期记忆。本文比较的“先规划后写作”框架属于这一谱系,其设计导向各异——认知写作、动态层级大纲、事件图谱与硬性长度约束——但都统一了大纲生成与扩展过程。与提出单一新框架的工作不同,我们构建了跨越多个“先规划后写作”框架的直接比较基准。

#### 多智能体与基于反思的修订。

另一条并行研究脉络将长文本生成建模为多智能体协作或过程监督。Wu等人[19]确立了“对话智能体+程序化对话流”作为复杂大语言模型任务的通用模式;Hong等人[7]将标准操作流程编码为多角色智能体通过共享消息池协调的提示序列;Huot等人[8]和Shao等人[16]通过规划/写作智能体协调或多轮对话迭代优化大纲。在反思与过程监督方面,Reflexion[17]通过自然语言反思将自我批评提炼为情景记忆;DPO[14]将偏好对齐转化为二元交叉熵损失;LongDPO[12]结合逐步DPO与全局记忆池,专门优化长文本生成。与这些提出单一框架的工作不同,我们提供了一个受控比较平台,使不同框架能够并列评估。

#### 评估方法与直接大纲评估。

评估协议已从BLEU/ROUGE主导转向多维度细粒度评分。HANNA[3]和WriteJudge[21]从多个维度评估生成故事的质量;大语言模型评判范式在MT-Bench[26]上与人类评估达成85%非平局一致性,但位置偏差、冗长偏好和自我偏好偏差依然存在;ExPerT[15]、ProxyQA[18]和WritingBench[22]分别通过原子方面提取、代理问题和查询相关评分标准减少了对黄金标准参考答案的依赖。然而,现有写作侧评估针对的是写作输出而非大纲本身——这正是我们的基于锚点的大语言模型评判协议所要弥补的方法论缺口。我们将HANNA评分、WebNovelBench叙事质量框架[9]、LongBench-Write长度评分[2]和WritingBench的查询相关评分标准整合成一个覆盖7个框架、跨3种粒度的统一协议,将大纲阶段与扩展阶段解耦为大纲侧主轨道加写作侧辅助轨道。

## 3方法

我们不提出新的生成框架,而是在统一基准上对现有长文本生成框架进行直接比较。本节提供形式化任务描述、实验设计和评估协议。

### 3.1任务与定义

长文本生成框架定义为 $\mathcal{F}=\langle P,\,\mathcal{O},\,\mathcal{W}\rangle$,其中 $P$ 是跨阶段的提示编排,$\mathcal{O}$ 是中间表示(自然语言段落、结构化JSON、叙述性大纲文本或无),$\mathcal{W}$ 是将最终大纲映射为长文本输出的写作策略。给定源文本 $x$ 和目标长度 $L$,框架输出长文本 $y$。我们的比较在7个代表性框架之间变化 $\mathcal{F}$,同时固定大语言模型后端、评估模型和指标体系。我们将原始的“前提→长文本”正向生成设置反转为“长文本→大纲”反向提取设置(后称“任务反转”)——所有7个框架处理现有文本而非用户指令。这种反转引入了三个系统性副作用:(i)Dome的角色槽在执行路径上为空;(ii)StoryWriter的章节数量范围需按模式调整;(iii)评估标准从“生成质量”转向“大纲对齐度”。

#### 控制变量。

我们固定以下因素:(1)统一写作后端——所有7个框架共享相同大语言模型(deepseek-v4-flash);(2)统一评估器——评估器与生成器使用相同模型;本研究未缓解自我偏好偏差;(3)统一数据接口与契约——输入语义在3种加载模式间对齐,所有输出均在统一JSON字段下生成;(4)统一指标体系,按模式激活维度:D1_跨章一致性仅在全书模式激活,M1_与前文连续性仅在多章节模式激活,M7_内容比率仅在多章节/全书模式激活;(5)骨架对齐——所有7个框架的提示编排顺序、阶段数量和关键槽约束与原始论文或官方代码同构。

#### 未控制差异。

本实验是受控比较而非完全单变量设计:(i)采样参数差异——各框架使用其原始论文的默认温度值(CogWriter 0.1,SuperWriter 0.6,StoryWriter阶段1为1.0/阶段2为0.5,其他为0.7),而非统一值;(ii)提示层面偏差——少样本删除、内联JSON注释替换等细微偏差;(iii)已知缺陷——naive/cot/selfrefine在英文加载模式下,章节槽中仍保留残留的中文占位符字段,影响12个组合。

#### 评估器与生成器共享模型引入的自我偏好偏差在本研究中未被缓解。

因此所有“优胜”声明应视为方向性模式而非统计显著结论;后续实验将引入额外大语言模型作为评估器以厘清自我偏好偏差。

### 3.2研究问题

我们沿两条证据链组织研究问题——大纲侧主要证据(大纲输出的直接评估)和写作侧辅助证据(从大纲扩展的写作输出的评估)。四个研究问题为观察性提出;因果归因留给未来的消融工作。

- • RQ1:在7个框架中,大纲侧指标是否出现稳定排名?结构化大纲框架是否在忠实度和一致性上系统性地优于非大纲基线?
- • RQ2:大纲侧指标与写作侧指标之间的相关性有多强?这是否支持大纲-写作解耦原则?

相似文章

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。