先溯源后成文:主张锁定报告

arXiv cs.CL 论文

摘要

本文提出主张锁定报告,一种先溯源后成文的协议,通过在大语言模型生成前固定统计证据,以提高科学报告的可重复性和准确性。

arXiv:2608.25336v1 公告类型:新 摘要:大语言模型(LLMs)能够流畅地表达统计证据,但统计报告仍可能出现数值漂移、效应方向反转或将阈值化对比重述为分类效应等问题。我们将这些失败框定为一个控制问题:科学报告中承载证据的内容应由结构化的统计结果固定,而不是在文本生成过程中采样。因此,我们使用跨运行可重复性来压力测试报告可见的数字和主张是否在文本生成前绑定。现有控制在文本或槽位级别操作;确定性混合模板仅能重现61.1%的报告可见数值内容,因为大语言模型仍然选择模板渲染哪些发现和数字。我们提出主张锁定报告,一种先溯源后成文的协议,在LLM仅撰写连接性文本之前,固定每个可报告主张的证据来源、数字、方向和允许的语言强度。在fMRI功能连接报告和基于Evidence Inference 2.0的随机对照试验报告中,主张锁定报告分别提高了37.4和20.5个点的可重复性,相较于混合模板。盲法人类审计支持观察到的方向保持和治理趋势。在DeepSeek的fMRI成本分析中,主张锁定报告还产生了最低的观察token使用和中位生成延迟。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:18

# 1. 引言
来源:https://arxiv.org/html/2608.25336
西安电子科技大学,被EMNLP 2026收录:2026年8月

**文本之前,先锁定来源:统计文本生成的声明锁定报告法**

萧帆,李景源\*,郭红斌,韩宇波,张怡\*
西安电子科技大学
\{xiufan, hongbin, hanyubo\}@stu\.xidian\.edu\.cn \{lijingyuan, yizhang\}@xidian\.edu\.cn
\*通讯作者\*

代码(https://github.com/XiuFan719/Claim-Locked-Reporting)

**摘要**
大型语言模型(LLMs)能够流畅地陈述统计证据,但统计报告仍然可能偏离数值、颠倒效应方向,或将阈值对比重新表述为分类效应。我们将这些失败视为一个控制问题:科学报告中承载证据的内容应由结构化的统计结果固定,而非在散文生成过程中采样生成。因此,我们利用跨运行的可重复性来严格测试报告可见的数字和声明是否在散文生成前被绑定。现有的控制机制在文本或槽位级别运行;确定性混合模板跨种子仅能复现报告可见数值内容的61.1%,因为LLM仍然选择模板渲染哪些发现和数字。我们提出了*声明锁定报告*,一种在LLM撰写连接性文字之前固定每个可报告声明的证据来源、数字、方向和允许语言强度的“先溯源后写作”协议。在功能性磁共振成像(fMRI)功能连接报告和“证据推理2.0”数据集的随机对照试验报告中,声明锁定报告相比混合模板分别将可重复性提升了37.4和20.5个百分点。盲评人类审计支持观察到的方向保持和治理趋势。在使用DeepSeek进行的fMRI成本分析中,声明锁定报告也实现了最低的观测令牌使用量和中位生成延迟。代码可在 https://github.com/XiuFan719/Claim-Locked-Reporting 获取。

考虑一份由大型语言模型(LLM)生成的功能性磁共振成像(fMRI)报告。在撰写任何文字之前,统计结果已由分析固定。然而,在多次运行中,相同的结果仍可能导致不同的报告。一份报告可能包含另一份报告省略的发现,报告不同的数字细节,或使用更强或更弱的措辞描述相同的群体效应。这种变化改变了报告中承载证据的内容。当底层结果未改变时,报告的发现集合及其数字,连同其解释强度,应在多次运行中保持稳定。

LLMs越来越多地被用于起草科学和临床报告,当前的可靠性框架大多询问生成的文本是否忠实于可观察或可检索的来源,例如图像、患者记录或检索到的段落\[Van Veen et al., 2024 (https://arxiv.org/html/2608.25336#bib.bib4), Bannur et al., 2024 (https://arxiv.org/html/2608.25336#bib.bib5), Tu et al., 2024 (https://arxiv.org/html/2608.25336#bib.bib6), Singhal et al., 2023 (https://arxiv.org/html/2608.25336#bib.bib3)\]。对于LLM生成的统计报告,可靠性问题则不同。功能连接(FC)分析、随机对照试验(RCT)摘要和流行病学报告是基于已计算出的统计结果编写的:计数、效应估计、方向、阈值、协变量条件或证据范围\[Bullmore and Sporns, 2009 (https://arxiv.org/html/2608.25336#bib.bib18), Zalesky et al., 2010 (https://arxiv.org/html/2608.25336#bib.bib19), Marek et al., 2022 (https://arxiv.org/html/2608.25336#bib.bib14)\]。报告可能使用来源中出现的数字或术语,但仍然改变其所传达的统计声明,例如偏离数字、颠倒方向或夸大关联强度。我们将此类错误称为*统计声明扭曲*。统计报告的可靠性不仅要求保留来源支持的内容,还要求保留该内容的统计含义。

现有的控制机制在生成流程的不同节点介入。为清晰起见,我们将其分为两个层面。文本级控制包括提示、检索\[Lewis et al., 2020 (https://arxiv.org/html/2608.25336#bib.bib7)\]、结构化输出\[Willard and Louf, 2023 (https://arxiv.org/html/2608.25336#bib.bib8), Beurer-Kellner et al., 2023 (https://arxiv.org/html/2608.25336#bib.bib10)\]和事后验证\[Manakul et al., 2023 (https://arxiv.org/html/2608.25336#bib.bib9)\]。这些方法可以约束生成过程或输出形式,但模型仍然决定陈述哪些统计推断以及陈述的强度。槽位级控制将选定的字段与确定性表面实现相结合\[Reiter and Dale, 2000 (https://arxiv.org/html/2608.25336#bib.bib27), Gatt and Krahmer, 2018 (https://arxiv.org/html/2608.25336#bib.bib28)\]。它确保选定的字段被一致地渲染,但它不决定首先应选择哪个字段。当LLM选择槽位时,报告的数字、方向和语言强度在多次运行中仍可能变化。

这留下了一个声明级别的空白。现有的控制机制可以约束文本或渲染选定的槽位,但它们不在渲染前固定可报告的统计声明。我们通过*声明锁定报告*来解决这一空白,这是第三个控制层级,在LLM写作前将每个可报告的声明绑定到其证据来源、数字、效应方向和允许的语言强度。声明构建器将结构化的证据记录转换为声明账本;风险审计员和策略控制器确定哪些声明可被接受以及它们可以被陈述的强度;确定性渲染器根据账本输出数字、表格、实体标签和方向标签;而LLM仅在锁定的声明周围撰写连接性文字。该协议改变了模型被允许决定的内容。我们使用自动和人类分析互补的方法,在FC报告和RCT报告中评估声明锁定报告的报告稳定性、统计正确性和声明治理。额外的实验考察了组件贡献和实际生成成本。我们的贡献总结如下:

- 我们将统计声明扭曲界定为LLM生成统计报告中的一个可靠性问题,并利用跨运行的可重复性作为压力测试,检验承载证据的内容是否在散文生成前被固定。
- 我们提出声明锁定报告,一种“先溯源后写作”协议,在散文生成前将每个可报告声明绑定到其证据来源、数字、方向和允许的语言强度。
- 我们在肥胖相关的FC报告和“证据推理2.0”上的RCT报告中,针对基础基线评估了该协议,并辅以组件分析和盲评人类审计。声明锁定报告在两种设置下分别将可重复性相比混合模板提升了37.4和20.5个百分点。

## 2. 相关工作

#### 统计报告与忠实生成。
经典的自然语言生成将内容规划与表面实现分离\[Reiter and Dale, 2000 (https://arxiv.org/html/2608.25336#bib.bib27), Gatt and Krahmer, 2018 (https://arxiv.org/html/2608.25336#bib.bib28)\]:系统首先决定传达什么,然后决定如何表达。后来的神经数据到文本生成从结构化记录中联合学习内容选择和实现\[Lebret et al., 2016 (https://arxiv.org/html/2608.25336#bib.bib20), Wiseman et al., 2017 (https://arxiv.org/html/2608.25336#bib.bib21)\],随后的研究表明,显式建模内容选择和规划可以提高生成质量\[Puduppully et al., 2019 (https://arxiv.org/html/2608.25336#bib.bib22)\]。然而,统计报告揭示了这项工作未做区分的一点:选择正确的记录并不能保证正确的统计声明。相同的支持证据仍可能以错误的方向、剥离调整条件或不合理的强度进行表述。LLM时代的忠实度评估基于生成的输出。FActScore\[Min et al., 2023 (https://arxiv.org/html/2608.25336#bib.bib23)\]将文本分解为原子事实并评估它们是否被支持,而SelfCheckGPT\[Manakul et al., 2023 (https://arxiv.org/html/2608.25336#bib.bib9)\]使用跨采样生成的一致性作为幻觉信号;更广泛的调查同样围绕事实支持和一致性来组织失败案例\[Ji et al., 2023 (https://arxiv.org/html/2608.25336#bib.bib25), Huang et al., 2025 (https://arxiv.org/html/2608.25336#bib.bib26)\]。这些方法评估生成内容的属性,而不是显式表示内容所支持的统计声明。因此,一份报告可能包含单独被支持的事实,却改变了它们的联合统计含义。此类错误涉及报告的声明内容,而不仅仅是其单个事实是否出现在来源中。因此,我们将这些失败视为一个控制问题,而不是仅仅依赖事后检测。

#### 统计报告的约束生成。
现有方法通过检索增强生成(RAG)\[Lewis et al., 2020 (https://arxiv.org/html/2608.25336#bib.bib7)\]、约束解码和结构化生成\[Willard and Louf, 2023 (https://arxiv.org/html/2608.25336#bib.bib8), Beurer-Kellner et al., 2023 (https://arxiv.org/html/2608.25336#bib.bib10)\]以及事后验证\[Manakul et al., 2023 (https://arxiv.org/html/2608.25336#bib.bib9)\]来改善接地或约束生成。这些方法约束证据访问、输出结构或生成文本。然而,统计报告要求声明的数值、方向、推断范围和解释强度共同保持与其支持证据的绑定。因此,声明锁定报告将溯源绑定的统计声明(而非文本或选定字段)视为控制单元。

## 3. 声明锁定报告

### 3.1 统计证据记录
声明锁定报告从结构化的证据记录开始,而非原始影像或试验文档。该记录是固定给声明构建器的统计输入,仅包含已由领域分析流程计算出的结果。

在FC实例中,被试级连接矩阵和表型变量通过标准的边级统计分析转换为该记录。我们拟合一个边级广义线性模型(GLM),对比二元群体标签与人口统计协变量,随后在M=N⁡(N−1)/2M=N(N-1)/2个感兴趣区域(ROI)对\[Benjamini and Hochberg, 1995 (https://arxiv.org/html/2608.25336#bib.bib11)\]上进行Benjamini–Hochberg错误发现率(FDR)控制。一个并行模型额外调整了身体质量指数(BMI)(用于推导群体标签的连续协变量),提供了协变量吸收压力测试(§5.2 (https://arxiv.org/html/2608.25336#S5.SS2))。生成的记录存储FDR存活的边数、脑叶对摘要、枢纽描述、代表性边、可选的行为关联以及协变量调整的敏感性结果。对于FC文献背景声明,一个LLM辅助的文献支持标签初始化了措辞强度的上限,并在报告生成前被冻结。

在RCT实例中,证据记录由“证据推理2.0”\[DeYoung et al., 2020 (https://arxiv.org/html/2608.25336#bib.bib24)\]提供。每个实例包含一个干预措施、对照、结局、方向标签和一个包含支持性数字内容的证据范围。

### 3.2 锁定的统计声明
三个组件在报告生成前构建并约束锁定的声明:声明构建器、风险审计员和策略控制器。它们在一个共享的数据结构——声明账本上运作。

#### 声明构建器。
声明构建器将证据记录转换为声明账本,即一组类型化的声明。每个声明存储一个声明类型、规范文本、一个或多个指向记录的证据指针、它报告的数字字段、适用时的效应方向、文献支持级别和允许的语言强度。仅当其所需字段解析为证据指针时,声明才会被实例化。因此,诸如“分析证明了因果机制”之类的陈述永远不会被实例化,除非有证据记录明确支持此类声明。由于下游的渲染和写作由账本驱动,这一步骤在LLM介入之前就固定了报告可能包含的推断集合。

#### 风险审计员。
风险审计员是一个只读层。它检查每个声明并发出每条声明的审计记录,而不修改账本。每个声明都根据一组预定义的统计报告风险类别进行检查。该分类法围绕统计声明被表述时必须保留的五个证据承载属性组织:数值支持、方向保持、实体/来源支持、推断范围和解释强度。特定领域的审计规则使用相关科学文献中记录的风险来实例化这些属性。在FC中,这些风险包括与运动相关的混淆因素\[Power et al., 2012 (https://arxiv.org/html/2608.25336#bib.bib17)\]、选择后和循环分析效应\[Vul et al., 2009 (https://arxiv.org/html/2608.25336#bib.bib15), Kriegeskorte et al., 2009 (https://arxiv.org/html/2608.25336#bib.bib16)\]以及可重复性问题\[Marek et al., 2022 (https://arxiv.org/html/2608.25336#bib.bib14), Botvinik-Nezer et al., 2020 (https://arxiv.org/html/2608.25336#bib.bib13)\]。

这些类别是领域特定的,但它们实例化了相同的审计员接口:一个基于结构化证据字段的固定触发器,在散文生成前映射到一个策略动作。在FC中,触发器作用于边、枢纽、ROI名称、协变量调整模型和脑-行为关联。在RCT报告中,它们作用于“证据推理”的字段,包括干预措施、对照、结局、方向标签和证据范围。附录D (https://arxiv.org/html/2608.25336#A4)总结了共享控制目标如何在两个领域中实例化。

方向颠倒通过将每个方向声明绑定到账本存储的方向字段,而非自由文本来处理,因此报告可见的方向标签直接从该字段渲染。审计员还会拒绝任何其证据指针未能根据阶段输出解析的声明,在写作前强制执行溯源要求。对于每个被标记的声明,它记录需要由策略控制器应用的所需动作。

参见图片图1:统计文本生成的三种控制级别。文本级方法,包括提示、检索和结构化输出,将声明、数字、方向和语言强度留给LLM。混合模板增加了槽位级渲染,但LLM仍然选择哪些声明和数字填充槽位。声明锁定报告在散文生成前固定证据来源、数字、方向和允许的语言强度;LLM仅控制连接性措辞。
#### 策略控制器。
策略控制器通过两个操作将审计记录转换为渲染和写作约束。首先,它应用单调的强度降级:被标记声明的允许语言强度被

相似文章

通过溯源分析防范LLM代理失对齐

arXiv cs.CL

本文提出了一种基于溯源的框架和多阶段流水线\tool,用于在LLM代理执行工具调用前检测失对齐,与基于LLM作为裁判的基线相比,显著降低了错误率。

关于LLM智能体中“记忆来源洗白”的论文

Reddit r/AI_Agents

一篇论文探讨了LLM智能体中的“记忆来源洗白”现象,即长期记忆可以将不可信的观察结果转化为看似可信的上下文,并提出了通过记忆整合来保留来源信息的方法。

证据账本裁决:实现主张-证据可追溯性

arXiv cs.AI

本文介绍了证据账本裁决(evidence-ledger adjudication),一种用于AI辅助写作中主张-证据可追溯性的工作流,并在基于AVeriTeC、CLIMATE-FEVER和SciFact构建的盲测基准上进行了评估,结果表明基于智能体的方法优于基线方法。