Stage-Audit:跨维基表的可审计源前沿发现
摘要
Stage–Audit 提出了一种用于跨维基表的 Seed2Frontier 发现治理协议,采用分离的策展人-审计人写入权限和包含12项检查的审计分类法,将源前沿精度相比普通 LLM 策展人相对提高了42%。
arXiv:2605.20478v1 Announce Type: new
摘要:LLM 策展的表可能看起来有源依据,但包含无支持的行:策展人可能从参数化记忆中回忆条目,并事后添加并非实际来源的页面级引用。我们研究了 Seed2Frontier 发现中的这一风险:即从种子页面查找补充维基百科页面以组装结构表格的任务。Stage-Audit 通过分离的策展人-审计人写入权限、行级源引用门控以及包含12项检查的审计分类法(涵盖键、模式、源角色、基数和范围)来解决这一问题。在涵盖15个顶级域名的51个实例的 Seed2Frontier 评估集上,Stage-Audit 将源前沿精度从普通 LLM 策展人的0.356提高到0.505(相对提高42%),F1 从0.334提高到0.451(相对提高35%),同时保持每行的显式源可追溯性。普通 LLM 与 Stage-Audit 的对比分离了策略贡献,而非一般的基于 LLM 的发现。
查看缓存全文
缓存时间: 2026/05/21 06:32
# 阶段审计:面向跨维基表格的可审计源前沿发现 来源:https://arxiv.org/html/2605.20478 \\workshoptitle 用于野外发现的AI智能体 ###### 摘要 LLM生成的表格可能看似有源可溯,却包含无依据的行:策展人可能从参数化记忆中回忆条目,并事后附加并非真实来源的页面级引用。本研究在*种子到前沿发现*任务中考察了这一风险:该任务要求从种子页面出发,寻找补充的维基百科页面,以组装成结构化表格。阶段审计通过以下方式解决此问题:分离策展人与审计人的写入权限、行级源引用门控、以及一个包含12项检查的审计分类体系(覆盖键、模式、来源角色、基数和范围)。在涵盖15个顶级领域的51个实例的种子到前沿评估集上,与普通LLM策展人相比,阶段审计将源前沿精确率从0.356提升至0.505(相对提升+42%),F1分数从0.334提升至0.451(相对提升+35%),同时保持每行来源的可追溯性。普通LLM与阶段审计之间的比较,隔离的是策略本身的贡献,而非LLM基础发现能力的差异。 ## 1 引言 考虑这样一个问题:“按大洲列出长度超过1000公里的跨界河流。”没有哪个单独的维基百科页面能直接给出答案。一个希望返回结构化表格(而非段落)的LLM智能体,必须浏览主列表、各大洲概览页面以及每条河流的独立文章,然后将它们拼接成带有键和源可追溯性的行。我们将此问题称为*种子到前沿发现*:从种子维基页面出发,发现组装结构化表格所需的源前沿。 技术上的风险在于无意的无依据性。LLM策展人可能会从参数化记忆中回忆出行,并事后附加看似合理的页面级引用;即使引用并非该行的真实来源,该行看起来也被引用了。先前的研究记录了评估时的自我偏好和弱自我修正现象(Panickssery等,2024(https://arxiv.org/html/2605.20478#bib.bib21);Wataoka等,2024(https://arxiv.org/html/2605.20478#bib.bib32);Barkan等,2025(https://arxiv.org/html/2605.20478#bib.bib3);Huang等,2024(https://arxiv.org/html/2605.20478#bib.bib10);Kamoi等,2024(https://arxiv.org/html/2605.20478#bib.bib13));而在本问题中,失败发生在更早的阶段,即参考表格构建时。 我们引入*阶段审计*,一种针对种子到前沿发现的治理协议。策展人仅能在附带外部源URL和定位符的情况下暂存规范行;审计人不能编辑表格,而是根据一个包含12项检查的分类体系(覆盖行证据、主键、模式、来源角色、基数和范围)追加发现(图1(https://arxiv.org/html/2605.20478#S3.F1))。现有检索系统可以尝试种子到前沿发现(第2节(https://arxiv.org/html/2605.20478#S2));我们的贡献在于治理层的叠加,而非新的检索方法。一张表格中的每一行可能看似合理,但如果其分区、键或穷尽性声明有误,整张表依然不可用——这正是我们的表格级审计所要捕捉的问题。 我们做出三项贡献: (1)**任务与策划数据集**:一个包含51个实例的种子到前沿评估集,覆盖15个顶级领域,每个实例包括维基种子页面、标注的补充页面以及主键真值表。 (2)**协议**:阶段审计定义了角色分离的写入权限、源引用门控、行见证属性,以及一个适用于结构化表格的12项检查审计分类体系。 (3)**策略消融**:通过四种配置(仅记忆、种子外链、普通LLM策展人、阶段审计)的比较表明,提升源前沿精确率和F1分数的驱动力是源引用门控加审计,而非单纯的LLM基础发现能力。 ## 2 相关工作 **源依据与评判者偏差**。FActScore、ALCE、SAFE和PaperTrail对生成文本进行事后评估(Min等,2023(https://arxiv.org/html/2605.20478#bib.bib20);Gao等,2023b(https://arxiv.org/html/2605.20478#bib.bib1);Wei等,2024(https://arxiv.org/html/2605.20478#bib.bib33);Martin-Boyle等,2026(https://arxiv.org/html/2605.20478#bib.bib18));而LLM作为评判者的研究则记录了同族模型中的偏差和自我偏好(Zheng等,2023(https://arxiv.org/html/2605.20478#bib.bib34);Panickssery等,2024(https://arxiv.org/html/2605.20478#bib.bib21);Wataoka等,2024(https://arxiv.org/html/2605.20478#bib.bib32))。阶段审计在行进入表格之前就设置了门控,因此输出的是带有键和范围声明的结构化表格,而非一系列原子化事实。 **跨页面维基检索与引用感知生成**。SRAG、KARMA、WikiContradict和InfoGather涉及多页面维基构建(Lin等,2025(https://arxiv.org/html/2605.20478#bib.bib24);Lu和Wang,2025(https://arxiv.org/html/2605.20478#bib.bib25);Hou等,2024(https://arxiv.org/html/2605.20478#bib.bib26);Yakout等,2012(https://arxiv.org/html/2605.20478#bib.bib29));HybridQA、OTT-QA和Open-WikiTable则在固定的多页面表格语料库上进行QA评估(Chen等,2020(https://arxiv.org/html/2605.20478#bib.bib37),2021(https://arxiv.org/html/2605.20478#bib.bib38);Kweon等,2023(https://arxiv.org/html/2605.20478#bib.bib39)),而种子到前沿发现评估的是*源前沿本身的发现*。我们的普通LLM策展人基线充当了此类未受防护的LLM检索的代表。 RARR为自由文本输出追溯添加引用,Self-RAG则学习在生成过程中自我引用(Gao等,2023a(https://arxiv.org/html/2605.20478#bib.bib35);Asai等,2024(https://arxiv.org/html/2605.20478#bib.bib36));两者都将引用步骤置于生成器内部,且没有针对结构化表格契约的独立审计角色。阶段审计则在*行被暂存之前*强制执行引用,并引入一个独立的审计人,其发现结果不能改写策展人的表格;SPADE和MAST为表格契约观点提供了动机(Shankar等,2024(https://arxiv.org/html/2605.20478#bib.bib31);Cemri等,2025(https://arxiv.org/html/2605.20478#bib.bib5)),而生成器-批判者、辩论、Self-Refine和Constitutional AI探索了通过额外调用来进行批判的方式,但未设置行级源门控(Madaan等,2023(https://arxiv.org/html/2605.20478#bib.bib16);Du等,2024(https://arxiv.org/html/2605.20478#bib.bib7);Bai等,2022(https://arxiv.org/html/2605.20478#bib.bib2))。 ## 3 方法 ### 3.1 阶段审计监督协议 设MM为用于为用户问题策源依据表格的模型或智能体框架。某些策源表格稍后可能被用于评估或诊断同族模型。威胁并非来自对抗性欺骗,而是无意的自我引用:MM会输出记忆中的行,然后附加看似合理的页面级引用。由于在没有外部反馈的情况下,内在的自我修正能力较弱(Huang等,2024(https://arxiv.org/html/2605.20478#bib.bib10);Kamoi等,2024(https://arxiv.org/html/2605.20478#bib.bib13)),该协议让源政策(而非模型的自我批判)成为承担主要负荷的机制。 **用户查询**:“按大洲列出长度≥1000公里的跨界河流,包括长度和流经国家。” **种子**:en.wikipedia.org/wiki/Transboundary_river **策展人(暂存带有定位符的行)**:提出13个补充页面(例如,*Senegal_River*、*Amur*、*Ural_(river)*)。暂存31行;每行携带source_page和章节/信息框定位符。 **审计人(仅追加发现)**: ✓ 源引用门控:每行都引用了页面和定位符。 △ 范围,阻塞性:*Ural*跨越欧洲/亚洲;分区标签不明确。 △ 基数,阻塞性:发出31行,而从前沿覆盖率预计为33行。 **修复(策展人重新暂存)**:从*List_of_transboundary_rivers*中拉取缺失的2行;将*Ural*的大洲设置为Europe;Asia。 **经过审计的表格**:33行×4列,主键=River,每行→维基定位符。 **人类验收(部署阶段)**:审阅者签署经过审计的表格;*在我们的实验中被消融*(仅LLM审计人)。 重新暂存 图1:在策源的种子到前沿发现实例上的阶段审计演练。策展人提出带有定位符的行;审计人根据12项检查分类体系追加发现,不能编辑表格;阻塞性发现会触发返回策展人的修复-重新暂存循环。虚线表示部署阶段的人类验收角色;我们的实验消融了人类步骤,并运行单次策展人-审计人过程,不进行修复-重新暂存迭代,以隔离该策略在单次步骤中的价值。 **设计原则**。阶段审计包含四条操作规则: - **仅追加审计**:审计人不能编辑规范表格,而是单独记录发现。 - **源引用优先**:每一行在暂存之前必须携带源URL和定位符。 - **参数化记忆不是证据**:记忆的事实可能提示搜索方向,但不能作为行的依据。 - **双轴严重性**:每个发现按问题类型(事实性/结构性/范围相关)和严重性(阻塞性/卫生/建议)进行标记,以便修复时区分阻塞项与表面问题。 **工件生命周期**。暂存表格经历四个状态(*已提出*、*已暂存*、*已审计*、*已修复*),迭代直到没有阻塞性发现。策展人仅提出和暂存带有定位符的行;审计人追加发现,但不能编辑规范行。在部署中,人类验收步骤负责最终签字;本文仅评估LLM策展人+LLM审计人子流水线。 **源门控验收与审计检查**。我们说,如果对于发出的每一行RR,都存在一个证据定位符E(R)E(R),且该定位符的内容在仅对该定位符内容进行操作的抽取器ff下支持RR,则该行相对于MM具有非参数化见证。阶段审计通过源引用门控来实现这一点:没有定位符的提议行在审计之前就会被拒绝。该门控并不保证真实性。它只是改变了失败模式:一行出错,仅当抽取器错误地解读了所引用的定位符。工件契约A=(Q,K,C,P,S,E)A=(Q,K,C,P,S,E)记录了用户查询、主键模式、列、范围声明、源集合和证据映射。审计检查涵盖行证据、键完整性、模式一致性、基数、源角色覆盖、声明类型、标准化、范围匹配和时序可知性(检查项:附录I(https://arxiv.org/html/2605.20478#A9);严重性:附录F(https://arxiv.org/html/2605.20478#A6);证明草图:附录C(https://arxiv.org/html/2605.20478#A3))。*事实性*发现针对行证据;*结构性*发现针对K,CK,C;*范围相关*发现针对P,SP,S。图1(https://arxiv.org/html/2605.20478#S3.F1)展示了两个仅靠引用门控无法捕捉的范围/基数发现。 ### 3.2 种子到前沿发现过程 种子到前沿发现接受一个用户问题和一个种子维基页面,然后要求提供组装结构化表格所需的补充页面。阶段审计通过记录的前沿纪律来限定搜索范围:SS中的每个页面都记录了将其纳入的操作符(种子表格、兄弟列表、重定向、实体页面、可选的维基数据计数或排名检查;模板见附录B(https://arxiv.org/html/2605.20478#A2))。审计将缺失必需操作符、无法解释的页面以及不匹配的源角色视为范围失败。完整伪代码见附录A(https://arxiv.org/html/2605.20478#A1)。该过程是一个源发现策略,而非新的检索方法;现有的规划器可以尝试相同的任务,而我们的实验隔离了治理层的价值。 ## 4 锚定实验:种子到前沿发现 **策源评估集**。我们策源了51个种子到前沿发现实例,覆盖15个顶级领域(地理、文化、科学、政治、体育、商业、技术等)。其中35个实例是独立编写的问答;16个是通过对多页面父本进行筛选、前K个或年份范围修改而产生的程序化衍生实例(附录D(https://arxiv.org/html/2605.20478#A4))。每个实例包括一个维基种子页面、标注的补充页面(45/51个实例,平均每实例10.1个,范围1–35),以及一个主键真值表。 **配置**。在相同的模型上评估四种条件: - **仅记忆**:一次性提示生成参数化记忆中的行,不产生源前沿。 - **种子外链**:确定性维基API枚举种子的所有外链;无LLM,无行。 - **普通LLM策展人**:单个LLM提示要求提供补充页面和行,无源引用门控,无审计(代表未受防护的LLM检索规划器)。 - **阶段审计治理**:包含维基发现提示和源引用要求的策展人提示,随后是要求根据12项检查分类体系追加发现的审计人提示。 **设置**。我们使用gpt-5.4在T=0下运行实验。111标识符gpt-5.4和Llama 3.3 70B是API发布标签,直接引用自API响应。我们手动为每个实例标注种子维基URL,作为候选URL中最自然的起始页面。两个协议步骤被消融:人类验收(图1(https://arxiv.org/html/2605.20478#S3.F1),灰色虚线)以及任何修复-重新暂存迭代。我们只运行单次策展人-审计人过程,以匹配普通和仅记忆基线所获得的单次预算(循环消融见附录J(https://arxiv.org/html/2605.20478#A10))。按照类似WikiTabGen的评分方式(附录E(https://arxiv.org/html/2605.20478#A5)),我们在两个轴上报告召回率、精确率和F1分数:预测的维基页面与标注的补充页面集之间的比较,以及发出的行与标注的主键之间的比较。 表1:在包含51个实例的种子到前沿发现评估集上,使用gpt-5.4在T=0下的阶段审计结果。前沿指标(主轴)基于45个带有补充页面标签的实例;PK指标(副轴,见正文)基于全部51个实例。闭环评分:当审计人未返回任何接受的行或页面时(对于行为8/51,对于页面为4/51),阶段审计针对该实例输出0,而非传递策展人的输出。 **前沿比较**。在带有补充标签的45个实例上,阶段审计将源前沿精确率从0.356提升至0.505(普通LLM策展人),F1分数从0.334提升至0.451,补充页面召回率从0.384提升至0.491。我们通过有放回重采样45个每实例的阶段审计−普通差值(5000次抽取),并取所得均值的中间95%范围来计算配对自举95%置信区间:精确率区间为[+0.05,+0.25](双侧符号检验p=0.006),F1区间为[+0.03,+0.22](p=0.029),召回率区间为[+0.02,+0.21]。精确率和F1的区间完全位于零以上,表明提升对实例重采样是稳健的。种子外链与普通之间的差距(精确率0.020 vs. 0.356)表明,LLM基础发现贡献了相对于确定性外链枚举的大部分精确率提升;阶段审计则进一步增加了源引用门控和审计步骤,将精确率再提升绝对值+0.149(相对+42%),同时产生每行定位符输出,而后者是未受防护的策展人所不具备的。 **PK行(副轴)**。由于设计使然,阶段审计仅发出有源依据的行,因此那些发出所有记忆行的未受防护基线在PK重叠度上按设计排名更高(仅记忆0.619 > 普通0.588 > 阶段审计0.534);主轴是前沿质量及每行源可追溯性,而仅记忆的表格无法满足需要源依据的用户。 **策略优势所在**。阶段审计相对于普通策展人的前沿F1提升在小型前沿实例(1–3个补充页面,+0.25,n=17)上最大;在较大前沿(4–9页)上提升减小。
相似文章
相同问题,不同来源,不同答案:医疗多源RAG系统中的来源依赖性审计
本文提出了一个用于审计医疗多源RAG系统中来源依赖性的框架,发布了TransplantQA基准、HERO-QA检索策略以及一个结构化输出裁判,用于衡量跨来源答案关系。研究表明,更好的检索揭示出比先前估计更多的分歧,并主张将NLP评估从答案正确性转向跨来源关系分析。
Causal-Audit:通过目标感知因果链构建实现显式可审计的图推理
提出了Causal-Audit框架,该框架通过目标感知因果图构建和路径级证据聚合,实现大语言模型中显式且可审计的因果推理,在多个基准测试上优于现有方法。
基准审计中的可靠性差距:分布偏移与规模作为污染检测的失效模式
本文识别出分布偏移和规模约束是LLM基准审计中统计污染检测方法的关键失效模式。对27个模型评估三种范式的结果显示,在335次评估中仅有199次正确结果,表明存在系统性可靠性差距,使得这些方法无法替代透明数据溯源。
I-SAFE:用于科学AI模型结构审计的Wasserstein一致性度量
本文介绍了I-SAFE,一个基于Wasserstein一致性度量的科学AI模型事后分布审计框架,它揭示了基于准确率的评估无法捕获的模型输出中的结构差异。在药物-靶点相互作用预测任务上进行了演示,该框架是模型无关的,适用于任何具有结构化输入和外部先验知识的领域。
AuditWeave:为AI辅助和数据转换工作流打造的防篡改、审计可追溯的证据层
AuditWeave是一个轻量级Python库,它可将工作流步骤记录到一个防篡改的哈希链账本中,用于审计AI辅助和数据转换工作流,从而实现可追溯性和完整性验证。