GraphEcho:LLM 图代理中的结构冗余与证据溯源
摘要
GraphEcho 是一个基准测试,用于评估 LLM 图代理区分结构冗余与独立证据溯源的能力,揭示高效探索与有效证据使用之间的差距。
arXiv:2609.17695v1 公告类型:新
摘要:一个大型语言模型(LLM)代理可以在不获取更多独立证据的情况下遵循更多图路径。GraphEcho 测试代理是否将这些重复遭遇误认为是额外的佐证。该基准测试在保持证据内容固定的情况下,改变路径数量和证据来源,并评估判断和主动探索。受控合成实验揭示了模型依赖的判断变化,但冗余支持路径增加了所有评估冻结代理中重复行走的比例。溯源感知后训练(PAPT)减少了重复访问并提高了合成准确性,但覆盖的独立来源较少。在科学主张上,它继续减少重复,同时准确性下降。这些发现揭示了高效探索与有效证据使用之间的差距:代理可以学会停止重复,同时忽略所需信息。GraphEcho 提供了一种受控方式来评估图代理的结论以及其探索是否到达独立证据来源。
查看缓存全文
缓存时间: 2026/09/17 09:22
# 大语言模型图代理中的结构冗余与证据溯源 来源:https://arxiv.org/html/2609.17695 Sikun Wang††注明:同等贡献 Yixi Zhou††注明:同等贡献 隶属机构:香港浸会大学 邮箱:[[email protected]](mailto:[email protected]) Lei Fan 隶属机构:密歇根大学 邮箱:[[email protected]](mailto:[email protected]) Fan Zhang††注明:通讯作者 隶属机构:东京大学 邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 大型语言模型 \(LLM\) 代理可以在没有获取更多独立证据的情况下遵循更多的图路径。GraphEcho 测试代理是否会将这些重复遭遇误认为是额外的佐证。该基准在保持证据内容固定的同时,改变路径数量和证据来源,并评估判断力和主动探索能力。受控的合成实验揭示了模型相关的判断偏移,但冗余的支撑路径在所有评估的冻结代理中都增加了重复行走的比例。溯源感知的后训练 (PAPT) 减少了重复访问并提高了合成准确性,但覆盖了更少的独特来源。对于科学主张,它在准确性下降的同时持续减少重复。这些发现揭示了高效探索与有效证据使用之间的鸿沟:一个代理可以学会停止重复自身,同时忽略其所需的信息。GraphEcho 提供了一种受控的方式来评估图代理的结论以及其探索是否能达到不同的证据来源。 ## 1 一次观察可以产生多条路径 一个图代理可以通过一个结果节点、一个结论节点和一个表格条目来遇到一次实验观察。这些路径共享一个证据来源。将它们视为独立的佐证会改变代理的评估,而不会增加证据。重复检索也可能消耗其探索预算。 检索增强推理将证据选择与中间决策联系起来(Trivedi 等人, 2023; Asai 等人, 2024),而图检索则链接跨段落的信息(Gutiérrez 等人, 2024)。最近的研究考察了重复检索上下文(Ross 等人, 2026)、学习的图探索(Liu 等人, 2026)以及溯源感知的证据选择(Deng 等人, 2026)。这些方向推动了对结构化表示如何影响判断力和证据获取的受控测试。 GraphEcho 衡量代理是否能区分结构多样性和溯源多样性。我们的核心比较保持主张和五个路径模板固定,同时改变路径是来自一项研究还是五项独立研究。第二个比较将一条路径扩展为来自同一研究的五条路径。这些干预措施共同将表征敏感性与证据来源敏感性区分开来(图1)。 图 1:路径数量和来源数量定义了不同的干预措施。每条路线将一条三跳路径收缩到同一个主张;五条路线的比较保留了表征类型和证据措辞。 此比较需要控制证据内容、来源强度和图呈现方式。不同的路径长度可能改变推理难度,而不同的证据陈述可能增加信息。因此,我们在合成的来源数量干预中匹配路径长度和证据措辞。 我们的贡献确立了三个发现: - • 受控判断力。GraphEcho-Syn 在 800 个虚构主张中将冗余路径与不同来源分开;静态响应在不同模型间显示出不同的方向。 - • 主动获取。冗余的支撑路径在所有四个冻结代理中提高了回声行走率,而准确率则呈现双向变化。 - • 训练权衡。溯源感知后训练 (PAPT) 相比冻结的 Qwen3-4B 将合成代理的准确率提高了 41.5 个百分点,但降低了来源召回率和 SciFact 准确率。低成本的控制和奖励消融实验区分了重复减少与证据使用改善。 ## 2 相关工作 #### 证据冲突与冗余。 冲突的段落可以在不相应降低模型置信度的情况下改变答案(Chen 等人, 2022)。Tan 等人 (2024) 发现模型在知识冲突下倾向于生成上下文而非检索到的上下文,而 Yoran 等人 (2024) 通过训练提高了对不相关段落的容忍度。先前的工作研究了上下文位置(Liu 等人, 2024)和检索冗余(Ross 等人, 2026)。GraphEcho 隔离了不同的失真来源:多条图路径可能重复一个证据来源。匹配证据措辞和路径模板将结构重复与来源数量区分开来。 #### 归因与图检索。 ALCE 分别评估答案正确性和引用质量(Gao 等人, 2023)。HippoRAG 结合知识图谱与个性化 PageRank 用于多跳检索(Gutiérrez 等人, 2024);HippoRAG 2 通过段落集成扩展了这一方法(Gutiérrez 等人, 2025)。PAGE-RAG 在选择图证据时追踪溯源(Deng 等人, 2026)。这些方法激励了对可访问的源信息是否足以防止重复佐证的测试。GraphEcho 在保持证据内容固定的同时改变溯源分配,并比较可见的源标识符与将重复证据折叠的预处理。 #### 自适应证据获取。 ReAct 交替进行推理与行动(Yao 等人, 2023),IRCoT 则在中间推理步骤间进行检索(Trivedi 等人, 2023)。Adaptive-RAG 根据问题复杂度选择检索策略(Jeong 等人, 2024),而 Self-RAG 学习何时检索以及如何评估检索到的段落和生成的答案(Asai 等人, 2024)。Call Neighbours Yourself (CNY) 通过基于目的地的在策略自我蒸馏训练图邻居选择(Liu 等人, 2026)。GraphEcho 考察在固定行动预算内,获取是否达到了不同的来源。PAPT 使用群组相对策略优化(Shao 等人, 2024),奖励包括判断力、来源计数和不同的证据获取。评估准确率与重复行走和来源召回率可以区分重复访问减少与证据覆盖范围扩大。 ## 3 将路径与证据来源区分开来 ### 3.1 溯源定义了干预措施 一个证据溯源原子 \(e\) 标识一个潜在的证据来源。对于一条图路径 \(p\),映射 \(\pi(p)=e\) 记录了该来源。给定一组路径 \(P\),结构多样性和溯源多样性分别为 \(N_{\mathrm{path}} = |P|,\) (1) \(N_{\mathrm{prov}} = |\{\pi(p): p \in P\}|.\) (2) 我们用 \(S_k P\) 表示有 \(s\) 个不同来源和 \(k\) 条路径的条件。冗余路径干预改变 \(N_{\mathrm{path}}\),同时保留证据原子及其内容。来源数量干预在固定路径数量时改变 \(N_{\mathrm{prov}}\)。 ### 3.2 合成图控制溯源 GraphEcho-Syn 包含来自生物医学、材料、农业和经济学的 800 个主张。虚构的实体名称将主张内容与熟悉的事实关联分开。每个主张有一个由五个支撑原子和五个反驳原子组成的候选池。生成器为每个原子分配一个不同的源标识符,并在图构建过程中保留源和原子标识符。 所有原子具有相同的相对可靠性权重 1.0。该权重在基准内表示相等的强度;它不使某个观察变得绝对可靠。支撑原子报告主张方向的变化,反驳原子报告相反的变化。黄金判定依据所显示条件下选择的不同来源的平衡:支撑占多数为 SUPPORT,反驳占多数为 REFUTE,平局为 MIXED。此标签根据基准惯例描述证据平衡。 每个原子最多承认通过不同表征类型的五条三跳路径。主要的来源数量比较使用相同的证据措辞和关系模板来生成 1S5P 和 5S5P。仅改变来源分配。在同一主张的不同变体中,生成器也保留主张措辞。词元计数仍是一个显式诊断指标,因为词元化可能对源标识符的处理方式不同。 数据集划分为 500 个训练、100 个开发和 200 个测试主张。每个基础主张的所有变体都保留在其划分中。实体名称在不同划分间也保持不相交。最初的 100 个主张的试点测试使用开发集主张,为后续评估保留了测试集。 表 1:冲突干预分别改变路径数量和溯源数量。 ### 3.3 冲突揭示虚假佐证 表 1 规定了五种冲突条件。C1 和 C2 包含相同的两个对立原子。C2 添加了支撑原子的四个表示,因此增加的 SUPPORT 率衡量了在冗余证据下的决策偏移。C3 提供了五个不同的支撑来源。C4 反转了溯源多数,而 C2R 检查冗余的反驳路径是否产生相应的偏移。 ### 3.4 SciFact 测试文档溯源 SciFact 将科学主张与带注释的证据摘要和理由句子配对(Wadden 等人, 2020)。我们使用其带标签的开发集划分进行评估,因为官方测试标签不可用。该转换保留了 188 个具有黄金证据的主张,并生成了 584 个图实例。十个符合条件的主张拥有多个证据文档。没有黄金证据的主张不进入此黄金理由实验。 对于每个文档,转换器保留带注释的理由集,并将它们的句子收集到一条证据记录中。冗余路线通过不同的图表示重复该记录。文档标识符在此实验中提供了可观察的源溯源。它们并不建立科学研究之间的统计独立性。PAPT 仅使用合成监督,将 SciFact 作为迁移评估。 ## 4 在预算内获取不同的证据 ### 4.1 观察图行动 代理环境公开当前节点、已访问节点、可用邻居、简短预览和剩余行走预算。行走行动揭示所选邻居的完整内容。停止行动返回最终判断。主要预算允许六次行走行动;其他运行使用三、五和八的预算。每个三跳溯源路径连接一个来源、一个表示、一个观察和一个主张。显式的共享主张边连接观察节点,允许直接移动到另一个候选观察。每个行动都遵循一条边;跟踪记录单独记录连接器移动和重复证据获取。 代理比较使用平衡溯源、冗余支撑路线和不同的支撑来源。邻居预览保留未见的证据内容及其黄金立场。在相应的缓解条件下,溯源元数据可能保持可见。一个原子的第一个承载证据的访问提供其完整的合成观察,使得在此受控设置中,对等效表示的后续访问变得冗余。 ### 4.2 比较低成本缓解措施 四种推理控制测试训练是否在元数据、指令和预处理之外增加了价值。M0 显示源节点而不显示原子标识符。M1 添加溯源标识符;M2 还指示模型在评估佐证时计算不同来源的数量。M3 在保留其多重性的同时对等效路径进行分组。 ### 4.3 训练溯源感知策略 PAPT 结合了判定奖励与来源计数和证据获取: \(R = R_{\mathrm{verdict}} + 0.4 R_{\mathrm{count}} + 0.4 R_{\mathrm{coverage}} - 0.4 R_{\mathrm{echo}} - 0.05 R_{\mathrm{cost}}.\) (3) 判定奖励在最终判断正确时为 \(+1\),否则为 \(-1\)。计数奖励衡量与黄金支撑和反驳溯源数量的匹配度。覆盖率奖励获取不同的有用来源;回声惩罚衡量重复的溯源获取。成本惩罚将行走次数除以预算。根据第 5 节中定义的计数,覆盖率等于 \(U/\max(1, \min(B, D))\),回声等于 \(E/\max(1, W)\),成本等于 \(W/B\)。设 \(\Delta\) 为已获取来源上支撑和反驳计数的绝对误差之和。对于有效的最终输出,计数奖励等于 \(\max(0, 1 - \Delta/\max(1, U))\),对于无效输出则为零。 训练协议对 Qwen3-4B 应用群组相对策略优化 (GRPO)(Shao 等人, 2024),使用四个轨迹的群组。我们使用秩为 16 和缩放参数 \(\alpha=32\) 的低秩适应 (LoRA)(Hu 等人, 2022)。每个训练主张贡献一个冲突实例,在 C1、C2、C3、C4 和 C2R 条件下共计 100 个样本。训练使用这 500 个样本进行一个周期,随机种子为 42。 所有奖励变体共享所选的训练实例和优化设置。消融实验移除回声奖励、移除覆盖率奖励,或仅保留判定奖励。检查点选择基于在开发集主张上最大化最终三个保留检查点的平均全目标奖励。在不同变体间使用相同的选择目标使其开发集分数具有可比性。测试标签和 SciFact 监督从不进入检查点选择。 ## 5 分别衡量判断力和获取能力 ### 5.1 模型与输出 冻结评估涵盖 Qwen3-1.7B、Qwen3-4B 和 Qwen3-8B。1.7B 和 8B 模型使用非思考生成。主要的开源模型设置使用贪婪解码。GPT-5-mini² 使用其原生采样设置提供了补充的 API 基线,这与温度为零的解码不同。 输出包含判定、置信度、支撑和反驳溯源计数、引用的源标识符以及简短的推理
相似文章
ExpGraph:面向LLM智能体的模型无关经验学习与图结构记忆
ExpGraph是一个模型无关的框架,通过自进化的技能与失败经验图,使LLM智能体能够复用过往经验,在不重新训练执行器的情况下将任务性能提升12%-21%。
EdgeMem: 通过保留证据的多锚点超图实现无LLM智能体记忆构建与检索
EdgeMem提出一种无LLM的方法,用于智能体记忆的构建与检索,采用多锚点超图,保留证据以提高基于记忆的问答性能。
LLM代理时代的Graph Engineering:从个体智能到系统智能
本文介绍了Graph Engineering作为一种新兴范式,用于组织多代理LLM系统,利用动态图结构协调专门化代理并管理复杂任务,从个体智能推进到系统智能。
迈向可安全审计的大模型智能体:一种统一的图表示方法
本文提出了 Agent-BOM,一种用于基于大语言模型(LLM)的智能体系统进行安全审计的统一图表示方法。它通过建模静态能力和动态运行时状态,解决了事后审计中的语义鸿沟问题,能够检测记忆投毒和工具误用等复杂的攻击链。
图工程 (GitHub 仓库)
一个精选的研究论文、基准测试和开源项目集合,专注于LLM Agents时代下的图工程,伴随一篇arXiv综述论文,旨在推进从个体智能到系统智能的研究。