Tokengeist: 智能体对话中的多轮归因追踪
摘要
介绍了Tokengeist,一种在智能体对话中跨多轮追踪归因的方法,揭示了平面归因方法的失败以及递归依赖图的必要性,在包含3,845个目标片段的基准测试(MTCABench)上达到了90%的源召回率。
arXiv:2607.22610v1 Announce Type: new
摘要:当语言模型在多轮对话中生成回复时,哪些来自之前轮次的词元塑造了该答案,这些依赖关系又是如何跨轮次传播的?现有的上下文归因方法通过单次处理完整上下文,恢复了表面依赖关系,但忽略了真实对话和多步推理任务中的分层、非线性结构。我们引入了多轮上下文归因(MTCA):给定模型回复中的一个目标片段,任务是跨轮次回溯归因,不仅识别哪些之前的轮次直接相关,还要识别这些轮次本身如何依赖于更早的上下文。我们提出了Tokengeist,一种与归因方法无关且可扩展的框架,通过将归因视为对话轮次上有向无环图(DAG)的递归遍历来恢复完整的依赖路径。我们将发布MTCABench,一个包含665个多轮对话中3,845个目标片段的基准测试,标注了深度达14的黄金来源图,涵盖四种依赖类型。在四个开放权重模型上,平面归因方法无法恢复多跳依赖,源召回率低于20%,而Tokengeist达到了90%。我们的结果揭示了单次归因的系统性失败模式——我们称之为来源坍缩(provenance collapse)——并激励了跨轮次递归推理的归因方法。
查看缓存全文
缓存时间: 2026/07/28 06:26
# Tokengeist:智能体对话中的多轮归因追踪
来源:https://arxiv.org/html/2607.22610
Jessica Tang¹,Shraddha Barke²,Sharad Agarwal²,
¹多伦多大学,²微软研究院,
通讯邮箱:jessicatang2019@gmail\.com,sbarke@microsoft\.com,sagarwal@microsoft\.com
###### 摘要
当语言模型在多轮对话中生成回复时,哪些来自先前轮次的标记影响了该答案——这些依赖关系又是如何跨轮次传播的?现有的上下文归因方法一次性处理完整上下文,恢复表面级别的依赖关系,但忽略了现实对话和多步推理任务中分层、非线性的结构。我们引入了**多轮上下文归因(MTCA)**:给定模型回复中的一个目标跨度,任务是在跨轮次中向后追溯归因,不仅识别哪些先前轮次直接相关,还要识别这些轮次本身如何依赖于更早的上下文。我们提出了**Tokengeist**,一个归因方法无关且可扩展的框架,通过将归因视为对话轮次上有向无环图(DAG)的递归遍历,恢复完整的依赖路径。我们将发布**MTCABench**,一个包含665个多轮对话中3845个目标跨度的基准测试,这些跨度带有深度达14的黄金来源图,涵盖四种依赖类型。在四个开源权重模型上,扁平归因方法无法恢复多跳依赖关系,源召回率低于20%,而Tokengeist达到90%。我们的结果揭示了单次归因的系统性失败模式——我们称之为**来源崩塌**——并推动了在跨轮次中递归推理的归因方法的发展。
Tokengeist:智能体对话中的多轮归因追踪
Jessica Tang¹††⁰¹⁰²Work done during internship at Microsoft Research\.,Shraddha Barke²,Sharad Agarwal²,
¹多伦多大学,²微软研究院,
通讯邮箱:jessicatang2019@gmail\.com,sbarke@microsoft\.com,sagarwal@microsoft\.com
## 1 引言
大语言模型(LLMs)越来越多地被部署在单个查询并非孤立事件而是较长交互序列中的一步的场景中。多轮对话、工具调用智能体和检索增强管道都会产生这样的上下文:模型的最终答案可能依赖于几个轮次之前引入的信息——并且这些信息可能已经通过中间助手轮次的总结、重新格式化或转换。这为可解释性和可信度提出了一个基本问题:*给定模型回复中的特定主张,哪条先前上下文的链条解释了其来源?*
这个问题在智能体对话中尤其重要,因为工具会自动为用户调用,有时是在高价值场景中,如金融、购物和企业工作流。识别回复的来源可以帮助调试这些工作流,使工程师或智能体循环能够进行纠正。
先前的工作研究了单轮设置中的上下文归因。方法包括基于注意力的启发式方法(Cohen-Wang 等,2025 (https://arxiv.org/html/2607.22610#bib.bib6))、基于梯度的方法(Yin and Neubig, 2022 (https://arxiv.org/html/2607.22610#bib.bib27))、学习到的代理模型(Wang 等,2025a (https://arxiv.org/html/2607.22610#bib.bib23);Cohen-Wang 等,2024 (https://arxiv.org/html/2607.22610#bib.bib7)),以及提示模型解释自身推理的方法(Tahaei 等,2024 (https://arxiv.org/html/2607.22610#bib.bib21);Laban 等,2024 (https://arxiv.org/html/2607.22610#bib.bib12))。然而,这些方法通常将可用上下文视为一个**扁平**序列:提示或检索到的上下文,后接回复。当应用于多轮对话时,它们可以为早期标记或跨度分配重要性分数,但并未明确恢复对话的**分层**结构,其中助手轮次本身可能是一个衍生产物,浓缩、过滤或转换了更早的上下文。我们认为这一差距至关重要。
Liu 等 (2024 (https://arxiv.org/html/2607.22610#bib.bib16)) 和 Laban 等 (2026 (https://arxiv.org/html/2607.22610#bib.bib13)) 表明 LLMs 不会均匀地关注长上下文中的信息。我们假设多轮设置中的归因具有**非线性、多跳结构**:对第 NN 轮的答案可能依赖于第 N−2N\{\-\}2 轮中的一个主张,而该主张又依赖于第 11 轮中工具的输出。一个查看整个上下文窗口的扁平归因方法无法恢复这种结构;它只能识别哪些轮次**看起来**与最终答案相关,而不能识别相关性是如何通过对话**传播**到最终答案的。
#### 动机示例。
图 1 (https://arxiv.org/html/2607.22610#S1.F1) 在 TauBench 的一个航空公司对话中说明了这一挑战。智能体的主张“你的旅行保险将提供全额退款”(T28)通过一个中间资格判定(T24)追溯回去,该判定结合了两个早期来源:用户陈述的健康原因(T23)和工具结果中的保险字段(T9),后者是通过由用户 ID 八轮前(T3)发起的查找链获取的。对 T28 应用扁平归因时,其最高分数分配给了 T27——取消工具结果,它确认了预订已被取消,但并未提及保险资格——并且遗漏了来源 T23 和 T3。
参见图注
图 1:递归来源追踪示例。右侧箭头(紫色)显示 Tokengeist 的递归追踪,在用户撰写的轮次(T23, T3)处停止。左侧箭头(灰色)显示扁平归因追踪。
#### 多轮上下文归因(MTCA)。
我们将此问题形式化为 MTCA。给定最终模型回复中的一个目标跨度,目标是恢复其完整来源:它依赖于哪些先前轮次或上下文,以及这些信息通过什么中间步骤链到达回复?与单轮归因不同,MTCA 必须考虑对话的分层结构。
#### Tokengeist。
我们提出了 Tokengeist,一个用于 MTCA 的框架,它将来源表示为对话轮次上的 DAG,并且与所选的基础归因方法无关。从目标跨度开始,Tokengeist 应用单轮归因方法识别最相关的先前轮次,然后对每个候选中间轮次递归重复此步骤,直到达到原始用户输入或系统提示。
#### MTCABench。
为了评估 MTCA,我们引入了 MTCABench,一个包含 665 个多轮对话中 3845 个注释目标跨度的基准测试(688 个来自 ConFETTI(Alkhouli 等,2025 (https://arxiv.org/html/2607.22610#bib.bib3)),3157 个来自 TauBench(Yao 等,2025 (https://arxiv.org/html/2607.22610#bib.bib26))),带有黄金来源图。对话包括工具调用痕迹和测试已知 LLM 失败模式的案例,包括幻觉和来自无关轮次的干扰。注释遵循附录 C (https://arxiv.org/html/2607.22610#A3) 中描述的结构化协议。
#### 贡献。
1. 1.我们引入了**多轮上下文归因(MTCA)**,一个新任务,旨在恢复模型回复的完整跨轮次来源,而不仅仅是单次标记归因。
2. 2.我们提出了**Tokengeist**,一个将 MTCA 形式化为通过递归归因构建 DAG 并提供对结果图灵活路径提取的框架。
3. 3.我们将发布**MTCABench**,一个包含 665 个多轮对话中 3845 个注释目标跨度且带有黄金来源图的基准测试,用于在现实对话中评估归因方法。
4. 4.我们展示了实证结果,揭示了扁平归因方法的系统性失败,并评估了 Tokengeist 下的基础归因方法。
## 2 相关工作
#### 单轮上下文归因。
越来越多的工作识别输入的哪些部分影响模型的生成输出。早期的标记或特征级方法包括对比解释,它识别解释模型为何偏好一个预测而非另一个的输入标记(Yin and Neubig, 2022 (https://arxiv.org/html/2607.22610#bib.bib27)),以及基于扰动的方法,如 LIME(Ribeiro 等,2016 (https://arxiv.org/html/2607.22610#bib.bib19))和 SHAP(Lundberg and Lee, 2017 (https://arxiv.org/html/2607.22610#bib.bib17)),它们通过输入扰动或特征联盟估计特征重要性。最近的工作针对基于内容的生成,将生成的语句与提供的上下文中的证据联系起来。ContextCite(Cohen-Wang 等,2024 (https://arxiv.org/html/2607.22610#bib.bib7))学习一个代理模型,预测当包含或排除上下文源时生成如何变化,而 AT2(Cohen-Wang 等,2025 (https://arxiv.org/html/2607.22610#bib.bib6))通过结合在消融派生监督下的注意力头信号来避免昂贵的消融。长上下文回溯方法,如 TracLLM(Wang 等,2025b (https://arxiv.org/html/2607.22610#bib.bib24))和 AttnTrace(Wang 等,2025a (https://arxiv.org/html/2607.22610#bib.bib23)),通过信息搜索、贡献分数去噪或基于注意力的回溯识别长输入中的句子、段落或章节。几个基准测试评估证据基础:Li 等 (2024b (https://arxiv.org/html/2607.22610#bib.bib15)) 表明自动归因评估仍然困难;Li 等 (2024a (https://arxiv.org/html/2607.22610#bib.bib14)) 针对结构化来源的知识感知生成;Hirsch 等 (2025 (https://arxiv.org/html/2607.22610#bib.bib10)) 将用户选择的生成跨度定位到源跨度。相关工作评估属性生成和引用质量(Gao 等,2023 (https://arxiv.org/html/2607.22610#bib.bib9);Yu 等,2026 (https://arxiv.org/html/2607.22610#bib.bib28))。这些工作通常将上下文视为扁平输入,并为单次生成返回相关的标记、跨度、段落、文档或引用。相比之下,MTCA 要求多轮对话的递归来源结构:不仅哪个事件影响目标跨度,而且哪个**更早的**事件影响了该事件本身。
#### 多轮和长上下文理解。
Liu 等 (2024 (https://arxiv.org/html/2607.22610#bib.bib16)) 和 Laban 等 (2026 (https://arxiv.org/html/2607.22610#bib.bib13)) 记录了 LLMs 不会统一使用分布在长上下文中的信息。Bai 等 (2024 (https://arxiv.org/html/2607.22610#bib.bib4)) 和 Kwan 等 (2024 (https://arxiv.org/html/2607.22610#bib.bib11)) 评估多轮对话能力,最近的工具使用基准(Alkhouli 等,2025 (https://arxiv.org/html/2607.22610#bib.bib3);Yao 等,2025 (https://arxiv.org/html/2607.22610#bib.bib26);Patil 等,2025 (https://arxiv.org/html/2607.22610#bib.bib18))将评估更接近动作依赖于先前轮次、工具调用和工具结果的现实交互历史。然而,它们主要评分任务成功、回复质量或工具调用正确性,并未提出一个方法是否可以通过恢复多跳来源图来解释生成跨度。
#### 图结构来源。
我们的公式将来源表示为 DAG,其边从后一个事件指向它所依赖的前一个事件,将 MTCA 与工作流来源和程序依赖分析联系起来,后者捕捉实体如何从先前实体和活动中派生(Acar 等,2010 (https://arxiv.org/html/2607.22610#bib.bib1))或使程序执行中的数据和控制依赖关系显式化(Ferrante 等,1987 (https://arxiv.org/html/2607.22610#bib.bib8))。最近的 NLP 工作已经开始研究结构化工件上的归因;例如,Suri 等 (2025 (https://arxiv.org/html/2607.22610#bib.bib20)) 通过基于图的推理将模型回复基于流程图组件中。MTCA 的不同之处在于,图并非作为输入工件提供给模型,而是必须从中间节点可能由模型生成的对话痕迹中重构。这使得递归追踪成为核心,因为方法可能识别附近的助手总结,却错过了其派生的原始来源——这是我们形式化为**来源崩塌**的失败模式。
## 3 问题形式化
#### 符号。
对话 C\mathcal{C} 是轮次 T1,T2,...,TNT_{1},T_{2},\ldots,T_{N} 的序列,其中每个轮次由一个角色 ri∈{System,User,Assistant,Tool}r_{i}\in\{\textsc{System},\textsc{User},\textsc{Assistant},\textsc{Tool}\} 和内容 cic_{i}(一个标记序列)组成。我们称 ri∈{System,User}r_{i}\in\{\textsc{System},\textsc{User}\} 的轮次为**外生轮次**,因为其内容由外部提供。ri=Assistantr_{i}=\textsc{Assistant} 的轮次为**内生轮次**,由模型生成。ri=Toolr_{i}=\textsc{Tool} 的轮次为**工具结果轮次**:其内容由外部工具执行器产生,而非模型,因此它们不携带模型生成的注意力权重,在归因时单独处理(第 4 节 (https://arxiv.org/html/2607.22610#S4))。TTT_{T} 表示**目标轮次**:C\mathcal{C} 中我们旨在解释其内容的任何助手轮次。**目标跨度**是 TTT_{T} 内容中一个连续的子序列 ȳ=(ya,...,yb)\bar{y}=(y_{a},\ldots,y_{b}),其中 1≤a≤b≤|cT|1\leq a\leq b\leq|c_{T}|。
### 3.1 单轮归因
归因在三个粒度上运行,各有不同作用。**标记级别**是计算归因的地方。令 A\mathcal{A} 表示一个**基础归因方法**:给定目标跨度 ȳ\bar{y}(输出标记的一个连续片段)和上下文 XX(前面的标记序列),A\mathcal{A} 对每个源标记 xj∈Xx_{j}\in X 产生一个分数,量化 xjx_{j} 对 ȳ\bar{y} 的影响程度。具体实例在第 4.4 节 (https://arxiv.org/html/2607.22610#S4.SS4) 中描述。**句子级别**是打分单位。我们不是每个标记报告一个分数,而是将 XX 分割成句子 seg(X)=(s1,...,sM)\mathrm{seg}(X)=(s_{1},\ldots,s_{M});每个句子在其标记索引范围内作为原子单位打分,产生一个句子级分数向量 a=A(ȳ,s1,...,sM)∈R≥0M。\mathbf{a}=\mathcal{A}(\bar{y},\,s_{1},\ldots,s_{M})\in\mathbb{R}_{\geq 0}^{M}.\(1\) 对句子范围而不是单个标记打分,可以减少来自标点或常见标记上注意力尖峰带来的噪声。**轮次级**是来源单位。当 XX 连接多个轮次时,每个 sis_{i} 恰好属于一个轮次(通过字符偏移追踪)。轮次聚合将句子分数减少为每个轮次一个分数: a^k=maxi:si∈Tkai,\hat{a}_{k}=\max_{\,i\,:\,s_{i}\in T_{k}}a_{i},\(2\) 为每个前面的 TkT_{k} 产生 a^k≥0\hat{a}_{k}\geq 0,反映该轮次内最强的句子级信号。在**扁平归因**中,A\mathcal{A} 应用一次,XX 等于目标前面的所有轮次,然后轮次聚合(公式 2 (https://arxiv.org/html/2607.22610#S3.E2))得出每个轮次一个分数。这是我们比较的扁平归因基线。
### 3.2 多轮上下文归因(MTCA)
给定 C\mathcal{C}、ȳ\bar{y} 和 A\mathcal{A},MTCA 的目标是恢复一个**来源图** G=(V,E,w)G=(V,E,w):一个在对话轮次上的加权有向无环图,其中 TTT_{T} 是唯一的根,每条边 (Ti,Tj)∈E(T_{i},T_{j})\in E 表示 TiT_{i} 依赖于 TjT_{j},且 idx(j)<idx(i)\mathrm{idx}(j)<\mathrm{idx}(i)。边权重 w(Ti,Tj)w(T_{i},T_{j}) 量化依赖强度(例如基于注意力分数)。一个节点可以有多个入边,允许多父节点(DAG)恢复,其中多个源跨度共同支持一个单一跨越轮次的跨度。相似文章
智能体图令牌推理
提出了一种智能体图令牌推理方法,将图令牌化重新构建为LLM逐步推理过程的一部分,使模型能够在推理过程中动态选择图视图和粒度。该方法在七个图领域上优于基线,并能零样本迁移到未见领域。
“我没有做出微观决策”:在协作中衡量、引导和揭示目标层面的人工智能贡献
引入CoTrace,一个用于人机协作中目标层面归因的框架,该框架分析大语言模型如何通过对话回合中的具体需求和间接影响来塑造目标。
令牌统计揭示多轮大语言模型交互中的对话漂移
本文提出双可预测性(P)和信息数字孪生(IDT),一种使用令牌频率统计来监控多轮LLM交互中对话一致性的轻量级方法,无需使用嵌入或模型内部信息。该方法在检测矛盾和话题转换时达到100%的敏感度,同时为扩展LLM部署建立了实用的监控框架。
TPA: 用于检测RAG中幻觉的下一个令牌概率归因
TPA提出了一种新颖的方法,通过将下一个令牌概率归因于七个不同的源头(查询、RAG上下文、过去令牌、自身令牌、FFN、最终LayerNorm、初始嵌入),并按词性标签聚合,来检测RAG系统中的幻觉。该方法在包括Llama2、Llama3、Mistral和Qwen在内的五个大语言模型上实现了最先进的性能。
基于归因引导转向的LLM谄媚行为词元级诊断
本文提出了一种基于积分梯度的词元归因方法,用于在词元级别诊断LLM中的谄媚行为,并提出了归因引导的对比激活转向方法,在不重新训练的情况下减少推理过程中的谄媚行为。