推理流如何运作?追踪注意力诱导信息流以在LLM中进行定向强化学习

Hugging Face Daily Papers 论文

摘要

FlowTracer是一个强化学习框架,它利用注意力诱导图来追踪推理流并分配词元级别的信用,从而提升推理任务的性能。

词元级别的信用分配仍然是大型语言模型(LLM)中强化学习(RL)的一个关键障碍,RL方法通常平等对待所有词元,无法区分关键推理步骤与常规格式或流畅填充。最近的研究利用模型内部信号进行更细粒度的信用分配,但这些往往是点式启发方法,忽略了信息传播的整体结构。我们提出FlowTracer,这是一个强化学习框架,它在注意力诱导的有向无环图上追踪针对答案的推理流,其中节点对应词元,边容量来自聚合的注意力权重,并从这一全局结构中推导出词元信用。边容量被重新加权,仅保留能够到达答案区域的影响,同时强制局部流量守恒,使中间词元不会因路径长度或不相关分支而损失或增加有效质量。在此图上,FlowTracer提取连接问题与答案的信息流主干,并通过流量吞吐量对词元进行评分,揭示出介导长距离依赖的高影响枢纽和聚合检查点。这些推导出的重要性用于塑造词元级奖励,使学习信号能够精确聚焦于将信息导向(或偏离)正确答案的词元,并在多种推理任务中带来一致的性能提升。
查看原文
查看缓存全文

缓存时间: 2026/06/10 05:45

论文页面 - 推理如何流动?追踪注意力诱导的信息流以实现LLM中的定向强化学习

来源:https://huggingface.co/papers/2606.10646 作者:

,

,

,

,

,

,

,

,

,

,

摘要

FlowTracer 是一个强化学习框架,利用注意力诱导图来追踪推理流程,并基于全局信息传播结构为 token 分配信用。

Token 级别的信用分配 (https://huggingface.co/papers?q=Token-level%20credit%20assignment) 仍是大型语言模型 (https://huggingface.co/papers?q=reinforcement%20learning) 中强化学习 (https://huggingface.co/papers?q=large%20language%20models) 的主要障碍。RL 方法通常将所有 token 一视同仁,无法区分关键推理步骤与常规格式或流畅的填充词。最近的尝试利用模型内部信号进行更细粒度的信用分配,但这些方法通常是点状启发式,忽略了信息传播的全局结构。我们提出 FlowTracer,一个 RL 框架,在注意力诱导的有向无环图 (https://huggingface.co/papers?q=attention-induced%20directed%20acyclic%20graph) 上追踪针对答案的推理流。其中节点对应 token,边容量 (https://huggingface.co/papers?q=edge%20capacities) 来自聚合的注意力权重,并从此全局结构中推导出 token 的信用。边容量被重新加权,仅保留能够到达答案区域的影响力,同时强制执行局部流量守恒 (https://huggingface.co/papers?q=flow%20conservation),使得中间 token 不会因路径长度或无关分支而丢失或获得有效质量。在此图上,FlowTracer 提取连接问题与答案的信息流骨干 (https://huggingface.co/papers?q=information-flow%20backbone),并通过流量吞吐量对 token 进行评分,揭示出调节长距离依赖关系的高影响力枢纽和聚合检查点。这些推导出的重要性被用于塑造 token 级别的奖励 (https://huggingface.co/papers?q=token-level%20rewards),使得学习信号能够精准聚焦于将信息导向(或偏离)正确答案的 token,并在多种推理任务上带来持续的收益。

查看 arXiv 页面 (https://arxiv.org/abs/2606.10646)查看 PDF (https://arxiv.org/pdf/2606.10646)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.10646)

在你的智能体中获取此论文:

hf papers read 2606\.10646

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2606.10646 即可从此页面关联。

引用此论文的数据集 0

无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.10646 即可从此页面关联。

引用此论文的 Spaces 0

无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2606.10646 即可从此页面关联。

包含此论文的收藏集 0

无收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从此页面关联。

相似文章

ReasoningFlow: 用于理解LLM推理轨迹的篇章结构

arXiv cs.CL

介绍 ReasoningFlow,一个将大语言模型推理轨迹的篇章结构捕获为有向无环图的框架,从而能够细粒度分析推理行为(如自我反思和回溯)。基于对数千条轨迹的手动和自动标注,揭示了模型之间的结构相似性,并且大多数错误步骤并不贡献于最终答案。

AtManRL: 通过可微分注意力显著性实现忠实推理

arXiv cs.CL

AtManRL 是一种通过可微分注意力操作和强化学习来训练大语言模型的方法,旨在确保推理令牌因果地影响最终预测,从而生成更忠实的思维链推理。在 GSM8K 和 MMLU 上使用 Llama-3.2-3B 进行的实验表明,该方法能够识别具有影响力的推理令牌并提高推理透明度。