推理流如何运作?追踪注意力诱导信息流以在LLM中进行定向强化学习
摘要
FlowTracer是一个强化学习框架,它利用注意力诱导图来追踪推理流并分配词元级别的信用,从而提升推理任务的性能。
查看缓存全文
缓存时间: 2026/06/10 05:45
论文页面 - 推理如何流动?追踪注意力诱导的信息流以实现LLM中的定向强化学习
来源:https://huggingface.co/papers/2606.10646 作者:
,
,
,
,
,
,
,
,
,
,
摘要
FlowTracer 是一个强化学习框架,利用注意力诱导图来追踪推理流程,并基于全局信息传播结构为 token 分配信用。
Token 级别的信用分配 (https://huggingface.co/papers?q=Token-level%20credit%20assignment) 仍是大型语言模型 (https://huggingface.co/papers?q=reinforcement%20learning) 中强化学习 (https://huggingface.co/papers?q=large%20language%20models) 的主要障碍。RL 方法通常将所有 token 一视同仁,无法区分关键推理步骤与常规格式或流畅的填充词。最近的尝试利用模型内部信号进行更细粒度的信用分配,但这些方法通常是点状启发式,忽略了信息传播的全局结构。我们提出 FlowTracer,一个 RL 框架,在注意力诱导的有向无环图 (https://huggingface.co/papers?q=attention-induced%20directed%20acyclic%20graph) 上追踪针对答案的推理流。其中节点对应 token,边容量 (https://huggingface.co/papers?q=edge%20capacities) 来自聚合的注意力权重,并从此全局结构中推导出 token 的信用。边容量被重新加权,仅保留能够到达答案区域的影响力,同时强制执行局部流量守恒 (https://huggingface.co/papers?q=flow%20conservation),使得中间 token 不会因路径长度或无关分支而丢失或获得有效质量。在此图上,FlowTracer 提取连接问题与答案的信息流骨干 (https://huggingface.co/papers?q=information-flow%20backbone),并通过流量吞吐量对 token 进行评分,揭示出调节长距离依赖关系的高影响力枢纽和聚合检查点。这些推导出的重要性被用于塑造 token 级别的奖励 (https://huggingface.co/papers?q=token-level%20rewards),使得学习信号能够精准聚焦于将信息导向(或偏离)正确答案的 token,并在多种推理任务上带来持续的收益。
查看 arXiv 页面 (https://arxiv.org/abs/2606.10646)查看 PDF (https://arxiv.org/pdf/2606.10646)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.10646)
在你的智能体中获取此论文:
hf papers read 2606\.10646
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2606.10646 即可从此页面关联。
引用此论文的数据集 0
无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.10646 即可从此页面关联。
引用此论文的 Spaces 0
无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2606.10646 即可从此页面关联。
包含此论文的收藏集 0
无收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从此页面关联。
相似文章
ReasoningFlow: 用于理解LLM推理轨迹的篇章结构
介绍 ReasoningFlow,一个将大语言模型推理轨迹的篇章结构捕获为有向无环图的框架,从而能够细粒度分析推理行为(如自我反思和回溯)。基于对数千条轨迹的手动和自动标注,揭示了模型之间的结构相似性,并且大多数错误步骤并不贡献于最终答案。
AtManRL: 通过可微分注意力显著性实现忠实推理
AtManRL 是一种通过可微分注意力操作和强化学习来训练大语言模型的方法,旨在确保推理令牌因果地影响最终预测,从而生成更忠实的思维链推理。在 GSM8K 和 MMLU 上使用 Llama-3.2-3B 进行的实验表明,该方法能够识别具有影响力的推理令牌并提高推理透明度。
FlowEdit:针对涉及冲突的不适定问题的LLM推理流的信息论控制
FlowEdit 是一个新颖的框架,利用信息论原理来调节LLMs的内部推理流,使其能够针对具有冲突条件的不适定问题在单次生成中输出多个替代回答。实验表明,与领先的专有模型相比,精确集合匹配准确率提升68%,回答信息量提升24%。
答案词元如何读取推理轨迹?思维大模型在定量推理中的自读模式
研究发现,思维大模型中的答案词元在定量推理时遵循结构化自读模式——前向漂移+聚焦关键锚点,并据此提出免训练 SRQ 引导方法,无需微调即可提升准确率。
强化学习能否教会大型语言模型进行长程推理?表达力是关键
本文介绍了 ScaleLogic 框架,该框架证明了强化学习的训练计算资源消耗遵循与大型语言模型推理深度相关的幂律分布。文章强调,逻辑表达力对于提升下游迁移能力和训练效率至关重要。