TurnSight:工具集成推理中的回合级事后自蒸馏

Hugging Face Daily Papers 论文

摘要

TurnSight 提出了一种面向工具集成推理的回合级事后自蒸馏框架,通过基于执行条件的事后视角和自适应强化学习优势调制来提供密集监督。

工具集成推理(TIR)使大语言模型(LLMs)能够通过迭代工具交互解决复杂任务。然而,现有的强化学习方法通常依赖轨迹级监督,限制了长视界 TIR 场景中的细粒度信用分配。同策略自蒸馏通过具有特权上下文的教师分支提供更密集的信号,但现有方法通常从真实答案或检索到的技能中获取此类上下文,这可能无法反映智能体实际访问的状态。此外,token级监督无法捕捉工具交互的回合级结构。为了解决这一问题,我们提出了 TurnSight,这是一种回合级事后自蒸馏框架,直接从执行条件事后中获取监督信号。该框架随后构建具有不同前瞻范围的多个事后视角,并通过跨视野方向一致性选择可靠的监督信号。最后,所选的事后信号在兄弟轨迹之间进行归一化,并在保持其原始优化方向的同时用于自适应调节 RL 优势。在三个基准上的大量实验证明了 TurnSight 的有效性。我们的代码可在 https://github.com/quchangle1/TurnSight 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:43

论文页面 - TurnSight:用于工具集成推理的回合级事后自我蒸馏

来源:https://huggingface.co/papers/2608.04007

摘要

工具集成推理(TIR)使大型语言模型(LLM)能够通过迭代式工具交互解决复杂任务。然而,现有的强化学习方法通常依赖轨迹级监督,这限制了在长视野 TIR 场景中的细粒度信用分配。在线策略自蒸馏通过具有特权上下文的教师分支提供更密集的信号,但现有方法通常从地面真值答案或检索到的技能中提取此类上下文,这可能无法反映智能体实际访问的状态。此外,令牌级监督无法捕捉工具交互的回合级结构。为解决这一问题,我们提出了 TurnSight,一个回合级事后自我蒸馏框架,它直接从基于执行条件的事后视角中导出监督信号。然后,它构建多个具有不同前瞻视野的事后视角,并通过跨视野方向一致性选择可靠的监督信号。最后,所选的事后信号在同源轨迹中进行归一化,并用于自适应地调节强化学习优势,同时保持其原始的优化方向。在三个基准上的大量实验证明了 TurnSight 的有效性。我们的代码可在 https://github.com/quchangle1/TurnSight 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.04007) 查看 PDF (https://arxiv.org/pdf/2608.04007) 项目页面 (https://huggingface.co/collections/ChangleQu/turnsight) GitHub0 (https://github.com/quchangle1/TurnSight) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04007)

在您的智能体中获取这篇论文:

hf papers read 2608\.04007

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.04007 即可从本页链接到该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.04007 即可从本页链接到该数据集。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.04007 即可从本页链接到该 Space。

包含此论文的集合 1

相似文章

H^2SD:混合事后自我蒸馏

Hugging Face Daily Papers

提出H^2SD,一种混合事后自我蒸馏框架,通过对成功和失败轨迹采用不同的教师模型使用方式,改善了RLVR,实现了更优的推理性能。

HINT-SD: 面向长程智能体的目标性事后自我蒸馏

Hugging Face Daily Papers

HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。