TurnSight:工具集成推理中的回合级事后自蒸馏
摘要
TurnSight 提出了一种面向工具集成推理的回合级事后自蒸馏框架,通过基于执行条件的事后视角和自适应强化学习优势调制来提供密集监督。
查看缓存全文
缓存时间: 2026/08/05 05:43
论文页面 - TurnSight:用于工具集成推理的回合级事后自我蒸馏
来源:https://huggingface.co/papers/2608.04007
摘要
工具集成推理(TIR)使大型语言模型(LLM)能够通过迭代式工具交互解决复杂任务。然而,现有的强化学习方法通常依赖轨迹级监督,这限制了在长视野 TIR 场景中的细粒度信用分配。在线策略自蒸馏通过具有特权上下文的教师分支提供更密集的信号,但现有方法通常从地面真值答案或检索到的技能中提取此类上下文,这可能无法反映智能体实际访问的状态。此外,令牌级监督无法捕捉工具交互的回合级结构。为解决这一问题,我们提出了 TurnSight,一个回合级事后自我蒸馏框架,它直接从基于执行条件的事后视角中导出监督信号。然后,它构建多个具有不同前瞻视野的事后视角,并通过跨视野方向一致性选择可靠的监督信号。最后,所选的事后信号在同源轨迹中进行归一化,并用于自适应地调节强化学习优势,同时保持其原始的优化方向。在三个基准上的大量实验证明了 TurnSight 的有效性。我们的代码可在 https://github.com/quchangle1/TurnSight 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.04007) 查看 PDF (https://arxiv.org/pdf/2608.04007) 项目页面 (https://huggingface.co/collections/ChangleQu/turnsight) GitHub0 (https://github.com/quchangle1/TurnSight) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04007)
在您的智能体中获取这篇论文:
hf papers read 2608\.04007
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.04007 即可从本页链接到该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.04007 即可从本页链接到该数据集。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.04007 即可从本页链接到该 Space。
包含此论文的集合 1
相似文章
H^2SD:混合事后自我蒸馏
提出H^2SD,一种混合事后自我蒸馏框架,通过对成功和失败轨迹采用不同的教师模型使用方式,改善了RLVR,实现了更优的推理性能。
HINT-SD: 面向长程智能体的目标性事后自我蒸馏
HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。
HiDiffTIR:多轮工具集成推理的层次难度感知策略优化
提出HiDiffTIR,一种面向LLM代理中多轮工具集成推理的层次难度感知策略优化框架,通过细粒度信用分配提升性能和工具调用准确性。
通过工具监督强化学习实现视觉推理
提出 ToolsRL,一个两阶段强化学习框架,教多模态大模型使用简单视觉工具完成复杂视觉推理任务。
HERO: 从环境观察中进行事后增强反思的智能体自蒸馏
HERO 提出了一种事后增强的自蒸馏框架,利用环境观察作为局部对齐的反馈,以提升多轮智能体的能力,在 TauBench 和 WebShop 上优于现有方法,尤其在有限的轮次预算下表现突出。