HINT-SD: 面向长程智能体的目标性事后自我蒸馏
摘要
HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。
查看缓存全文
缓存时间: 2026/05/25 06:36
论文页面 - HINT-SD:面向长周期智能体的针对性事后自蒸馏
来源:https://huggingface.co/papers/2605.17873
摘要
HINT-SD 是一个针对性自蒸馏框架,能从完整轨迹中选择与失败相关的动作,从而提升长周期 LLM 智能体训练的效率与效果。
使用强化学习(https://huggingface.co/papers?q=reinforcement%20learning)训练长周期 LLM 智能体具有挑战性,因为稀疏的结果奖励只能反映任务是否成功,却无法揭示是哪些中间动作导致了该结果,以及应如何修正这些动作。近期方法通过从回合级动作-输出信号中生成奖励或文本提示,或利用反馈条件自蒸馏(https://huggingface.co/papers?q=self-distillation)来缓解这一问题。然而,当大量中间回合已经成功或中性时,在每个回合都生成反馈效率低下;而在固定或不对齐的回合应用反馈,往往无法监督导致失败的动作。为弥补这一差距,我们提出 HINT-SD,这是一个针对性自蒸馏(https://huggingface.co/papers?q=self-distillation)框架,它利用完整轨迹的事后洞察(https://huggingface.co/papers?q=hindsight)来选取与失败相关的动作,并仅在目标动作片段上应用反馈条件蒸馏(https://huggingface.co/papers?q=feedback-conditioned%20distillation)。在 BFCL v3 和 AppWorld 上的实验表明,我们的方法相比密集的每回合反馈基线最高提升 18.80%,同时每个训练步骤的时间降低 2.26 倍,从而表明选择蒸馏位置是实现长周期智能体有效且高效训练的关键因素。
查看 arXiv 页面 (https://arxiv.org/abs/2605.17873) 查看 PDF (https://arxiv.org/pdf/2605.17873) 添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2605.17873)
在你的智能体中获取这篇论文:
hf papers read 2605\.17873
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
尚无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.17873 以在此页面进行链接。
引用此论文的数据集 0
尚无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.17873 以在此页面进行链接。
引用此论文的 Space 0
尚无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.17873 以在此页面进行链接。
包含此论文的集合 0
尚无包含此论文的集合
将此论文添加至集合 (https://huggingface.co/new-collection) 以在此页面进行链接。
相似文章
H^2SD:混合事后自我蒸馏
提出H^2SD,一种混合事后自我蒸馏框架,通过对成功和失败轨迹采用不同的教师模型使用方式,改善了RLVR,实现了更优的推理性能。
HERO: 从环境观察中进行事后增强反思的智能体自蒸馏
HERO 提出了一种事后增强的自蒸馏框架,利用环境观察作为局部对齐的反馈,以提升多轮智能体的能力,在 TauBench 和 WebShop 上优于现有方法,尤其在有限的轮次预算下表现突出。
OPID: 同策略技能蒸馏用于智能体强化学习
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
Learning More from Less: 从后见之明中进行强化学习
介绍了Learning from Hindsight (LfH)方法,该方法将后见之明重标注应用于视觉-语言-动作模型的强化学习后训练。通过将失败的机器人轨迹重新标注为它们实际完成的任务,LfH在分布外操作任务上实现了5倍的样本效率提升。
何时蒸馏与蒸馏什么:面向多轮智能体的选择性后见蒸馏
本文首次系统研究了多轮LLM智能体中的信用分配问题,提出了SERL——一种选择性环境重加权学习框架。SERL利用环境反馈在因果相关动作上强化强化学习目标,在ALFWorld和WebShop上分别达到了90.0%和80.1%的成功率。