HINT-SD: 面向长程智能体的目标性事后自我蒸馏

Hugging Face Daily Papers 论文

摘要

HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。

使用强化学习训练长程 LLM 智能体是一项挑战,因为稀疏的结果奖励能够揭示任务是否成功,但无法指示哪些中间动作导致了该结果,也无法说明应如何纠正这些动作。近期的方法通过从回合层面的动作输出信号中生成奖励或文本提示,或者通过使用反馈条件自我蒸馏来缓解此问题。然而,在每一回合都生成反馈效率低下,因为许多中间回合已经是成功的或中性的;在固定或错位的回合上应用反馈,往往无法监督那些导致失败的动作。为弥补这一差距,我们提出了 HINT-SD,一种目标性自我蒸馏框架,它利用全轨迹的事后视角选择与失败相关的动作,并仅在目标动作片段上应用反馈条件蒸馏。在 BFCL v3 和 AppWorld 上的实验表明,我们的方法相比密集逐回合反馈基线,性能提升高达 18.80%,同时每个训练步骤的时间降低了 2.26 倍,这表明选择蒸馏位置是实现高效且有效的长程智能体训练的关键因素。
查看原文
查看缓存全文

缓存时间: 2026/05/25 06:36

论文页面 - HINT-SD:面向长周期智能体的针对性事后自蒸馏

来源:https://huggingface.co/papers/2605.17873

摘要

HINT-SD 是一个针对性自蒸馏框架,能从完整轨迹中选择与失败相关的动作,从而提升长周期 LLM 智能体训练的效率与效果。

使用强化学习(https://huggingface.co/papers?q=reinforcement%20learning)训练长周期 LLM 智能体具有挑战性,因为稀疏的结果奖励只能反映任务是否成功,却无法揭示是哪些中间动作导致了该结果,以及应如何修正这些动作。近期方法通过从回合级动作-输出信号中生成奖励或文本提示,或利用反馈条件自蒸馏(https://huggingface.co/papers?q=self-distillation)来缓解这一问题。然而,当大量中间回合已经成功或中性时,在每个回合都生成反馈效率低下;而在固定或不对齐的回合应用反馈,往往无法监督导致失败的动作。为弥补这一差距,我们提出 HINT-SD,这是一个针对性自蒸馏(https://huggingface.co/papers?q=self-distillation)框架,它利用完整轨迹的事后洞察(https://huggingface.co/papers?q=hindsight)来选取与失败相关的动作,并仅在目标动作片段上应用反馈条件蒸馏(https://huggingface.co/papers?q=feedback-conditioned%20distillation)。在 BFCL v3 和 AppWorld 上的实验表明,我们的方法相比密集的每回合反馈基线最高提升 18.80%,同时每个训练步骤的时间降低 2.26 倍,从而表明选择蒸馏位置是实现长周期智能体有效且高效训练的关键因素。

查看 arXiv 页面 (https://arxiv.org/abs/2605.17873) 查看 PDF (https://arxiv.org/pdf/2605.17873) 添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2605.17873)

在你的智能体中获取这篇论文:

hf papers read 2605\.17873

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

尚无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.17873 以在此页面进行链接。

引用此论文的数据集 0

尚无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.17873 以在此页面进行链接。

引用此论文的 Space 0

尚无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.17873 以在此页面进行链接。

包含此论文的集合 0

尚无包含此论文的集合

将此论文添加至集合 (https://huggingface.co/new-collection) 以在此页面进行链接。

相似文章

H^2SD:混合事后自我蒸馏

Hugging Face Daily Papers

提出H^2SD,一种混合事后自我蒸馏框架,通过对成功和失败轨迹采用不同的教师模型使用方式,改善了RLVR,实现了更优的推理性能。

OPID: 同策略技能蒸馏用于智能体强化学习

Hugging Face Daily Papers

OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。

Learning More from Less: 从后见之明中进行强化学习

arXiv cs.LG

介绍了Learning from Hindsight (LfH)方法,该方法将后见之明重标注应用于视觉-语言-动作模型的强化学习后训练。通过将失败的机器人轨迹重新标注为它们实际完成的任务,LfH在分布外操作任务上实现了5倍的样本效率提升。