标签
TurnSight 提出了一种面向工具集成推理的回合级事后自蒸馏框架,通过基于执行条件的事后视角和自适应强化学习优势调制来提供密集监督。
介绍Hindsight Policy Optimization (HPO),一种新颖的策略梯度方法,它利用意图空间和Wasserstein距离来减少长周期语言智能体训练中的方差,显示出比GRPO和PPO更好的稳定性。
MeetMemory是一款基于Hindsight和Groq构建的工具,为AI赋予会议的永久记忆,使其能够即时回顾所有历史对话,无需手动搜索或记笔记。
HERO 提出了一种事后增强的自蒸馏框架,利用环境观察作为局部对齐的反馈,以提升多轮智能体的能力,在 TauBench 和 WebShop 上优于现有方法,尤其在有限的轮次预算下表现突出。
HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。