重访DAgger:大语言模型智能体时代的新探索
摘要
本文重新审视了数据集聚合(DAgger)方法在训练长周期大语言模型智能体中的应用,证明了在回合级别上对教师与学生的策略进行插值能够有效缓解协变量偏移,并在SWE-bench Verified等软件工程基准测试中优于现有方法。
查看缓存全文
缓存时间: 2026/05/14 04:17
论文页面 - 重访DAgger:LLM Agent时代的新视角
来源:https://huggingface.co/papers/2605.12913
摘要
面向长程语言模型(LM)Agent的DAgger风格训练,通过结合教师-学生策略的轮次级插值与在线交互,融合了监督微调和强化学习两方面的优势。
长程LM Agent需在多轮交互中学习,早期的一个微小错误就可能改变后续状态分布,导致整个轨迹偏离。现有方案各有不足:监督微调提供了密集的教师监督,但因基于离线的教师轨迹训练而饱受协变量偏移问题;而使用可验证奖励的强化学习虽通过在线策略展开避免了离线的策略失配,却仅提供稀疏的结果反馈。我们通过重新审视数据集聚合(DAgger)来解决这一困境:该算法通过学生与教师策略在轮次级别的插值来收集轨迹,随后学生利用教师提供的监督标签在这些轨迹上进行训练。通过与环境的直接交互,模型得以接触到部署时可能遇到的真实状态,有效缓解了协变量偏移。此外,由于学生通过模仿教师行为进行学习,它在学习过程中能获得丰富的反馈。为证明DAgger兼具两者优势,我们使用该算法训练了一个软件工程Agent,学生模型规模为4B和8B参数。在SWE-bench Verified上,我们的DAgger风格训练在4B规模上比最强的后训练基线提升了3.9个百分点,在8B规模上提升了3.6个百分点。所得到的4B Agent达到了27.3%,超越了已发布的代表性8B SWE Agent系统;而8B Agent则达到了29.8%,超越了SWE-Gym-32B,与更强的32B规模Agent仅差5个点以内。在保留的SWE-Gym测试集上也取得了一致提升,这些结果表明DAgger对于现代长程LM Agent的有效性。
查看 arXiv 页面 (https://arxiv.org/abs/2605.12913)
查看 PDF (https://arxiv.org/pdf/2605.12913)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.12913)
在你的 Agent 中获取本文:
hf papers read 2605.12913
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
暂无模型链接本文
请在模型的 README.md 中引用 arxiv.org/abs/2605.12913 以在此页建立链接。
引用本文的数据集 0
暂无数据集链接本文
请在数据集的 README.md 中引用 arxiv.org/abs/2605.12913 以在此页建立链接。
引用本文的 Spaces 0
暂无 Space 链接本文
请在 Space 的 README.md 中引用 arxiv.org/abs/2605.12913 以在此页建立链接。
包含本文的收藏集 0
暂无收藏集包含本文
请将本文添加到一个收藏集 (https://huggingface.co/new-collection) 以在此页建立链接。
相似文章
@dair_ai: 新论文:让LLM智能体获得经验,同时改进权重并保持可读性。智能体经验…
JERP 提出了一种方法,让LLM智能体从相同的交互轨迹中联合学习可解释的自然语言规则并更新策略参数,在AlfWorld和WebShop上提升了性能,同时保持了可检查性。
LongDS-Bench:论长时域智能体数据分析的失败
介绍LongDS,一个用于评估LLM智能体在长时域、多轮数据分析任务上的基准。评估表明,即使最佳模型也仅达到48.45%的准确率,性能随轮次急剧下降,凸显出维护分析状态是关键瓶颈。
偏离时回溯:缓解大语言模型推理蒸馏中的双重暴露偏差
本文介绍了一种名为Motab的新型大语言模型推理蒸馏流水线,通过动态监控学生生成并在偏离时回溯到安全状态并借助教师干预,同时缓解离策略和在线策略暴露偏差,取得了约3%的平均性能提升。
DART:通过蒸馏-审计-修复训练缓解差异感知大语言模型中的有害漂移
# 通过蒸馏-审计-修复训练缓解差异感知大语言模型中的有害漂移 来源:[https://arxiv.org/html/2604.16845](https://arxiv.org/html/2604.16845) Ziwen Pan1 Zihan Liang111footnotemark:1 Jad Kabbara2 Ali Emami1 1埃默里大学 2麻省理工学院 {ziwen\.pan, zihan\.liang, ali\.emami}@emory\.edu, jkabbara@mit\.edu ###### 摘要 经过安全调优的大语言模型(LLM)通常会回避承认人口统计差异,即使这种承认在事实上是正确的(例如,基于血统的
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。