重访DAgger:大语言模型智能体时代的新探索

Hugging Face Daily Papers 论文

摘要

本文重新审视了数据集聚合(DAgger)方法在训练长周期大语言模型智能体中的应用,证明了在回合级别上对教师与学生的策略进行插值能够有效缓解协变量偏移,并在SWE-bench Verified等软件工程基准测试中优于现有方法。

长周期语言模型智能体通过多轮交互进行学习,其中单次早期错误可能改变后续状态分布,进而破坏整个轨迹。现有方法在互补方面存在不足:监督微调提供密集的教师监督,但由于在离策略的教师轨迹上训练而遭受协变量偏移;而通过可验证奖励进行强化学习则避免了这种离策略不匹配,通过从在策略的轨迹中学习,但仅提供稀疏的结果反馈。我们通过重新审视针对多轮语言模型智能体的数据集聚合(DAgger)来解决这一困境:该算法通过学生和教师策略在回合级别的插值来收集轨迹,然后使用教师提供的监督标签对这些轨迹进行训练。通过直接与环境交互,我们将模型暴露于部署期间可能遇到的真实状态,从而有效缓解协变量偏移。此外,由于学生是通过模仿教师行为来学习的,它在学习过程中获得了丰富的反馈。为了证明DAgger兼具两者的优势,我们测试了该算法,训练了一个软件工程智能体,学生模型参数分别为4B和8B。在SWE-bench Verified上,我们的DAgger风格训练比最强的后训练基线在4B规模上提高了3.9个百分点,在8B规模上提高了3.6个百分点。由此产生的4B智能体达到27.3%的性能,超过了具有代表性的已发布8B SWE智能体系统,而8B智能体达到29.8%,超越了SWE-Gym-32B,并接近更强的32B规模智能体(差距在5个百分点以内)。结合在保留的SWE-Gym数据集上的一致提升,这些结果表明DAgger对于现代长周期语言模型智能体的有效性。
查看原文
查看缓存全文

缓存时间: 2026/05/14 04:17

论文页面 - 重访DAgger:LLM Agent时代的新视角

来源:https://huggingface.co/papers/2605.12913

摘要

面向长程语言模型(LM)Agent的DAgger风格训练,通过结合教师-学生策略的轮次级插值与在线交互,融合了监督微调和强化学习两方面的优势。

长程LM Agent需在多轮交互中学习,早期的一个微小错误就可能改变后续状态分布,导致整个轨迹偏离。现有方案各有不足:监督微调提供了密集的教师监督,但因基于离线的教师轨迹训练而饱受协变量偏移问题;而使用可验证奖励的强化学习虽通过在线策略展开避免了离线的策略失配,却仅提供稀疏的结果反馈。我们通过重新审视数据集聚合(DAgger)来解决这一困境:该算法通过学生与教师策略在轮次级别的插值来收集轨迹,随后学生利用教师提供的监督标签在这些轨迹上进行训练。通过与环境的直接交互,模型得以接触到部署时可能遇到的真实状态,有效缓解了协变量偏移。此外,由于学生通过模仿教师行为进行学习,它在学习过程中能获得丰富的反馈。为证明DAgger兼具两者优势,我们使用该算法训练了一个软件工程Agent,学生模型规模为4B和8B参数。在SWE-bench Verified上,我们的DAgger风格训练在4B规模上比最强的后训练基线提升了3.9个百分点,在8B规模上提升了3.6个百分点。所得到的4B Agent达到了27.3%,超越了已发布的代表性8B SWE Agent系统;而8B Agent则达到了29.8%,超越了SWE-Gym-32B,与更强的32B规模Agent仅差5个点以内。在保留的SWE-Gym测试集上也取得了一致提升,这些结果表明DAgger对于现代长程LM Agent的有效性。

查看 arXiv 页面 (https://arxiv.org/abs/2605.12913)
查看 PDF (https://arxiv.org/pdf/2605.12913)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.12913)

在你的 Agent 中获取本文:

hf papers read 2605.12913

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

暂无模型链接本文

请在模型的 README.md 中引用 arxiv.org/abs/2605.12913 以在此页建立链接。

引用本文的数据集 0

暂无数据集链接本文

请在数据集的 README.md 中引用 arxiv.org/abs/2605.12913 以在此页建立链接。

引用本文的 Spaces 0

暂无 Space 链接本文

请在 Space 的 README.md 中引用 arxiv.org/abs/2605.12913 以在此页建立链接。

包含本文的收藏集 0

暂无收藏集包含本文

请将本文添加到一个收藏集 (https://huggingface.co/new-collection) 以在此页建立链接。

相似文章

LongDS-Bench:论长时域智能体数据分析的失败

arXiv cs.LG

介绍LongDS,一个用于评估LLM智能体在长时域、多轮数据分析任务上的基准。评估表明,即使最佳模型也仅达到48.45%的准确率,性能随轮次急剧下降,凸显出维护分析状态是关键瓶颈。

DART:通过蒸馏-审计-修复训练缓解差异感知大语言模型中的有害漂移

arXiv cs.CL

# 通过蒸馏-审计-修复训练缓解差异感知大语言模型中的有害漂移 来源:[https://arxiv.org/html/2604.16845](https://arxiv.org/html/2604.16845) Ziwen Pan1 Zihan Liang111footnotemark:1 Jad Kabbara2 Ali Emami1 1埃默里大学 2麻省理工学院 {ziwen\.pan, zihan\.liang, ali\.emami}@emory\.edu, jkabbara@mit\.edu ###### 摘要 经过安全调优的大语言模型(LLM)通常会回避承认人口统计差异,即使这种承认在事实上是正确的(例如,基于血统的