DRIFT: 解耦轨迹展开与重要性加权微调以实现高效多轮优化
摘要
本文提出DRIFT框架,该框架结合离线轨迹与重要性加权监督微调,高效实现与强化学习相当的多轮交互学习性能。
查看缓存全文
缓存时间: 2026/06/01 07:18
论文页面 - DRIFT:解耦轨迹展开与重要性加权微调实现高效多轮优化
来源:https://huggingface.co/papers/2605.31455 发布于 5月29日
·
由https://huggingface.co/mujianijan 提交
mj (https://huggingface.co/mujianijan)于 6月1日
摘要
DRIFT 是一个框架,它结合离线轨迹与重要性加权监督微调,实现了与强化学习相当的多轮交互学习效率与性能。
大型语言模型越来越多地部署于多轮交互场景,其中用户或环境可以迭代地提供轻量级反馈。然而,在实践中优化此类行为面临一个尖锐的两难困境:在线强化学习 (https://huggingface.co/papers?q=online%20reinforcement%20learning) 能够有效处理多轮动态 (https://huggingface.co/papers?q=multi-turn%20dynamics),但代价高昂,因为每次更新都需要生成完整的修正轨迹;而离线监督微调 (https://huggingface.co/papers?q=offline%20supervised%20fine-tuning) (SFT) 虽然高效,却面临分布偏移和行为崩溃 (https://huggingface.co/papers?q=behavioral%20collapse) 的问题。为此,我们创新性地提出了 DRIFT(解耦轨迹展开 (https://huggingface.co/papers?q=Rollouts) 与重要性加权微调 (https://huggingface.co/papers?q=Importance-Weighted%20Fine-Tuning)),该框架将 KL 正则化 RL 目标 (https://huggingface.co/papers?q=KL-regularized%20RL%20objective) 等价于重要性加权监督学习 (https://huggingface.co/papers?q=importance-weighted%20supervised%20learning) 的理论洞见付诸实践。DRIFT 通过从固定参考策略 (https://huggingface.co/papers?q=reference%20policy) 采样离线交互轨迹、推导基于回报的重要性权重 (https://huggingface.co/papers?q=importance%20weights),并在所得数据集上通过加权 SFT 优化策略,从而将轨迹展开与优化解耦。实验表明,DRIFT 在多轮强化学习基准上达到了匹配或更优的性能,同时保持了标准监督微调的训练效率与简洁性。代码已开源至 https://github.com/2020-qqtcg/DRIFT。
查看 arXiv 页面 (https://arxiv.org/abs/2605.31455)查看 PDF (https://arxiv.org/pdf/2605.31455)GitHub0 (https://github.com/2020-qqtcg/DRIFT)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31455)
在你的智能体中获取此论文:
hf papers read 2605.31455
未安装最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.31455 以从此页面链接。
引用此论文的数据集0
暂无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.31455 以从此页面链接。
引用此论文的 Spaces0
暂无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.31455 以从此页面链接。
包含此论文的收藏0
暂无收藏包含此论文
请将此论文添加至一个收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
Drift Q-Learning
提出了DriftQL,它结合了基于漂移的行为正则化器与评论家驱动的策略改进,用于离线强化学习,在D4RL和OGBench上优于扩散和流方法,同时保持简单性和效率。
DRIFT:通过在线策略数据归因优化指令数据
DRIFT提出了一种方法,利用在线策略影响函数来优化大型语言模型监督微调的训练数据分布,持续提升现有基线的性能上限。
过程奖励引导的树状展开实现高效多轮强化学习
提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。
Dynamic Rollout Editing:减少RL训练推理模型中的过度思考
本文介绍了一种训练时干预方法——动态展开编辑(Dynamic Rollout Editing, DRE),用于减少GRPO式强化学习推理模型中的过度思考。DRE通过保留可到达解的路径前缀并偏好经过验证的较短版本,来编辑成功轨迹,从而削弱对不必要思考的偏好。
TRACE:一种用于高效智能体强化学习的统一展开预算分配框架
TRACE是一个统一的展开预算分配框架,通过基于前缀信息性在树状展开中动态分配资源,增强多轮智能体强化学习中的奖励对比。它在Multi-Hop QA等智能体基准测试上提升了效率和准确性。