DRIFT: 解耦轨迹展开与重要性加权微调以实现高效多轮优化

Hugging Face Daily Papers 论文

摘要

本文提出DRIFT框架,该框架结合离线轨迹与重要性加权监督微调,高效实现与强化学习相当的多轮交互学习性能。

大语言模型越来越多地被部署在多轮交互环境中,用户或环境可以迭代地提供轻量级反馈。然而,在实践中优化此类行为面临严峻困境:在线强化学习能有效处理多轮动态,但由于每次更新都需要生成完整的修正轨迹,成本过高;而离线监督微调(SFT)虽高效,却遭受分布偏移和行为崩溃的问题。为此,我们创新性地提出DRIFT(解耦轨迹展开与重要性加权微调),该框架基于一个理论洞见:KL正则化的强化学习目标等价于重要性加权监督学习。DRIFT通过从固定参考策略中采样离线交互轨迹,推导基于回报的重要性权重,并对生成的数据集进行加权SFT来优化策略,从而将轨迹展开与优化解耦。实验表明,DRIFT在多轮强化学习基准上达到或超越其性能,同时保持标准监督微调的训练效率和简洁性。代码开源于 https://github.com/2020-qqtcg/DRIFT。
查看原文
查看缓存全文

缓存时间: 2026/06/01 07:18

论文页面 - DRIFT:解耦轨迹展开与重要性加权微调实现高效多轮优化

来源:https://huggingface.co/papers/2605.31455 发布于 5月29日

·

由https://huggingface.co/mujianijan 提交

mj (https://huggingface.co/mujianijan)于 6月1日

摘要

DRIFT 是一个框架,它结合离线轨迹与重要性加权监督微调,实现了与强化学习相当的多轮交互学习效率与性能。

大型语言模型越来越多地部署于多轮交互场景,其中用户或环境可以迭代地提供轻量级反馈。然而,在实践中优化此类行为面临一个尖锐的两难困境:在线强化学习 (https://huggingface.co/papers?q=online%20reinforcement%20learning) 能够有效处理多轮动态 (https://huggingface.co/papers?q=multi-turn%20dynamics),但代价高昂,因为每次更新都需要生成完整的修正轨迹;而离线监督微调 (https://huggingface.co/papers?q=offline%20supervised%20fine-tuning) (SFT) 虽然高效,却面临分布偏移和行为崩溃 (https://huggingface.co/papers?q=behavioral%20collapse) 的问题。为此,我们创新性地提出了 DRIFT(解耦轨迹展开 (https://huggingface.co/papers?q=Rollouts) 与重要性加权微调 (https://huggingface.co/papers?q=Importance-Weighted%20Fine-Tuning)),该框架将 KL 正则化 RL 目标 (https://huggingface.co/papers?q=KL-regularized%20RL%20objective) 等价于重要性加权监督学习 (https://huggingface.co/papers?q=importance-weighted%20supervised%20learning) 的理论洞见付诸实践。DRIFT 通过从固定参考策略 (https://huggingface.co/papers?q=reference%20policy) 采样离线交互轨迹、推导基于回报的重要性权重 (https://huggingface.co/papers?q=importance%20weights),并在所得数据集上通过加权 SFT 优化策略,从而将轨迹展开与优化解耦。实验表明,DRIFT 在多轮强化学习基准上达到了匹配或更优的性能,同时保持了标准监督微调的训练效率与简洁性。代码已开源至 https://github.com/2020-qqtcg/DRIFT。

查看 arXiv 页面 (https://arxiv.org/abs/2605.31455)查看 PDF (https://arxiv.org/pdf/2605.31455)GitHub0 (https://github.com/2020-qqtcg/DRIFT)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31455)

在你的智能体中获取此论文:

hf papers read 2605.31455

未安装最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

暂无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.31455 以从此页面链接。

引用此论文的数据集0

暂无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.31455 以从此页面链接。

引用此论文的 Spaces0

暂无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2605.31455 以从此页面链接。

包含此论文的收藏0

暂无收藏包含此论文

请将此论文添加至一个收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

Drift Q-Learning

arXiv cs.LG

提出了DriftQL,它结合了基于漂移的行为正则化器与评论家驱动的策略改进,用于离线强化学习,在D4RL和OGBench上优于扩散和流方法,同时保持简单性和效率。

过程奖励引导的树状展开实现高效多轮强化学习

arXiv cs.CL

提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。

Dynamic Rollout Editing:减少RL训练推理模型中的过度思考

arXiv cs.CL

本文介绍了一种训练时干预方法——动态展开编辑(Dynamic Rollout Editing, DRE),用于减少GRPO式强化学习推理模型中的过度思考。DRE通过保留可到达解的路径前缀并偏好经过验证的较短版本,来编辑成功轨迹,从而削弱对不必要思考的偏好。