LongTraceRL:利用规则奖励从搜索代理轨迹学习长上下文推理
摘要
LongTraceRL 引入了分层干扰项构建和规则奖励设计,以通过强化学习改善语言模型中的长上下文推理。该方法通过知识图谱随机游走生成多跳问题,并利用搜索代理轨迹构建具有挑战性的干扰项,规则奖励提供实体级过程监督。
查看缓存全文
缓存时间: 2026/06/01 03:18
论文页面 - LongTraceRL:通过搜索智能体轨迹与评分奖励学习长上下文推理
来源:https://huggingface.co/papers/2605.31584
摘要
LongTraceRL 通过分层干扰项构建和评分奖励设计,解决大语言模型中的长上下文推理挑战,从而提升推理质量。
长上下文推理 (https://huggingface.co/papers?q=Long-context%20reasoning) 仍是大型语言模型 (https://huggingface.co/papers?q=large%20language%20models) 的核心挑战,模型常难以在大量干扰内容中定位并整合关键信息。基于可验证奖励的强化学习 (https://huggingface.co/papers?q=Reinforcement%20learning%20with%20verifiable%20rewards) (RLVR (https://huggingface.co/papers?q=RLVR)) 在该任务上已展现潜力,但现有方法受限于低混淆度的干扰项以及仅能提供结果奖励、无法监督中间推理步骤的稀疏信号。为此,我们提出 LongTraceRL。在数据构建方面,我们通过知识图谱随机游走 (https://huggingface.co/papers?q=knowledge%20graph%20random%20walks) 生成多跳问题,并利用搜索智能体轨迹 (https://huggingface.co/papers?q=search%20agent%20trajectories) 构建分层干扰项 (https://huggingface.co/papers?q=tiered%20distractors):即智能体已阅读但未引用的文档(高混淆度)和搜索结果中出现但从未打开的文档(低混淆度),以此生成比随机采样或单次搜索所构建的上下文更具挑战性的训练样本。在奖励设计方面,我们提出评分奖励 (https://huggingface.co/papers?q=rubric%20reward),利用每条推理链上的黄金实体作为细粒度的实体级过程监督。该评分奖励 (https://huggingface.co/papers?q=rubric%20reward) 仅应用于最终答案正确的回复(正样本策略),从而区分正确回复中的推理质量,并防止奖励作弊 (https://huggingface.co/papers?q=reward%20hacking)。在三个推理 LLM(4B–30B)以及五个长上下文基准上的实验表明,LongTraceRL 始终优于强基线,并鼓励全面、基于证据的推理。代码、数据集和模型请访问 https://github.com/THU-KEG/LongTraceRL{https://github.com/THU-KEG/LongTraceRL}。
查看 arXiv 页面 (https://arxiv.org/abs/2605.31584)查看 PDF (https://arxiv.org/pdf/2605.31584)GitHub4 (https://github.com/THU-KEG/LongTraceRL)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31584)
在您的智能体中获取此论文:
hf papers read 2605.31584
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.31584 以从本页链接它。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.31584 以从本页链接它。
引用此论文的 Space0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.31584 以从本页链接它。
包含此论文的收藏集0
无收藏集包含此论文
将本论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
@akshay_pachaar: https://x.com/akshay_pachaar/status/2086451430580470095
本文解释了当前的智能体记忆系统如何存储和检索事实,但无法识别模式,并介绍了 Zep 的 Observations 功能,该功能通过分析知识图谱来得出结构性见解。
@DeFiMinty: AI系统能否持续为AI智能体生成更难的训练任务?腾讯的新研究表明可以。递归…
腾讯的一项新研究引入了递归合成终端任务(RST),这是一种逐步为AI智能体生成更难、可验证的训练任务的方法。从639个任务开始,它在15轮中生成了37,484个经过验证的任务,使用这些任务进行强化学习将Qwen3.5-27B在Terminal-Bench Hard上的性能从22.7%提升到32.0%。
@UnTalNixon_exe:微软研究院刚刚发布了AI智能体们期待已久的内存插件。PlugMem。无需微调。……
微软研究院发布了PlugMem,一款面向AI智能体的内存插件,可将经验提炼为知识图谱,将上下文令牌减少10-100倍,并在无需微调的情况下提高决策效用。
@samsja19: 与多智能体一起到来的还有 prime-rl 0.8.0 版本,自 0.7.0 以来共有 13 位贡献者提交了 98 个 commit,菜单上有:1. 多智能体…
Prime Intellect 发布了 prime-rl 0.8.0,增加了多智能体训练、Nixl 和 Model Express 权重广播、扩展的多模态支持,以及多项性能改进。
@samsja19:Prime RL 现在可以表示和训练多智能体系统,支持智能体裁判、自我对弈、用户模拟等用例…
Prime RL 现在支持表示和训练多智能体系统,可实现智能体裁判、自我对弈、用户模拟以及复杂智能体协作等用例。