X-Tree:为智能体高效泛化而对可复用经验进行分词

Hugging Face Daily Papers 论文

摘要

X-Tree 直接从智能体轨迹中恢复可复用的技能层次结构(无需调用 LLM),并将其集成到离线强化学习、在线 RLVR 以及 on-policy 自蒸馏中,在数据和预算相同的条件下,于 WebArena、ScienceWorld 和 WebShop 上的成功率相较标准训练方案最高提升 5.8%。

多步智能体通常在扁平的动作流上进行训练:SFT 和 RLVR 对每个 token 一视同仁,忽略了跨任务重复出现的子流程,而这正是人类能够自上而下、基于可复用例程进行规划的层次结构。这一结构被闲置未用,扁平式训练也无法让每条来之不易的轨迹充分发挥其内容所蕴含的潜力。近期的智能体确实会利用这种结构,但仅将其作为写在上下文中的 LLM 技能,从未进入权重之中,因此其收益无法超越检索层面进行泛化。我们则直接从数据本身中恢复这一层次结构并据此进行训练,全程无需调用 LLM。借鉴文本分词器仅通过计数构建词表的思路,我们根据可复用性对动作片段进行打分,并将规范化后的动作合并为一棵可复用的经验树(eXperience tree,简称 X-Tree)。X-Tree 中的每个节点刻画了一个高频且成功导向的技能如何由子技能组合而成,从而引导高效的泛化。我们将 X-Tree 集成到三种训练设置中:离线 RL,将每个节点作为训练样本;在线 RLVR,采用自适应技能奖励加成;以及 on-policy 自蒸馏,将 X-Tree 作为自蒸馏教师的特权上下文。在三种模型规模下,跨 WebArena、ScienceWorld 和 WebShop 的对比实验表明,在数据和预算相同的条件下,X-Tree 相比标准方案在 WebArena 上成功率提升最高达 4.5%,在 ScienceWorld 上提升 5.8%,在 WebShop 上提升 4.1%。配对分析(matched analyses)表明,这些收益源于 X-Tree 结构本身以及上述三种集成方式。
查看原文
查看缓存全文

缓存时间: 2026/10/02 20:31

论文页面 - X-Tree:将可复用经验进行分词,以实现高效的智能体泛化

来源:https://huggingface.co/papers/2609.32993

摘要

多步智能体是在扁平的动作流上进行训练的:SFT 和 RLVR 对每个 token 施加均匀的权重,忽略了跨任务反复出现的子过程,也忽略了让人类能够自顶向下地从可复用例程中进行规划的层级结构。这种结构被闲置不用,扁平化训练对每条稀缺轨迹的利用程度远低于其内容所能支撑的上限。近期的智能体确实用到了这种结构,但仅以 LLM 编写的技能形式存在于上下文中,从未纳入模型权重,因此其收益无法在检索之外泛化。我们则从数据本身中恢复出这一层级结构并在其上进行训练,全程无需调用 LLM。遵循文本分词器仅靠计数来构建词表的思路,我们根据可复用性为动作片段打分,并将规范化后的动作合并为一棵可复用的经验树(eXperience Tree,X-Tree)。X-Tree 的每个节点刻画了一个高频且能带来成功结果的技能是如何由子技能组合而成的,从而引导高效的泛化。我们将 X-Tree 集成到三种训练设置中:离线 RL,以每个节点作为一个训练实例;在线 RLVR,采用自适应技能加成(skill bonus);以及 on-policy 自蒸馏,以 X-Tree 作为自我教师的特权上下文(privileged context)。在 WebArena、ScienceWorld 和 WebShop 三个基准上、三个模型规模下,X-Tree 在相同数据量与预算下相比标准训练配方最多带来 4.5% 的 WebArena 成功率(SR)提升、5.8% 的 ScienceWorld SR 提升和 4.1% 的 WebShop 成功率提升。对照分析将这些收益归因于 X-Tree 的结构及其三种集成方式。

[查看 arXiv 页面 (https://arxiv.org/abs/2609.32993)] [查看 PDF (https://arxiv.org/pdf/2609.32993)] [项目页面 (https://sitaocheng.github.io/xtree/)] [GitHub1 (https://github.com/sitaocheng/X-Tree)] [加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.32993)]

在你的智能体中获取这篇论文:

hf papers read 2609.32993

还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

尚无模型关联本论文

在模型 README.md 中引用 arxiv.org/abs/2609.32993,即可在此页面建立关联。

引用本论文的数据集 0

尚无数据集关联本论文

在数据集 README.md 中引用 arxiv.org/abs/2609.32993,即可在此页面建立关联。

引用本论文的 Space 0

尚无 Space 关联本论文

在 Space README.md 中引用 arxiv.org/abs/2609.32993,即可在此页面建立关联。

收录本论文的合集 0

尚无合集收录本论文

将本论文添加到合集 (https://huggingface.co/new-collection),即可在此页面建立关联。

相似文章

AREX:迈向递归自我改进的深度研究代理

Hugging Face Daily Papers

AREX 引入了一系列用于深度研究的递归自我改进代理,在内层研究循环和外层自我改进循环之间交替,并通过长周期强化学习进行训练。在 BrowseComp 和 Humanity's Last Exam 等基准测试中,其表现大幅优于同量级基线模型。

过程奖励引导的树状展开实现高效多轮强化学习

arXiv cs.CL

提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。