X-Tree:为智能体高效泛化而对可复用经验进行分词
摘要
X-Tree 直接从智能体轨迹中恢复可复用的技能层次结构(无需调用 LLM),并将其集成到离线强化学习、在线 RLVR 以及 on-policy 自蒸馏中,在数据和预算相同的条件下,于 WebArena、ScienceWorld 和 WebShop 上的成功率相较标准训练方案最高提升 5.8%。
查看缓存全文
缓存时间: 2026/10/02 20:31
论文页面 - X-Tree:将可复用经验进行分词,以实现高效的智能体泛化
来源:https://huggingface.co/papers/2609.32993
摘要
多步智能体是在扁平的动作流上进行训练的:SFT 和 RLVR 对每个 token 施加均匀的权重,忽略了跨任务反复出现的子过程,也忽略了让人类能够自顶向下地从可复用例程中进行规划的层级结构。这种结构被闲置不用,扁平化训练对每条稀缺轨迹的利用程度远低于其内容所能支撑的上限。近期的智能体确实用到了这种结构,但仅以 LLM 编写的技能形式存在于上下文中,从未纳入模型权重,因此其收益无法在检索之外泛化。我们则从数据本身中恢复出这一层级结构并在其上进行训练,全程无需调用 LLM。遵循文本分词器仅靠计数来构建词表的思路,我们根据可复用性为动作片段打分,并将规范化后的动作合并为一棵可复用的经验树(eXperience Tree,X-Tree)。X-Tree 的每个节点刻画了一个高频且能带来成功结果的技能是如何由子技能组合而成的,从而引导高效的泛化。我们将 X-Tree 集成到三种训练设置中:离线 RL,以每个节点作为一个训练实例;在线 RLVR,采用自适应技能加成(skill bonus);以及 on-policy 自蒸馏,以 X-Tree 作为自我教师的特权上下文(privileged context)。在 WebArena、ScienceWorld 和 WebShop 三个基准上、三个模型规模下,X-Tree 在相同数据量与预算下相比标准训练配方最多带来 4.5% 的 WebArena 成功率(SR)提升、5.8% 的 ScienceWorld SR 提升和 4.1% 的 WebShop 成功率提升。对照分析将这些收益归因于 X-Tree 的结构及其三种集成方式。
[查看 arXiv 页面 (https://arxiv.org/abs/2609.32993)] [查看 PDF (https://arxiv.org/pdf/2609.32993)] [项目页面 (https://sitaocheng.github.io/xtree/)] [GitHub1 (https://github.com/sitaocheng/X-Tree)] [加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.32993)]
在你的智能体中获取这篇论文:
hf papers read 2609.32993
还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 0
尚无模型关联本论文
在模型 README.md 中引用 arxiv.org/abs/2609.32993,即可在此页面建立关联。
引用本论文的数据集 0
尚无数据集关联本论文
在数据集 README.md 中引用 arxiv.org/abs/2609.32993,即可在此页面建立关联。
引用本论文的 Space 0
尚无 Space 关联本论文
在 Space README.md 中引用 arxiv.org/abs/2609.32993,即可在此页面建立关联。
收录本论文的合集 0
尚无合集收录本论文
将本论文添加到合集 (https://huggingface.co/new-collection),即可在此页面建立关联。
相似文章
Tree-of-Experience:一种在低重复性和隐式奖励环境下用于自进化智能体的结构化经验管理方案
本文介绍了FinEvolveBench(一个用于金融情感预测的基准测试)和Tree-of-Experience(ToE,一种针对低重复性任务和隐式奖励的LLM智能体的结构化经验管理方法)。实验表明,在此类挑战性场景中,ToE优于通用经验机制。
RS-Claw: 通过层次化技能树实现的渐进式主动工具探索——面向遥感智能体
RS-Claw 提出了一种用于遥感智能体的主动工具探索范式,利用层次化技能树,支持按需顺序决策,在Earth-Bench上实现了高达86%的输入令牌压缩,并且性能优于被动选择基线。
针对预算受限代理搜索的更充分利用与更智能探索
本文介绍了ExTS,这是一种针对LLM代理中预算受限代理搜索的树搜索策略,在提示优化和代码生成等任务中,相比标准基线平均提升5.5%。
AREX:迈向递归自我改进的深度研究代理
AREX 引入了一系列用于深度研究的递归自我改进代理,在内层研究循环和外层自我改进循环之间交替,并通过长周期强化学习进行训练。在 BrowseComp 和 Humanity's Last Exam 等基准测试中,其表现大幅优于同量级基线模型。
过程奖励引导的树状展开实现高效多轮强化学习
提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。