Tree-of-Experience:一种在低重复性和隐式奖励环境下用于自进化智能体的结构化经验管理方案
摘要
本文介绍了FinEvolveBench(一个用于金融情感预测的基准测试)和Tree-of-Experience(ToE,一种针对低重复性任务和隐式奖励的LLM智能体的结构化经验管理方法)。实验表明,在此类挑战性场景中,ToE优于通用经验机制。
arXiv:2606.06960v1 公告类型:新
摘要:基于经验的自进化对LLM智能体至关重要,但现有基准测试通常假设目标明确、任务模式稳定且反馈清晰。我们研究了一种更具挑战性的场景:低重复性任务与隐式奖励,其中过往经验难以重用,且反馈具有延迟性、噪声性和结果级特征。我们引入了 \textsc{FinEvolveBench}(一个时间控制的金融情感预测基准测试),将每日新闻驱动的预测与未来超额收益相关联。我们进一步提出了Tree-of-Experience(ToE),一种结构化的经验管理方法,用于组织、检索、验证和更新智能体经验。实验表明,通用经验机制并不总能持续优于无经验的基线,而ToE则实现了更强的整体性能。这些结果凸显了结构化经验管理对于隐式奖励环境下自进化智能体的重要性。
查看缓存全文
缓存时间: 2026/06/08 09:21
# 经验之树:低重复性与隐式奖励环境下自进化智能体的结构化经验管理方案 来源:https://arxiv.org/html/2606.06960 Zihao Deng, Yining Zhu, Leiming Wang, Jingfei Lu Junbo Wang, Chuncheng Ran, Yu Yang, Dixuan Yang, Jikun Shen ###### 摘要 基于经验的自进化对于大语言模型智能体至关重要,但现有基准通常假设明确的目标、稳定的任务模式和清晰的反馈。我们研究了一个更具挑战性的设置:低重复性任务与隐式奖励,其中过去的经验难以复用,反馈延迟、有噪声且仅出现在结果层面。我们引入了FinEvolveBench,一个时间可控的金融情感预测基准,将每日新闻驱动的预测与未来超额收益相关联。我们进一步提出了Tree-of-Experience (ToE),一种结构化经验管理方法,用于组织、检索、验证和更新智能体经验。实验表明,通用经验机制并不总能持续优于无经验基线,而ToE取得了更强的整体性能。这些结果突显了在隐式奖励环境中自进化智能体进行结构化经验管理的重要性。 --- # 经验之树:低重复性与隐式奖励环境下自进化智能体的结构化经验管理方案 Zihao Deng, Yining Zhu, Leiming Wang, Jingfei LuJunbo Wang, Chuncheng Ran, Yu Yang, Dixuan Yang, Jikun Shen ## 1 引言 评估语言模型智能体能否通过经验提升,需要那些过去交互能够影响未来决策的环境。现有自进化基准在测试经验积累、反思和策略修订方面取得了重要进展 (Shinn et al., 2023; Zheng et al., 2025)。然而,其中许多基准围绕具有相对稳定执行模式、明确目标和可验证结果的程序化任务构建,例如软件工程、网页导航、工具使用或具身指令跟随 (Jimenez et al., 2024; Mialon et al., 2023; Shridhar et al., 2020)。这些设置有助于研究智能体能否复用成功轨迹,但它们仅部分反映了真实世界的决策问题——其中任务实例弱重复、反馈间接且环境规律随时间变化。 我们专注于这个尚未被充分评估的设置:智能体必须在复杂且异质的任务中适应,同时与提供间接且不稳定反馈的环境交互,即低重复性任务与隐式奖励。在此类任务中,历史经验不能直接复用,因为每个实例可能涉及不同的信息来源、潜在因果因素和决策依据。反馈通常仅在结果层面观察到,而非针对单个推理或信息选择步骤的逐步监督。这造成了困难的信用分配问题:成功或失败无法可靠地追溯到特定因素、推理步骤或证据片段。例如,金融市场每个交易日都暴露于大量正面和负面新闻信号,使得难以确定正确的或不正确的市场情绪预测是否源自任何特定分析。此外,环境可能充满噪声且非平稳,使得以前有用的经验变得不可靠甚至有害。这些特性挑战了许多基于经验的智能体方法背后的一个常见假设:语义相似的过去任务能为未来任务提供直接可复用的指导。 金融情感预测为此设置提供了天然的试验场。给定按时间排序的市场新闻,智能体必须推断出能够预测未来市场走势的情绪信号。与标准情感分类不同,预测质量并非由附加在单条新闻上的明确标签监督,而是通过随后的市场结果间接反映。因此奖励是延迟、有噪声且隐式的。同时,任务本质上是低重复性的:即使新闻涉及相似的实体或主题,周围的市场背景、投资者预期、宏观经济条件和公司特定状态也可能存在显著差异。因此,历史经验不能仅基于表面相似性复用。智能体必须判断过去的推理模式在当前市场体制下是否仍然有效,并决定检索、修改或丢弃哪些经验。这使得金融情感预测成为测试智能体在低重复性、隐式奖励和非平稳环境下能否管理经验并适应的合适基准。 因此,我们引入FinEvolveBench,一个用于评估金融情感预测中基于经验的自进化的基准,并提出Tree-of-Experience (ToE),一种结构化的经验管理方法,作为低重复性和隐式奖励环境的参考解决方案。我们在多个基础模型和自进化策略上进行了全面评估,包括无经验流水线、通用经验机制以及我们提出的结构化方法。结果表明,通用经验机制在无经验设置上并未持续改进,表明在低重复性的金融环境中复用经验并非微不足道。相比之下,结构化的经验管理在当前协议下提供了更强的整体性能。 我们的贡献总结如下:(1) 我们将低重复性任务与隐式奖励定义为自进化智能体的一个评估设置,突出了弱任务重复性、结果级反馈和非平稳性带来的综合挑战;(2) 我们构建了FinEvolveBench,一个时间有序的金融情感预测基准,具有严格的时间控制、最新的市场数据、延迟反馈以及基于未来超额收益的金融评估指标;(3) 我们提出了Tree-of-Experience (ToE),一种结构化经验管理参考方法和诊断性评估,表明在FinEvolveBench中有效的自进化要求智能体有选择地检索、验证和更新经验,而非直接复用历史模式。 ## 2 相关工作 越来越多的研究致力于大语言模型智能体的运行时自进化,旨在通过反思、记忆和经验复用使智能体在部署后能够改进。我们首先介绍代表性的自进化方法及其采用的评估基准,然后回顾现有的金融NLP基准,并解释为何它们不足以验证在低重复性任务和隐式奖励下的智能体自进化能力。 ##### 运行时自进化与通用基准 运行时学习研究智能体如何通过交互流在部署后改进,而非通过离线监督数据,这与更广泛的共识一致:未来智能体必须从具身经验中学习 (Silver and Sutton, 2025)。外部记忆为模型权重更新提供了一种高效的、非参数化的替代方案,绕过了传统的成本和稳定性瓶颈。诸如 Reflexion (Shinn et al., 2023)、Mem0 (Chhikara et al., 2025)、Evo-Memory (Wei et al., 2025) 和 MemRL (Zhang et al., 2026) 等系统探索了智能体如何存储、检索和复用过去的成功与失败以优化未来推理。为评估这些能力,语言模型越来越多地作为自主智能体在各种通用基准上进行测试。软件和工具使用基准,如 SWE-Bench (Jimenez et al., 2024)、BigCodeBench (Zhuo et al., 2025)、GAIA (Mialon et al., 2023)、XBench (Chen and others, 2025) 和 τ²-Bench (Barres and others, 2025),衡量智能体能否通过推理、工具调用和环境交互解决真实任务。更接近自进化或长周期智能体的基准,包括 LifelongAgentBench (Zheng et al., 2025)、HLE (Phan et al., 2025) 和 ALFWorld (Shridhar et al., 2020),进一步强调在模拟环境中的终身学习、前沿级知识和交互规划。虽然这些基准对衡量任务完成和经验复用至关重要,但它们运行在大多假设明确成功信号、稳定规则和清晰任务重复的环境中。 ##### 金融NLP与金融基准 现有的金融基准,包括 FinQA (Chen et al., 2021)、TAT-QA (Zhu et al., 2021)、FinBen (Xie and others, 2024) 以及基于目标的情感数据集 (Muhammad et al., 2025),主要提供静态的、实例级的监督,用于金融理解和推理。它们不要求智能体处理带时间戳的信息、维护不断演变的经验或适应延迟的市场反馈。面向交易的框架如 StockBench (Chen et al., 2025) 引入了时间模拟,但主要评估交易行为的盈利能力而非记忆驱动的自进化。它们还往往依赖有限的检索证据,减少了真实市场信息流的广度和噪声。FinEvolveBench 则在一个更广泛的全市场信息环境中评估智能体,该环境包含密集、嘈杂且弱结构化的舆论信号。 ## 3 FinEvolveBench 在本节中,我们介绍 FinEvolveBench,一个包含两大主要组件的基准:一个时间交互的金融市场环境,以及一个定义良好的自进化智能体工作流。这些组件共同提供了一个灵活的测试平台,用户可以方便地插入和评估不同的基于经验的自进化方法。FinEvolveBench 的整体框架如图1所示。  图1:FinEvolveBench 概览。FinEvolveBench 由一个带有隐式奖励的市场环境数据集和一个工作流组成,该工作流将骨干大语言模型转化为配备通用自进化机制的智能体。 ### 3.1 环境构建 我们基于中国A股市场的31个申万一级行业指数、带时间戳的公共金融新闻以及每日市场记录构建 FinEvolveBench。对于每个交易日,我们将新闻流与开盘/收盘价、交易量和成交数据对齐,并将对齐后的记录转换为按时间顺序排列的情感预测实例。环境是时间交互的:智能体只能访问截至当前日期可用的信息,而每个预测被记录下来,一旦其预测期变得可观测,便会转换为延迟的市场反馈。我们在附录中包含了金融市场环境和数据结构的详细信息。 ### 3.2 自进化智能体工作流 在 FinEvolveBench 的交互环境之上,我们设计了一个轻量级的自进化智能体工作流。受主流记忆和基于经验的自进化机制(如 Mem0 (Chhikara et al., 2025) 和 MemRL (Zhang et al., 2026))的启发,我们将经验管理分解为两个阶段:检索和更新。这一抽象允许研究人员在统一的基准接口下评估他们自己的基于经验的自进化方法。 如图1右侧所示,工作流包含四个主要步骤。 ##### 步骤1: 信息感知与任务构建 智能体首先感知可用的环境信息并提取与任务相关的内容,从而构建当前交互所需的任务。具体来说,根据待分析目标所属的行业,智能体从可用信息来源中检索并提取与该行业相关的重要新闻,从而构建具体的金融情感分析任务。 ##### 步骤2: 任务相关经验检索 经验管理智能体从经验库中检索一组可能对完成当前任务有用的经验。 ##### 步骤3: 任务执行 根据任务描述和检索到的经验,智能体执行任务。遵循金融情感分析的先前工作,如 FinBERT (Araci, 2019) 和 FinGPT (Yang et al., 2023),智能体为待分析目标生成一个范围为[-1,1]的连续情感分数。 ##### 步骤4: 验证与反思 任务执行后,环境记录预测轨迹,并在相应的市场结果变得可观测时计算反馈。增强反馈的轨迹随后用于更新经验池,模拟进入下一个交易日。 该工作流提供了一个统一接口来评估基于经验的自进化方法,而不规定经验应如何组织、检索或更新。在下一节中,我们将介绍针对低重复性任务和隐式奖励的结构化经验管理自进化解决方案。 ## 4 方法论 在本节中,我们介绍 Tree-of-Experience:一种结构化的经验管理方法,并展示 FinEvolveBench 如何在低重复性和隐式奖励环境下比较和诊断不同的经验机制。 ### 4.1 问题形式化 遵循第3节定义的自进化智能体工作流,我们将经验采用形式化为一个非参数化强化学习过程。在每个时间步 t,智能体观察状态 s_t,检索外部经验 E_t,并产生动作 a_t。在相应的结果 o_t 变得可观测后,环境返回一个延迟的反馈信号 r_t = R(a_t, o_t), (1) 其中 R(·) 是一个任务特定的奖励函数。该反馈用于更新检索到的经验的效用,而不修改模型参数。整体框架如图2所示。  图2:Tree-of-Experience 概览。上图展示了端到端学习工作流:给定任务 τ_t,智能体从经验记忆 E 中检索一个经验上下文 m_ctx,生成输出 y_t,并更新检索到的经验的效用值 Q。
相似文章
MetaEvo: 一种用于经验驱动型智能体持续进化的元优化框架
MetaEvo 提出了一种两阶段框架,用于基于LLM的智能体的持续进化,利用基于偏好的优化来增强原则抽象和用于经验重用的模块化架构,在推理基准测试上优于强基线。
EvolveTrade:基于经验驱动的策略优化,用于自我进化的LLM交易代理
EvolveTrade 引入了一个针对 LLM 交易代理的自我进化框架,该框架利用决策轨迹和投资组合反馈来优化工具使用策略,在不同市场状态下改善夏普比率和累计收益率。
环境作为支架:丰富反馈以引导长期任务中的自我进化智能体
本文提出了反馈丰富环境(FEEs),通过丰富强化学习的反馈来引导长期任务中的自我进化智能体,并在使用Qwen3模型和RL算法的基准测试中显示了稳定性和性能的提升。
X-Tree:为智能体高效泛化而对可复用经验进行分词
X-Tree 直接从智能体轨迹中恢复可复用的技能层次结构(无需调用 LLM),并将其集成到离线强化学习、在线 RLVR 以及 on-policy 自蒸馏中,在数据和预算相同的条件下,于 WebArena、ScienceWorld 和 WebShop 上的成功率相较标准训练方案最高提升 5.8%。
针对预算受限代理搜索的更充分利用与更智能探索
本文介绍了ExTS,这是一种针对LLM代理中预算受限代理搜索的树搜索策略,在提示优化和代码生成等任务中,相比标准基线平均提升5.5%。