层次化实验者智能体
摘要
介绍了层次化实验者智能体(HExA),这是一个基于上下文、以实验为中心的自我改进框架,使LLM智能体能够设计实验、学习可复用技能,并在新领域回答查询,在Interphyre物理模拟基准上取得了显著优于基线的改进。
查看缓存全文
缓存时间: 2026/06/30 05:33
# 1 引言 来源:https://arxiv.org/html/2606.29315
## 层次化实验型智能体
Abhranil Chandra Sankaran Vaidyanathan Utsav Dhanuka Varun Gandhi Scott Niekum
马萨诸塞大学阿默斯特分校
HExA 网站(https://general-exp-3-continual-learning-agent.github.io/HeXA/)|| HExA 代码(https://github.com/General-Exp-3-Continual-Learning-Agent/HeXA-Hierarchical-Experimentalist-Agents)|| Interphyre 网站(https://sankaranv.com/interphyre/)|| Interphyre 代码(https://github.com/sankaranv/interphyre)
**摘要**
大型语言模型(LLMs)越来越多地被用于在现实世界中采取行动并增强人类决策能力。然而,大多数系统依赖于通过模仿获得的参数化知识,或者通过使用固定数据、检索或搜索的后训练来增强。这种范式在全新领域以及无法仅凭先验知识回答的复杂查询中行不通。例如,了解物理定律本身并不能使 LLMs 在复杂的物理系统中回答查询或完成长周期任务。为了普遍解决这类新颖问题,智能体应具备**主动实验**的基本能力——探索并收集针对查询的特定数据或关于未知环境的一般原理,并通过从这些多样化的交互和体验中学习来获取新的可复用技能。因此,我们引入了**层次化实验型智能体(HExA)**,这是一个上下文内、以实验为中心的自我改进框架,它能够(1)迭代地设计和优化与查询相关的实验;(2)从经验中递增式地学习一个可复用且可组合的技能库,以加速任务内和任务间的实验;(3)整合实验数据以有效采取行动或回答问题。HExA 完全在上下文内运行且无需训练,兼容任何黑盒模型,并且不依赖外部监督、先知或离线数据。为了评估智能体在主动实验任务上的表现,我们引入了**Interphyre**,它基于 PHYRE 2D 程序化物理模拟环境,并提供了工具调用和干预 API,智能体可用这些 API 提出并测试假设。我们的实验表明,当前的 LLM 智能体在这些场景中仍然表现挣扎。在 Interphyre 最难级别上,Claude Sonnet 4.6 的成功率仅为 2%,而 HExA 将同一模型的成功率提升至最高 77%。我们还展示了使用开放权重模型以及其他智能体基线(如 ReAct 和 Reflexion)在所有实验中的类似改进。HExA 智能体在不进行任何主动实验、仅使用从较简单级别学习和迁移的技能时,也能达到 44% 的成功率,这证明了 HExA 所学技能的可复用性和泛化能力。HExA 表明,通过实验学习能使智能体在解决新任务时更有效、更高效地取得进展,帮助它们发现新知识并获取可复用的技能。
![[无标题图片]](https://arxiv.org/html/2606.29315v1/umass_cics.png)
联系:{abhranilchan,sniekum}@cs.umass.edu
![[无标题图片]](https://arxiv.org/html/2606.29315v1/scalar.png)
大规模语言模型(LLMs)和 LLM 智能体在广泛的知识工作和智能体任务中展现了卓越的能力,包括代码生成、数学推理和多步骤规划(Gao et al., 2025 (https://arxiv.org/html/2606.29315#bib.bib18); Jimenez et al., 2024 (https://arxiv.org/html/2606.29315#bib.bib25); Yao et al., 2023b (https://arxiv.org/html/2606.29315#bib.bib68); Schick et al., 2023 (https://arxiv.org/html/2606.29315#bib.bib45))。训练和部署这些模型的主流范式假设:参数化知识——在模仿预训练阶段从海量人类生成数据中编码的信息,并通过后训练进行增强,再进一步利用额外的测试时计算和检索增强生成——足以在推理时应对任何查询(Anthropic, 2026 (https://arxiv.org/html/2606.29315#bib.bib6); OpenAI, 2025 (https://arxiv.org/html/2606.29315#bib.bib40); Team et al., 2024 (https://arxiv.org/html/2606.29315#bib.bib54); Team, 2026 (https://arxiv.org/html/2606.29315#bib.bib56); Gao et al., 2024 (https://arxiv.org/html/2606.29315#bib.bib19))。这一假设在训练语料中密集存在的领域,以及通过零样本或少样本用户提示的上下文学习即可利用先验知识进行推理的领域,是相当合理的(Dong et al., 2024 (https://arxiv.org/html/2606.29315#bib.bib15); Mei et al., 2025 (https://arxiv.org/html/2606.29315#bib.bib38); Dou et al., 2026 (https://arxiv.org/html/2606.29315#bib.bib16))。然而,这种方法在两个方面会失效。首先,智能体可能面对一个从未在训练中出现过的新环境,其动态特性、约束条件或解决策略在训练语料中不存在,甚至对人类而言也知之甚少,因此无法从任何训练语料中回忆出来。其次,即使模型中编码了相关的通用知识,将其应用于具体实例可能需要的远不止回忆和推理:例如,了解物理定律本身并不能解决一个实验物理问题(Silver & Sutton, 2025 (https://arxiv.org/html/2606.29315#bib.bib50); Ying et al., 2025 (https://arxiv.org/html/2606.29315#bib.bib69))。在现实世界中,面对广阔的新任务和新查询空间,智能体的成功很可能不能仅仅依赖预训练的参数化知识。相反,我们认为智能体原则上应该像科学家一样通过主动实验来学习:这包括探索、收集信息、提出可证伪的假设、通过交互和实验测试假设,并基于环境确认或反驳的结果进行推理(Spelke & Kinzler, 2007 (https://arxiv.org/html/2606.29315#bib.bib51); Team et al., 2023 (https://arxiv.org/html/2606.29315#bib.bib53), 2021 (https://arxiv.org/html/2606.29315#bib.bib55))。这正是参数回忆、思维链和静态检索难以提供的信息。然而,实验代价高昂:每个实例可能需要多次这样的循环才能解决,而智能体通常面对的是整个相关实例系列,而非孤立的单个实例。每次都从头重新探索的智能体无法充分利用这种结构。这促使我们不仅要进行实验,还要从中学习——从过去的实验中提炼出可复用的技能,并将其迁移到相关任务中,以分摊实验成本。这些观察构成了我们工作的核心问题:*LLM 智能体如何通过上下文内的实验、技能学习和迁移,在复杂新颖领域中高效地进行推理和行动?*
![参见说明文字]
图 1:HExA 框架在 Interphyre 物理谜题上的概览。
(a) 基线 ReAct:每个种子独立解决,无跨种子学习。每个种子包含交替的 Get-State-Info 调用(场景布局、间隔分析)和 Simulate-Action 调用(在 (x,y,r) 放置红球),以成功(✓)或失败(×)结束。
(b) HExA:种子被分组到一个*元回合*中。每个种子结束后,一个进化器智能体将轨迹提炼到*技能库*(物理原理 + 常见错误);进化后的技能库被注入后续种子的系统提示中。HExA 在每个源级别上运行 25 次迭代,覆盖 50 个种子,以产生完全进化的级别特定技能库。
(c) 跨级别迁移到未见过的级别:每个源级别(down_to_earth, two_body_problem, pass_the_parcel)独立运行 HExA 循环(箭头表示这种复用)以构建其技能库。然后,进化器将生成的多个技能库综合成一个单一的跨级别技能库,用于更难的靶标级别(catapult),且*不需要任何靶标级别的轨迹*。
因此,我们提出了**层次化实验型智能体(HExA)**(图 1 (https://arxiv.org/html/2606.29315#S1.F1)),这是一个新颖的上下文内强化学习框架,它将上下文学习沿着三个方向进行了扩展:(1)智能体主动与模拟器交互(作为一种工具),提出并测试假设,通过审慎的实验而非被动观察来收集与查询相关的信息;(2)智能体反思批量的成功和失败实验观察,将可复用的技能(带有奖励标签的策略,包括何时使用、有何帮助、何时避免)提炼到一个持久的外部技能库中;(3)在每个新回合开始时,从技能库中检索技能并注入到智能体的上下文中,以提高实验效率、测试新假设并指导进一步的探索。这个循环将探索成本分摊到多个问题实例上。我们的方法可以看作层次化的,因为 HExA 使用高层技能,这些技能抽象了许多低层技能和模拟器动作(具体放置和参数设置)。由于每个技能都是在智能体已经拥有先前学到的技能的情况下提炼的,因此后来的技能隐式地建立在早期技能之上。除了针对单个实例的技能之外,HExA 还构建了更高阶的技能,这些技能捕捉如何从交互本身进行学习,从而支持在新的种子和配置中持续取得进展,并在无需任何目标级别实验的情况下泛化到结构新颖、更困难的级别。最近的基准测试如 CL-Bench(Dou et al., 2026 (https://arxiv.org/html/2606.29315#bib.bib16))在一定程度上侧重于评估前沿 LLMs 的上下文学习能力,但仅依赖于对预训练期间未见数据的静态事实分析。相比之下,我们将 HExA 实例化并形式化用于更广泛的场景:任何需要主动实验来收集针对性、实例特定证据(而不仅仅是回忆和推理)才能解决实例的任务。这涵盖两种情况:模型已经拥有相关通用知识但必须通过实验才能精确应用的任务,以及完全陌生的领域,模型必须通过与未见过的开放环境交互从零开始学习(Team et al., 2021 (https://arxiv.org/html/2606.29315#bib.bib55); Hughes et al., 2024 (https://arxiv.org/html/2606.29315#bib.bib23))。物理推理是一个自然的测试平台,因为模型通常拥有相关原理,但如果没有实验和交互,就无法以所需的精度应用它们。为了具体研究这种设置,我们引入了 Interphyre(第 4.1 节 (https://arxiv.org/html/2606.29315#S4.SS1) 和 G (https://arxiv.org/html/2606.29315#A7)),这是一个可扩展的 2D 物理推理基准测试,建立在 PHYRE(Bakhtin et al., 2019 (https://arxiv.org/html/2606.29315#bib.bib8))之上,增加了对程序化工具调用和干预 API 的支持——场景检查、部分仿真、接触记录、反事实快照/恢复。这使我们既能评估智能体的能力,也能教会它们提出与查询相关的问题、在未知领域进行假设和实验,以及整合可复用的技能以高效地解决新任务,所有这些都在上下文内完成。总之,我们的主要贡献如下:
1. 我们形式化了一个**以实验为中心的上下文学习问题设置**,以评估和改进通用 LLM 智能体。在该设置中,解决一个任务需要与环境进行主动实验,以收集针对查询的证据,这要么是为了补充参数化知识,要么是为了应对完全新颖、未见过的领域。我们还引入了 **Interphyre**,这是一个基准测试,用于更好地评估和训练该问题设置下的智能体。
2. 我们提出了**层次化实验型智能体(HExA)**,这是一个无需训练、上下文内的 RL 框架。在该框架中,LLM 联合设计实验、从交互体验中提炼层次化且可组合的技能,并整合实验证据来解决问题,所有这些都不需要参数更新或外部监督。
3. 我们证明,HExA 既改进了前沿黑盒模型,也改进了较小的 LLMs。在 Interphyre 最难的级别上,使用 Claude Sonnet 4.6 作为基础模型(原本只有 2% 的成功率)时,准确率提升了高达+75%。此外,在较简单级别上学习的技能库可以在无需任何目标级别实验的情况下迁移到未见过的级别,仅通过迁移的层次化技能就获得了高达+36% 的提升。
## 2 相关工作
**从交互中学习。** LLM 智能体通过**参数化微调**(如强化学习,Ouyang et al., 2022 (https://arxiv.org/html/2606.29315#bib.bib41);Rafailov et al., 2023 (https://arxiv.org/html/2606.29315#bib.bib44);Guo et al., 2025 (https://arxiv.org/html/2606.29315#bib.bib21))或**非参数化适应**来改进决策。虽然参数化更新能带来强劲的性能,但通常计算成本高,且有灾难性遗忘或过度专门化的风险(Ziegler et al., 2020 (https://arxiv.org/html/2606.29315#bib.bib72);Shi et al., 2025 (https://arxiv.org/html/2606.29315#bib.bib47);Luo et al., 2025 (https://arxiv.org/html/2606.29315#bib.bib34)),这推动了向上下文内智能体的转变,作为一种更高效的替代方案。我们的无需训练框架 HExA 直接针对这一挑战,通过上下文内的实验以及可复用层次化技能的自我进化,实现 LLM 智能体的自我改进。
**语言模型的技能。** 技能是以自然语言描述的模块,用于捕获可复用的程序化知识,以在推理时增强语言模型(Anthropic, 2025a (https://arxiv.org/html/2606.29315#bib.bib4), b (https://arxiv.org/html/2606.29315#bib.bib5))。技能增强已在智能体任务中得到验证(Si et al., 2023 (https://arxiv.org/html/2606.29315#bib.bib49)),包括编码(Ma et al., 2026a (https://arxiv.org/html/2606.29315#bib.bib35))和网页导航(Wang et al., 2026c (https://arxiv.org/html/2606.29315#bib.bib62))。早期的技能库主要依靠人工标注构建(Li et al., 2026a (https://arxiv.org/html/2606.29315#bib.bib28), b (https://arxiv.org/html/2606.29315#bib.bib31); Liang et al., 2026 (https://arxiv.org/html/2606.29315#bib.bib32); Wang et al., 2026b (https://arxiv.org/html/2606.29315#bib.bib60)),这种方法有效但难以在上下文学习场景中扩展,因为这些场景中的上下文长、技术性强且领域特定。因此,近期工作已转向自动化技能构建。AutoSkill(Yang et al., 2026 (https://arxiv.org/html/2606.29315#bib.bib65))从交互轨迹中提取可复用行为作为永久版本化产物,而 AutoRefine(Qiu et al., 2026 (https://arxiv.org/html/2606.29315#bib.bib43))将智能体轨迹转化为可复用的专业知识。CoEvoSkills(Zhang et al., 2026 (https://arxiv.org/html/2606.29315#bib.bib70))通过生成器-验证器协同进化构建多文件技能包;EvoSkill(Alzubi et al., 2026 (https://arxiv.org/html/2606.29315#bib.bib3))执行失败驱动的精炼,形成结构化技能文件夹;而 SkillX(Wang et al., 2026a (https://arxiv.org/html/2606.29315#bib.bib59))将智能体轨迹提炼为一个通过执行反馈不断精炼的层次化技能知识库。然而,这些方法通常依赖外部反馈信号,如执行反馈、真值比较或任务完成奖励,来评估和改进技能质量(Ma et al., 2026b (https://arxiv.org/html/2606.29315#bib.bib36)),而这些在没有自动反馈的上下文学习场景中是无法获得的。另一条独立的工作线通过权重更新将技能内化:SKILL0(Lu et al., 2026 (https://arxiv.org/html/2606.29315#bib.bib33))使用上下文内强化学习。相似文章
分层实验者智能体
介绍了HExA,一个无需训练的框架,使LLM能够通过主动实验和技能复用来学习,在新的Interphyre物理基准测试中实现了高达77%的成功率,比现有智能体有大幅提升。
SkillHEX:通过假设驱动的自主探索与利用提升智能体技能
SkillHEX提出了一种用于大语言模型智能体自主技能演化的闭环框架,利用假设驱动的自我验证和证据引导的树搜索来克服稀疏奖励挑战。在有限交互预算下,它在SkillsBench上优于现有自演化方法。
迈向可审计的AI科学家:面向LLM代理的假设演化协议
本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。
EvoMaster:构建可进化大规模自主科学智能体的基础框架
# 论文页面 - EvoMaster:构建可进化大规模自主科学智能体的基础框架 来源:[https://huggingface.co/papers/2604.17406](https://huggingface.co/papers/2604.17406) 作者:,,,,,,,,,,,,,,,,,,,,, ## 摘要 EvoMaster 是一个可扩展、自我进化的智能体框架,专为大规模科学发现设计,支持在实验周期中迭代优化假设并持续积累知识。大语言模型与智能体的融合正在催生“智能体科学”新时代。
HarnessX:可组合、自适应且可演进的智能体夹具工坊
HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。