分层实验者智能体
摘要
介绍了HExA,一个无需训练的框架,使LLM能够通过主动实验和技能复用来学习,在新的Interphyre物理基准测试中实现了高达77%的成功率,比现有智能体有大幅提升。
查看缓存全文
缓存时间: 2026/07/01 19:44
论文页面 - 分层实验主义智能体
来源:https://huggingface.co/papers/2606.29315
摘要
HExA 使得大语言模型能够通过主动实验和技能学习在陌生领域提升自身能力,而无需训练或外部监督。
大语言模型(LLMs)正越来越多地被用于在现实世界中采取行动并支持人类决策,然而大多数智能体依赖于参数化知识、固定的训练后数据、检索或搜索。这种范式在陌生领域以及无法仅从先验知识回答的复杂查询中失效。例如,知道物理定律本身并不能使 LLMs 回答有关复杂物理系统的查询或完成长期任务。为了解决这个问题,我们提出了分层实验主义智能体(Hierarchical Experimentalist Agents,HExA)(https://huggingface.co/papers?q=Hierarchical%20Experimentalist%20Agents),这是一个通过主动实验进行学习的上下文内自我改进框架(https://huggingface.co/papers?q=self-improvement%20framework)。HExA 迭代地设计和优化与查询相关的实验(https://huggingface.co/papers?q=query-relevant%20experiments),从经验中学习可复用的可组合技能库(https://huggingface.co/papers?q=reusable%20library%20of%20composable%20skills),并整合实验证据(https://huggingface.co/papers?q=experimental%20evidence)来回答问题或采取行动。HExA 无需训练,兼容任何黑盒模型,且不需要外部监督、预言机或离线数据。为了评估主动实验(https://huggingface.co/papers?q=active%20experimentation),我们引入了 Interphyre(https://huggingface.co/papers?q=Interphyre),这是一个基于 PHYRE 2D 程序化物理环境(https://huggingface.co/papers?q=PHYRE%202D%20procedural%20physics%20environment)的工具调用基准(https://huggingface.co/papers?q=tool-calling%20benchmark),智能体通过模拟 API(https://huggingface.co/papers?q=simulation%20APIs)提出干预并测试假设。实验表明,当前的 LLM 智能体在这些设置中表现不佳,尤其是在 Interphyre(https://huggingface.co/papers?q=Interphyre)的最难关卡上。Claude Sonnet 4.6 仅达到 2% 的成功率,而 HExA 将同一模型提升至高达 77% 的成功率。HExA 还改进了开放权重模型,并优于诸如 ReAct(https://huggingface.co/papers?q=ReAct)和 Reflexion(https://huggingface.co/papers?q=Reflexion)等智能体基线。此外,仅使用从较容易关卡学到的技能并在没有主动实验(https://huggingface.co/papers?q=active%20experimentation)的情况下迁移,HExA 实现了 44% 的成功率,展示了其习得技能的可复用性和泛化能力。总体而言,HExA 表明通过主动实验(https://huggingface.co/papers?q=active%20experimentation)进行学习可以帮助智能体发现有用知识、获取可复用技能,并在新颖的长期任务上取得高效进展。
查看 arXiv 页面(https://arxiv.org/abs/2606.29315)查看 PDF(https://arxiv.org/pdf/2606.29315)项目页面(https://general-exp-3-continual-learning-agent.github.io/HeXA/)GitHub0(https://github.com/General-Exp-3-Continual-Learning-Agent/HeXA-Hierarchical-Experimentalist-Agents)加入收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2606.29315)
在你的智能体中获取这篇论文:
hf papers read 2606.29315
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有关联此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2606.29315 以在此页面链接它。
引用此论文的数据集0
没有关联此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2606.29315 以在此页面链接它。
引用此论文的 Spaces0
没有关联此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2606.29315 以在此页面链接它。
包含此论文的收藏集0
没有包含此论文的收藏集
添加此论文到收藏集(https://huggingface.co/new-collection)以在此页面链接它。
相似文章
层次化实验者智能体
介绍了层次化实验者智能体(HExA),这是一个基于上下文、以实验为中心的自我改进框架,使LLM智能体能够设计实验、学习可复用技能,并在新领域回答查询,在Interphyre物理模拟基准上取得了显著优于基线的改进。
SkillHEX:通过假设驱动的自主探索与利用提升智能体技能
SkillHEX提出了一种用于大语言模型智能体自主技能演化的闭环框架,利用假设驱动的自我验证和证据引导的树搜索来克服稀疏奖励挑战。在有限交互预算下,它在SkillsBench上优于现有自演化方法。
迈向可审计的AI科学家:面向LLM代理的假设演化协议
本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。
HIPIF: 面向长期LLM智能体学习的分层规划与信息折叠
介绍了HIPIF,一种通过分层规划与信息折叠来训练LLM智能体处理长期任务的方法,旨在减少长上下文干扰,在三个基准测试上取得了优异结果。
从受训者到训练者:LLM为多智能体推理强化学习设计的训练环境
本文介绍了LLM-as-Environment-Engineer框架,该框架使LLM能够为多智能体推理任务中的强化学习设计自己的训练环境,实现自我改进训练,其性能超越更大的专有模型。