分层实验者智能体

Hugging Face Daily Papers 论文

摘要

介绍了HExA,一个无需训练的框架,使LLM能够通过主动实验和技能复用来学习,在新的Interphyre物理基准测试中实现了高达77%的成功率,比现有智能体有大幅提升。

大型语言模型(LLMs)越来越多地被用于在现实世界中采取行动并支持人类决策,但大多数智能体依赖于参数化知识、固定的训练后数据、检索或搜索。这种范式在新颖领域以及无法仅凭先验知识回答的复杂查询中会失效。例如,知道物理定律本身并不能使LLM回答复杂物理系统中的查询或完成长期任务。为了解决这一问题,我们引入了分层实验者智能体(HExA),这是一个上下文内自我改进框架,通过主动实验进行学习。HExA迭代地设计和优化与查询相关的实验,从经验中学习可复用的可组合技能库,并整合实验证据来回答查询或采取行动。HExA无需训练,兼容任何黑盒模型,且不需要外部监督、预言机或离线数据。为了评估主动实验,我们引入了Interphyre,这是一个基于PHYRE 2D程序化物理环境构建的工具调用基准,智能体通过模拟API提出干预措施并测试假设。实验表明,当前的LLM智能体在这些设置中表现不佳,尤其是在Interphyre最难级别上。Claude Sonnet 4.6仅达到2%的成功率,而HExA将同一模型提升至高达77%的成功率。HExA还改进了开放权重模型,并优于ReAct和Reflexion等智能体基线。此外,仅使用从较容易级别中学到并转移的技能(无需主动实验),HExA达到了44%的成功率,展示了其学习技能的可复用性和泛化能力。总体而言,HExA表明通过主动实验进行学习可以帮助智能体发现有用知识、获取可复用技能,并在新颖的长期任务上取得高效进展。
查看原文
查看缓存全文

缓存时间: 2026/07/01 19:44

论文页面 - 分层实验主义智能体

来源:https://huggingface.co/papers/2606.29315

摘要

HExA 使得大语言模型能够通过主动实验和技能学习在陌生领域提升自身能力,而无需训练或外部监督。

大语言模型(LLMs)正越来越多地被用于在现实世界中采取行动并支持人类决策,然而大多数智能体依赖于参数化知识、固定的训练后数据、检索或搜索。这种范式在陌生领域以及无法仅从先验知识回答的复杂查询中失效。例如,知道物理定律本身并不能使 LLMs 回答有关复杂物理系统的查询或完成长期任务。为了解决这个问题,我们提出了分层实验主义智能体(Hierarchical Experimentalist Agents,HExA)(https://huggingface.co/papers?q=Hierarchical%20Experimentalist%20Agents),这是一个通过主动实验进行学习的上下文内自我改进框架(https://huggingface.co/papers?q=self-improvement%20framework)。HExA 迭代地设计和优化与查询相关的实验(https://huggingface.co/papers?q=query-relevant%20experiments),从经验中学习可复用的可组合技能库(https://huggingface.co/papers?q=reusable%20library%20of%20composable%20skills),并整合实验证据(https://huggingface.co/papers?q=experimental%20evidence)来回答问题或采取行动。HExA 无需训练,兼容任何黑盒模型,且不需要外部监督、预言机或离线数据。为了评估主动实验(https://huggingface.co/papers?q=active%20experimentation),我们引入了 Interphyre(https://huggingface.co/papers?q=Interphyre),这是一个基于 PHYRE 2D 程序化物理环境(https://huggingface.co/papers?q=PHYRE%202D%20procedural%20physics%20environment)的工具调用基准(https://huggingface.co/papers?q=tool-calling%20benchmark),智能体通过模拟 API(https://huggingface.co/papers?q=simulation%20APIs)提出干预并测试假设。实验表明,当前的 LLM 智能体在这些设置中表现不佳,尤其是在 Interphyre(https://huggingface.co/papers?q=Interphyre)的最难关卡上。Claude Sonnet 4.6 仅达到 2% 的成功率,而 HExA 将同一模型提升至高达 77% 的成功率。HExA 还改进了开放权重模型,并优于诸如 ReAct(https://huggingface.co/papers?q=ReAct)和 Reflexion(https://huggingface.co/papers?q=Reflexion)等智能体基线。此外,仅使用从较容易关卡学到的技能并在没有主动实验(https://huggingface.co/papers?q=active%20experimentation)的情况下迁移,HExA 实现了 44% 的成功率,展示了其习得技能的可复用性和泛化能力。总体而言,HExA 表明通过主动实验(https://huggingface.co/papers?q=active%20experimentation)进行学习可以帮助智能体发现有用知识、获取可复用技能,并在新颖的长期任务上取得高效进展。

查看 arXiv 页面(https://arxiv.org/abs/2606.29315)查看 PDF(https://arxiv.org/pdf/2606.29315)项目页面(https://general-exp-3-continual-learning-agent.github.io/HeXA/)GitHub0(https://github.com/General-Exp-3-Continual-Learning-Agent/HeXA-Hierarchical-Experimentalist-Agents)加入收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2606.29315)

在你的智能体中获取这篇论文:

hf papers read 2606.29315

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有关联此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2606.29315 以在此页面链接它。

引用此论文的数据集0

没有关联此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2606.29315 以在此页面链接它。

引用此论文的 Spaces0

没有关联此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2606.29315 以在此页面链接它。

包含此论文的收藏集0

没有包含此论文的收藏集

添加此论文到收藏集(https://huggingface.co/new-collection)以在此页面链接它。

相似文章

层次化实验者智能体

arXiv cs.AI

介绍了层次化实验者智能体(HExA),这是一个基于上下文、以实验为中心的自我改进框架,使LLM智能体能够设计实验、学习可复用技能,并在新领域回答查询,在Interphyre物理模拟基准上取得了显著优于基线的改进。

迈向可审计的AI科学家:面向LLM代理的假设演化协议

arXiv cs.AI

本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。