多智能体自动化研究系统的词汇表

Hugging Face Daily Papers 论文

摘要

本文介绍了一种用于描述和比较多智能体自动化研究系统的正式词汇表,涵盖了智能体身份、操作、通信和评估等设计选择。它区分了生成性品味和评估性品味,并在最近的系统上实例化了该词汇表。

我们引入了一个用于由一个或多个智能体构建的自动化研究系统的词汇表,以便更容易描述和比较其设计选择。该词汇表规定了:1) 智能体是谁,2) 系统中可用的操作,3) 谁可以调用它们,4) 智能体如何通信,5) 在运行内部和跨运行时哪些信息可见,6) 如何选择下一个动作,7) 如何开始一次运行,以及8) 如何评估输出。一条轨迹记录从输入任务到返回产物的单次运行。由于智能体、操作和初始化可能是随机的,在同一任务上重复运行会产生轨迹上的分布,而非单一行为。 我们的词汇表将结构性问题(例如智能体何时应通信、获得或失去能力、或在运行间传递信息)转化为可测试的选择。它还将评估器作为系统的一个组件,因为报告的收益取决于代理分数与真实质量的接近程度。这种区分也将“这些系统缺乏品味”这一模糊的抱怨分解为两个具有不同解决方案的失败。生成性品味是系统在观察到任何分数之前提出新颖轨迹的速率,而评估性品味是代理分数与其应匹配的质量之间的差距。我们在最近的自动研究系统上实例化了该词汇表,以说明它涵盖了结构上差异很大的设计。
查看原文
查看缓存全文

缓存时间: 2026/07/28 14:25

论文页面 - 多智能体自动化研究系统词汇表

来源:https://huggingface.co/papers/2607.22682

摘要

我们提出了一套用于由单个或多个智能体构建的自动化研究系统的词汇表,旨在使其设计选择更易于描述和比较。该词汇表规定了:1)智能体是谁;2)系统中有哪些可操作项;3)谁可以调用它们;4)智能体如何通信;5)单次运行内部及跨运行可见的信息范围;6)如何选择下一步行动;7)运行如何开始;以及8)输出如何评估。轨迹记录了从输入任务到返回结果的一次完整运行。由于智能体、操作和初始化可能具有随机性,同一任务上的重复运行会产生轨迹分布而非单一行为。我们的词汇表将结构设计问题(例如智能体何时应通信、获得或失去某种能力、或跨运行传递信息)转化为可测试的选择。同时,它使评估器成为系统的一个组成部分,因为报告的性能提升取决于代理分数与真实质量的匹配程度。这种分离还将“这些系统缺乏品味”这一模糊的抱怨分解为两种具有不同解决方案的失败:生成品味是指系统在观察到任何分数之前提出新颖轨迹的速率,而评估品味则是代理分数与应匹配质量之间的差距。我们将该词汇表应用于近期多个自主研究系统,以说明它能够涵盖结构差异极大的设计。

查看 arXiv 页面(https://arxiv.org/abs/2607.22682)查看 PDF(https://arxiv.org/pdf/2607.22682)项目页面(https://bardiyaak.github.io/multi-agent-research-vocabulary/)GitHub0(https://github.com/BardiyaAk/multi-agent-research-vocabulary)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.22682)

在你的智能体中获取这篇论文:

hf papers read 2607.22682

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.22682 以在此页面建立链接。

引用此论文的数据集0

无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.22682 以在此页面建立链接。

引用此论文的 Spaces0

无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.22682 以在此页面建立链接。

包含此论文的收藏集0

无收藏集包含此论文

将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中,以在此页面建立链接。

相似文章

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。

迈向虚拟细胞中的自主机制推理

Hugging Face Daily Papers

本文介绍了VCR-Agent,一个多智能体框架,通过结构化形式化和VC-TRACES数据集生成并验证机制性解释,从而增强大型语言模型在生物学研究中的应用。该方法通过虚拟细胞中的验证性机制推理,提高了基因表达预测的事实准确性。

DuMate-DeepResearch:一个可审计的多智能体系统,具备递归搜索与基于评分标准的推理

arXiv cs.AI

本技术报告介绍了DuMate-DeepResearch,一个用于深度研究任务的多智能体框架。该框架将智能体核心与工具生态系统解耦,并集成了基于图的动态规划、递归双层执行以及基于评分标准的测试时优化。该系统在两个深度研究基准测试中取得了最先进的结果,展示了可审计智能体基础设施的价值。