智能体自驱动显微镜基准测试支持资格认证,但未必能泛化到未见任务

arXiv cs.AI 论文

摘要

本文介绍了一个基准测试与轨迹记录框架,用于评估控制显微镜的基于LLM的智能体,比较了105种智能体配置,发现基准测试有助于资格验证,但无法可靠预测智能体在未见任务上的表现。

arXiv:2608.05266v1 公告类型:新 摘要:大语言模型智能体正越来越多地被开发用于控制各种科学表征工具,包括显微镜和同步加速器光束线。对物理基础设施的智能体化控制研究尚处于起步阶段,关于如何设计智能体系统,目前几乎没有成熟范式。在设计显微镜智能体时,需要做出许多选择,包括LLM的选择、智能体的数量、智能体的职责和委派规则、检索增强生成参数等等。在设计和优化智能体化显微镜控制器时,研究人员不仅希望确保智能体能够正确执行已知任务,还希望智能体能泛化到它之前未遇到过的新任务。在本研究中,我们开发了一个基准测试和轨迹记录框架,揭示了:a) 智能体架构的不同选择如何影响显微镜任务的性能;b) 基准测试在预测特定智能体是否能在未见显微镜任务上表现良好方面的局限性。该框架用于评估单智能体、双智能体和三智能体图拓扑、五种LLM、RAG和上下文参数,以及跨53项显微镜基准测试的操作约束。总共记录了105种智能体配置、1,949次单独测试运行和49,109次RAG检索。直接比较显示不同配置在延迟、Token使用、成本和失败模式上存在明显差异。然而,基于智能体架构和测试结果训练的代理模型并不能可靠地预测智能体在新颖、未见任务上的表现。这些结果表明,这些基准测试对资格验证、回归测试、诊断和直接比较是有用的,但当前异构的测试套件并不支持一种与任务无关的全局配置模型。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:46

# 自主智能体驱动显微镜基准测试支持资格认证,但不一定能泛化到未见任务
来源:https://arxiv.org/html/2608.05266
Nathan S\. JohnsonIan AbshireCarl Zeiss Research Microscopy Solutions, 5300 Central Boulevard, Dublin, CA 94568

###### 摘要

大型语言模型(LLM)智能体正越来越多地被开发用于控制广泛的科学表征工具,包括显微镜和同步辐射光束线。对物理基础设施的智能体化控制研究尚处于起步阶段,目前很少有成熟的工程范式可供参考。在设计显微镜智能体时有许多选择需要做出,包括LLM的选择、智能体的数量、智能体的职责和委派路径、检索增强生成(RAG)参数等。在设计并优化智能体显微镜控制器时,研究人员不仅希望确保智能体能够正确执行已知任务,还希望智能体能够泛化到其此前未遇到过的新任务。在本研究中,我们开发了一个基准测试和轨迹日志框架,用于揭示:a)不同的智能体架构选择如何影响显微镜任务的性能,以及b)基准测试在预测特定智能体在未见显微镜任务上是否表现良好方面的局限性。该框架被用于评估单智能体、双智能体和三智能体图拓扑结构、五种LLM、RAG和上下文参数以及操作约束,共涉及53项显微镜基准测试。总计记录了105种智能体配置、1,949次独立测试运行和49,109次RAG检索。直接比较显示各配置在延迟、令牌使用量、成本和失败模式方面存在显著差异。RAG检索审计识别了与成功或失败相关的知识片段,但基于这些回顾性关联进行剪枝并未持续改善性能。然而,基于智能体架构和测试结果训练的代理模型无法可靠预测智能体在新的未见任务上的表现。在前瞻性比较中,使用大幅剪枝的RAG数据库的单智能体配置产生了最高的总体性能,并且是帕累托最优的,尽管没有RAG数据库的基线配置在标准化基准测试中表现大致相当。这些结果表明,这些基准测试对于资格认证、回归测试、诊断和直接比较是有用的,但当前的异构测试套件并不支持与任务无关的全局配置模型。

## 1 引言

自动化正被引入科学过程的各个阶段,包括假设生成\[13 (https://arxiv.org/html/2608.05266#bib.bib3),12 (https://arxiv.org/html/2608.05266#bib.bib4)\]、样品合成\[6 (https://arxiv.org/html/2608.05266#bib.bib2)\]和数据分析\[16 (https://arxiv.org/html/2608.05266#bib.bib1)\]。这些工作遍及材料科学\[19 (https://arxiv.org/html/2608.05266#bib.bib5),1 (https://arxiv.org/html/2608.05266#bib.bib6)\]、化学\[29 (https://arxiv.org/html/2608.05266#bib.bib7),32 (https://arxiv.org/html/2608.05266#bib.bib9)\]以及生物和药学科学\[13 (https://arxiv.org/html/2608.05266#bib.bib3),23 (https://arxiv.org/html/2608.05266#bib.bib8)\]。当自动化决策与机器人样品处理和表征相结合时,就构成了自主驱动或自治实验室的基础\[1 (https://arxiv.org/html/2608.05266#bib.bib6),29 (https://arxiv.org/html/2608.05266#bib.bib7),23 (https://arxiv.org/html/2608.05266#bib.bib8),32 (https://arxiv.org/html/2608.05266#bib.bib9)\]。

显微镜仍然是该自动化问题中的一个难点。先进的X射线\[17 (https://arxiv.org/html/2608.05266#bib.bib31)\]、电子\[7 (https://arxiv.org/html/2608.05266#bib.bib13)\]、同步辐射\[24 (https://arxiv.org/html/2608.05266#bib.bib24),11 (https://arxiv.org/html/2608.05266#bib.bib25),33 (https://arxiv.org/html/2608.05266#bib.bib23),34 (https://arxiv.org/html/2608.05266#bib.bib12)\]和扫描探针仪器\[35 (https://arxiv.org/html/2608.05266#bib.bib20),18 (https://arxiv.org/html/2608.05266#bib.bib21),20 (https://arxiv.org/html/2608.05266#bib.bib22),22 (https://arxiv.org/html/2608.05266#bib.bib10)\]需要一系列涉及对准、参数选择、图像采集和分析的自适应决策。典型的工作流程可能需要光源校准、样品对中、放大倍率选择、曝光时间确定以及对图像质量的反复评估。正确的决策通常取决于样品、仪器状态以及工作流程早期测量结果。

参见图注图1:智能体图拓扑结构和MCP工具面的组织。(a)–(c) 单智能体、双智能体和三智能体图以及分配给每个智能体的总体职责。(d) 通过六个MCP服务器暴露的工具组,用于仪器控制、配方处理、几何和光学计算、图像分析、文件处理和Python执行。许多单独的步骤已经被自动化。强化学习方法已被用于调优显微镜参数和指导数据采集\[18 (https://arxiv.org/html/2608.05266#bib.bib21),20 (https://arxiv.org/html/2608.05266#bib.bib22)\]。主动学习方法已被用于在时间和实验资源有限时确定测量优先级\[21 (https://arxiv.org/html/2608.05266#bib.bib28),10 (https://arxiv.org/html/2608.05266#bib.bib29),31 (https://arxiv.org/html/2608.05266#bib.bib30)\]。显微镜数据也可以通过从传统计算机视觉到深度学习的方法进行分割和分析\[15 (https://arxiv.org/html/2608.05266#bib.bib34),3 (https://arxiv.org/html/2608.05266#bib.bib36),26 (https://arxiv.org/html/2608.05266#bib.bib35)\]。最近,LLM智能体已被用于协调原子力显微镜\[22 (https://arxiv.org/html/2608.05266#bib.bib10)\]、扫描电子显微镜\[7 (https://arxiv.org/html/2608.05266#bib.bib13)\]、X射线显微镜\[17 (https://arxiv.org/html/2608.05266#bib.bib31)\]、透射电子显微镜\[34 (https://arxiv.org/html/2608.05266#bib.bib12)\]和同步辐射光束线\[9 (https://arxiv.org/html/2608.05266#bib.bib11)\]上的更长工作流程。

智能体显微镜控制器的设计引入了第二个优化问题。系统设计者必须选择LLM、智能体的数量和职责、工具接口、保留的对话历史量、检索增强生成(RAG)的使用,以及控制检索和模型采样的参数。这些选择会影响成功率、延迟、成本、令牌使用量以及系统失败的方式。然而,目前尚不清楚在一个显微镜任务集合上测得的性能是否可以用于识别一个也将在先前未见任务上表现良好的配置。

基准测试本身也必须为特定目的而设计。某些测试旨在验证仪器操作能否安全完成。另一些测试检测软件回归、强制延迟或工具调用限制、将轨迹与预期工作流程进行比较,或评估最终定量测量结果。定量正确性是最终的科学终点,但冒烟测试、回归测试和操作限制对于鉴定驱动仪器的智能体仍然是必要的。因此,一个有用的基准测试应当明确每个测试测量的内容,以及可以从由此产生的通过率中得出什么结论。

参见图注图2:在共同的15项测试筛选集上对单智能体、双智能体和三智能体拓扑的直接比较。(a) 所评估的LLM和图拓扑在综合通过率与每项测试总令牌数之间的权衡。误差条显示95%置信区间。(b) 每种拓扑所记录的失败类型分布。在本研究中,我们开发了单智能体、双智能体和三智能体显微镜控制器,连接到六个模型上下文协议(MCP)服务器,用于仪器控制、配方处理、几何计算、图像分析、文件处理和Python执行。图拓扑结构和工具组织总结在图1 (https://arxiv.org/html/2608.05266#S1.F1) 中。我们评估了53项基准测试中的105种配置,并将每次运行与其配置、工具轨迹、操作指标和RAG检索标识符相关联。然后我们使用这些数据来提出三个问题:是否可以从历史基准数据优化智能体配置,这种优化器是否可以迁移到未见任务,以及检索级关联是否可用于改进RAG数据库。最后,我们前瞻性地测试了选定的配置,并在物理显微镜工作流程和定量测量上评估了智能体。

## 2 结果

### 2.1 基准测试产生了异构的性能格局

单智能体、双智能体和三智能体图拓扑连接到六个MCP服务器,这些服务器暴露了用于显微镜控制、配方处理、几何计算、图像分析、文件操作和Python执行的工具。描述仪器程序、样品特定信息、先前工作流程和操作指南的文档被嵌入到可供智能体使用的RAG数据库中。系统架构如图1 (https://arxiv.org/html/2608.05266#S1.F1) 所示,主要配置变量列于表3 (https://arxiv.org/html/2608.05266#S5.T3)。

基准测试包含53项测试,分为七个套件:一个包含六项测试的端到端工作流程、12个集成工作流程、19项原子仪器控制测试、六项几何和配方测试、八项回归和性能测试、一项图像分析测试和一项调试测试。测试范围从单个仪器操作到需要设置、图像采集、分割、几何计算、配方生成和安全关机的工作流程。综合通过标准包括科学或数值正确性以及为每项测试定义的轨迹、文件和操作检查。

在整个研究过程中,105种智能体配置由1,949次测试运行表示,记录了49,109次RAG检索。测试难度差异显著。许多原子仪器测试对几乎所有正常运行的配置都能通过,而几个较长的集成工作流程对大多数配置都失败。测试级别的通过率见补充图1。近乎普遍通过的测试作为资格认证、冒烟、安全和回归测试是有用的,但它们对于区分不同智能体配置提供的信息很少。

### 2.2 直接架构比较显示额外智能体会带来效率损失

第一阶段使用研究中包含的五种LLM,在15项测试的公共子集上比较了单智能体、双智能体和三智能体拓扑。结果总结在图2 (https://arxiv.org/html/2608.05266#S1.F2) 中。单智能体和双智能体系统覆盖了相似的通过率范围,但单智能体系统每项测试使用的令牌数比相应的双智能体系统最多少10,000个。三智能体拓扑在通过率方面没有提供一致的改进,因此未纳入后续的广泛配置扫描中。

拓扑结构还改变了主要的失败模式。双智能体系统更频繁地超过持续时间、LLM调用或工具调用的限制。这种行为与先前关于智能体在请求任务实际完成后仍继续采取行动的观察一致\[22 (https://arxiv.org/html/2608.05266#bib.bib10)\]。单智能体系统更经常在基于轨迹的检查中失败,因为它们完成了任务但没有调用确切的工具或遵循基准测试预期的分解方式。这一差异说明了为什么即使标题通过率综合了所有标准,组件级检查仍然有用。

### 2.3 代理模型能够插值已知测试,但无法泛化到未见任务

初始随机森林代理模型通过留出完整智能体配置来评估,同时允许相同的测试标识出现在训练集和验证集中。在这种配置留出评估下,模型实现了约0.78的ROC-AUC。这一结果表明,该模型可以在既有基准测试内进行插值,并估计新配置在训练数据中已表示的任务上的性能。

特征重要性分析说明了为什么这一结果并不意味着对新任务的泛化。测试标识是通过结果的最强预测因子,其次是LLM选择和智能体数量。简单的仪器控制测试在大多数配置下都能通过,而较长的集成工作流程仍然困难。因此,代理模型学习了大量关于任务固有难度的信息,而不是与任务无关的配置响应。

更严格的分析留出了完整的测试标识,并从设计矩阵中移除了测试标识。在这种评估下,L2正则化逻辑回归和随机森林模型各自实现了0.55的ROC-AUC。移除近乎普遍通过的测试并未显著改善任务留出结果。因此,本研究中记录的配置变量没有提供能够在异构基准测试中迁移的稳定全局排序。表1 (https://arxiv.org/html/2608.05266#S2.T1) 总结了两种验证方案。

验证目标|模型|分组变量|ROC-AUC
已表示测试的留出配置|L2逻辑回归|配置哈希|0.54
已表示测试的留出配置|随机森林|配置哈希|0.78
留出测试标识|L2逻辑回归|测试ID|0.53
留出测试标识|随机森林|测试ID|0.55
表1:在配置留出和任务留出验证下代理模型的性能。仅在配置留出分析中将测试标识作为特征包括在内。图3 (https://arxiv.org/html/2608.05266#S2.F3) 总结了配置留出代理模型分析。相关性和参数扫描表明,大多数单个配置变量与通过率的关系弱于测试标识。配置变量更一致地影响持续时间、令牌使用量、成本以及工作流程期间采取的操作数量。

### 2.4 RAG检索审计识别了有问题的上下文,但未定义通用的剪枝规则

每个检索到的知识片段都被标记了稳定标识符,并与其出现的运行相关联。这使得可以比较检索到某个条目的运行与未检索到该条目的运行之间的结果差异。费希尔精确检验随后进行Benjamini–Hochberg校正,识别出与更高或更低通过率相关的条目,并给出校正后的qq值。所得的火山图显示在图4 (https://arxiv.org/html/2608.05266#S2.F4) 中。

几个负相关的条目在人工检查时也明显不受欢迎。例如,routingdecisionanderrorhandling描述了监督者委派行为,这对单智能体图是无关的,在双智能体图中也是不必要的。这些条目由于已过时或与当前软件不兼容而被移除。

更令人惊讶的结果是,绝大多数嵌入文档与基准测试任务成功没有强相关性。大多数嵌入文档低于q=0.10q=0.10线,且不具有大的绝对ΔPass\\Delta\\text\{Pass\}率。其中一些条目包括直接与工作流程相关的文档,这些文档……

相似文章

AgenticDataBench:面向数据代理的综合性基准测试

Hugging Face Daily Papers

介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。

BenchTrace:用于测试LLM智能体反思能力与受控演进的基准

arXiv cs.AI

BenchTrace是一个用于评估LLM智能体自我进化能力的基准,重点通过包含1,821个标注回合的数据集以及两个评估任务——反思评估与进化评估——来测试反思与受控演进。使用Qwen3-32B和GPT-4.1进行的实验表明,两个模型均表现不佳,主要瓶颈在于诊断,并存在泛化与遗忘问题。